{"as_of":"2026-08-09T09:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7a43adff6e69d60a3c9b8dcf7ab8b791177b89e9857db2e2c640baecb6af4840","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":30,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:36:05.895482Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:59:42.133975Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:a1ab84d85685f0115630234a650684ac774511881287a0c120c1ee042ae2d42a","observation_id":"43ecb43a-4735-4712-b75f-d7a2087f9dc3","resolution":{"observed_at":"2026-05-17T15:07:39.816112Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-07T14:03:20.688743Z","title":"Loong: Generating minute-level long videos with autoregressive lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-07T13:55:36.207486Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:20.688743Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:79a6e73787d51ccf6d872ad846d033fb452546210b22ff6afaaf00d3d93be7bd","observation_id":"234ef67b-9fed-4f69-b73b-0b10d0e4e238","resolution":{"observed_at":"2026-08-07T14:03:20.688743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-07T14:00:17.046537Z","title":"Loong: Generating minute-level long videos with autoregressive language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20288","last_updated":"2025-05-26T17:59:07Z","snapshot_observed_at":"2026-08-09T05:26:23.979889Z","submitted_at":"2025-05-26T17:59:07Z","title":"Hierarchical Masked Autoregressive Models with Low-Resolution Token Pivots","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T14:00:17.046537Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2505.20288"},"observation_digest":"sha256:208dc4bcf4f32868e35ea3d5722b02898ecb6bcd2a45b902e635db26fa4e5a09","observation_id":"65cb59c6-2c2e-4798-9077-12b5e9ee947f","resolution":{"observed_at":"2026-08-07T14:00:17.046537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-07T10:28:41.605178Z","title":"Loong: Generating minute-level long videos with autoregressive language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-07T11:02:24.060549Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.605178Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:f0360b35bd2d118984f4b3a00c63b111114c827bfc386bdd998a0677518ffb8b","observation_id":"ecf31cbd-af7b-4861-b57c-eee64139f826","resolution":{"observed_at":"2026-08-07T10:28:41.605178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-11T01:36:53.029590Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2506.08009"},"observation_digest":"sha256:d29aac3efe5aa5e23e5d497fb176af43386b5322229743c9325cdf581a42b46a","observation_id":"4dad1b58-0de1-4a3d-a9d1-2327fcd5b564","resolution":{"observed_at":"2026-05-11T01:36:53.131734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-07T04:17:51.201816Z","title":"Loong: Generating minute-level long videos with autoregressive lan- guage models.arXiv preprint arXiv:2410.02757, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10962","last_updated":"2025-06-12T17:57:44Z","snapshot_observed_at":"2026-08-08T11:44:13.586975Z","submitted_at":"2025-06-12T17:57:44Z","title":"SpectralAR: Spectral Autoregressive Visual Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T04:17:51.201816Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2506.10962"},"observation_digest":"sha256:1a3e64c70e0c0913b80c8dd36b5c91e3d489fe61f93d98cc01ceb5489e84984a","observation_id":"7e651edd-6035-493a-89c6-4aad685075c8","resolution":{"observed_at":"2026-08-07T04:17:51.201816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-07T00:30:58.539477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13691","last_updated":"2025-06-16T16:52:52Z","snapshot_observed_at":"2026-08-08T15:16:17.202058Z","submitted_at":"2025-06-16T16:52:52Z","title":"UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:58.539477Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2506.13691"},"observation_digest":"sha256:53c136a11f305e3a0eba161c195d6d08d5a81462eb94c661c1deb61639ecdb67","observation_id":"f9215a7e-f11a-4acd-a52a-ec5a86ff0863","resolution":{"observed_at":"2026-08-07T00:30:58.539477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-07T00:30:28.919613Z","title":"Loong: Generating minute-level long videos with autoregressive language models.arXiv preprint arXiv:2410.02757, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14168","last_updated":"2025-06-18T09:44:09Z","snapshot_observed_at":"2026-08-07T22:16:51.604935Z","submitted_at":"2025-06-17T04:08:18Z","title":"VideoMAR: Autoregressive Video Generatio with Continuous Tokens","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:28.919613Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2506.14168"},"observation_digest":"sha256:fa37e35b26d3e6fb10152eb7e02d1a0640273bc57781ca2a2eadd05ac20b617a","observation_id":"7f265ae3-e3f9-4289-ab4c-441826bbe344","resolution":{"observed_at":"2026-08-07T00:30:28.919613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-06T18:51:29.715057Z","title":"Loong: Generating minute-level long videos with autoregressive language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-07T10:10:34.633901Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.715057Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:e2189400d0222cac9ef27decf3ebfbb44835a0da31b78b2890612864bd111fd4","observation_id":"08562ac5-5180-4707-9435-0fbf8578180c","resolution":{"observed_at":"2026-08-06T18:51:29.715057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-06T15:28:30.643014Z","title":"Loong: Generating minute-level long videos with autoregressive lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-08T15:16:48.431942Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:30.643014Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:2daca7c348a0bc15eb4f454e33ad94e98aa53e5f359d1df59f24eb338aa768d3","observation_id":"7f4c72cf-7aea-430b-bf5e-81a1e9075b20","resolution":{"observed_at":"2026-08-06T15:28:30.643014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-06T14:43:03.279456Z","title":"arXiv preprint arXiv:2410.02757","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2507.18046","last_updated":"2026-07-29T22:41:51Z","snapshot_observed_at":"2026-08-09T07:50:21.974187Z","submitted_at":"2025-07-24T02:50:26Z","title":"Enhancing Scene Transition Awareness in Video Generation via Post-Training","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:03.279456Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2507.18046"},"observation_digest":"sha256:835335f8e862546439dc3c974ad826d8814efe77a8143078a55418201c005c29","observation_id":"18149d3f-4904-48fb-97af-b879614ffba6","resolution":{"observed_at":"2026-08-06T14:43:03.279456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-05T20:49:52.758882Z","title":"Loong: Generating minute-level long videos with autoregressive language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09858","last_updated":"2025-08-13T14:50:19Z","snapshot_observed_at":"2026-08-08T15:16:52.668335Z","submitted_at":"2025-08-13T14:50:19Z","title":"HumanGenesis: Agent-Based Geometric and Generative Modeling for Synthetic Human Dynamics","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T20:49:52.758882Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2508.09858"},"observation_digest":"sha256:8822815b8d9e74bb39a1e9beeeb59a366e4bb8c7ce67b5cf6646b50820348f57","observation_id":"e17afe89-c307-4c59-a8a1-eae9de4956e7","resolution":{"observed_at":"2026-08-05T20:49:52.758882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2509.25161","last_updated":"2025-09-29T17:57:14Z","snapshot_observed_at":"2026-08-09T09:15:39.740119Z","submitted_at":"2025-09-29T17:57:14Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-16T11:15:29.102090Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2509.25161"},"observation_digest":"sha256:1414438a4b4d420dde553604ad24b69053af96e4fbe18360b4f1db6256c3894c","observation_id":"05edc1df-c0f8-4a7c-bebf-b1e5fa8eb76a","resolution":{"observed_at":"2026-05-16T11:15:29.226122Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2510.20206","last_updated":"2026-05-14T08:53:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-23T04:45:09Z","title":"RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-18T05:13:42.934115Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2510.20206"},"observation_digest":"sha256:64b6d16d25ea22f0cfa6b66a9393f7b4518001cc65797610d6c0cfa7e2063a7d","observation_id":"4965dc40-66e5-46c6-a47e-84b38ec35294","resolution":{"observed_at":"2026-05-18T05:15:54.297371Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2511.20714","last_updated":"2026-04-28T23:05:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T01:45:04Z","title":"Inferix: A Block-Diffusion based Next-Generation Inference Engine for World Simulation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T05:14:36.280155Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2511.20714"},"observation_digest":"sha256:7bd56baad90fe0bd1854e1216d444fe1d8fdbeb1aecd46f9ad4e680cb21ed185","observation_id":"6b987e18-a487-43ca-a8c6-39df490ec4bb","resolution":{"observed_at":"2026-05-17T05:19:05.018987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-03T19:41:58.807489Z","title":"Loong: Generating minute-level long videos with autoregressive language models.arXiv preprint arXiv:2410.02757, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22973","last_updated":"2026-06-22T15:51:03Z","snapshot_observed_at":"2026-08-03T19:41:54.757475Z","submitted_at":"2025-11-28T08:25:59Z","title":"BIFE: Better Interaction, Fewer Errors for Minute-Long Video Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T19:41:58.807489Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2511.22973"},"observation_digest":"sha256:e31a636c2e9d7cc70601a1bf6341b4fc2b5a0bdea498f44f7f704eacc32df29f","observation_id":"ff0dd921-4190-4d2d-bbac-46e2f790ad5c","resolution":{"observed_at":"2026-08-03T19:41:58.807489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2602.07775","last_updated":"2026-05-03T01:49:14Z","snapshot_observed_at":"2026-07-30T09:22:37.641917Z","submitted_at":"2026-02-08T02:16:02Z","title":"Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion","version":6},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-16T07:02:38.876518Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2602.07775"},"observation_digest":"sha256:e32e84825d92a57314924ead9bb0b2b603b1fca6d189fea917b3c173921aac98","observation_id":"ad757ea3-19b1-4a42-b533-57ba00fbb443","resolution":{"observed_at":"2026-05-16T07:07:29.831479Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2602.23058","last_updated":"2026-05-17T06:55:06Z","snapshot_observed_at":"2026-07-06T22:47:11.228912Z","submitted_at":"2026-02-26T14:42:53Z","title":"GeoWorld: Geometric World Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-21T11:39:15.308355Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2602.23058"},"observation_digest":"sha256:dafa00efabd5e7bb326698d08c0084ddbdd1b3eac47b680e0edd1330af25461f","observation_id":"4d353ac6-2594-423e-b748-f3962774c70e","resolution":{"observed_at":"2026-05-21T11:40:03.337727Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2603.03066","last_updated":"2026-05-19T02:39:43Z","snapshot_observed_at":"2026-07-31T20:59:59.870316Z","submitted_at":"2026-03-03T15:05:27Z","title":"EduVQA: Towards Concept-Aware Assessment of Educational AI-Generated Videos","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T11:52:09.262497Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2603.03066"},"observation_digest":"sha256:61550ef3406f665be4ddb49fc20aee6ea8325c963aecbdad30df4b7d9c12240a","observation_id":"db661cb8-0b07-4279-8e00-1d6053650965","resolution":{"observed_at":"2026-05-21T11:54:09.103453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2603.28489","last_updated":"2026-07-04T13:25:12Z","snapshot_observed_at":"2026-08-05T11:17:52.410204Z","submitted_at":"2026-03-30T14:23:45Z","title":"Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-14T01:35:14.878069Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2603.28489"},"observation_digest":"sha256:06f61b365d477631ded9a010293cc47e38fd86b47f304898fbbbbf5addc0d389","observation_id":"a5275a79-fece-4cb6-871f-5115c91336d4","resolution":{"observed_at":"2026-05-14T01:38:36.372424Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2604.07209","last_updated":"2026-04-13T13:03:18Z","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T15:31:22Z","title":"INSPATIO-WORLD: A Real-Time 4D World Simulator via Spatiotemporal Autoregressive Modeling","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-10T19:08:56.588282Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2604.07209"},"observation_digest":"sha256:a666513280ffb533c9573ef70c47424bdb42904f177690a15333f9bc06e0a6f3","observation_id":"60e5bb63-2705-4696-9a2a-b466ed02e487","resolution":{"observed_at":"2026-05-10T23:25:53.605274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-08-07T09:57:43.422059Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:13c56c12eebc1bd77e2e8efbc7b698d9891df67d08e89434bc1a9a3a79b2d898","observation_id":"abc3491d-9480-4f38-b430-594dc4f6170b","resolution":{"observed_at":"2026-05-11T23:31:14.905365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2605.14487","last_updated":"2026-05-14T07:27:39Z","snapshot_observed_at":"2026-08-06T04:41:33.559035Z","submitted_at":"2026-05-14T07:27:39Z","title":"Head Forcing: Long Autoregressive Video Generation via Head Heterogeneity","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:48.593354Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2605.14487"},"observation_digest":"sha256:3c1aad1df1e295633cb1af4b93d124b6323bb9c122004653cc43a6353c2a276c","observation_id":"d4980422-aaba-423f-8a2a-c00d56f982f0","resolution":{"observed_at":"2026-05-15T02:33:32.264156Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2605.30519","last_updated":"2026-05-28T19:56:00Z","snapshot_observed_at":"2026-08-07T21:20:03.682399Z","submitted_at":"2026-05-28T19:56:00Z","title":"OmniMem: Scalable and Adaptive Memory Retrieval for Long Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T07:56:40.001739Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2605.30519"},"observation_digest":"sha256:7921a0944e9cc1ffdc2d040664ea7b3549b3b6b2ea38cfa2ab131601a7ab7984","observation_id":"007b082c-3c63-4872-99d7-ab14f035742e","resolution":{"observed_at":"2026-06-29T08:03:14.485825Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2605.31603","last_updated":"2026-05-29T17:59:50Z","snapshot_observed_at":"2026-08-01T15:38:52.805916Z","submitted_at":"2026-05-29T17:59:50Z","title":"Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T22:56:21.783415Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2605.31603"},"observation_digest":"sha256:51154f3afdd82007bc30c48d82017e8c59d095baa5ef15a566455c98203c0a5b","observation_id":"a6dc219e-b016-4691-93c1-1586790ca6a8","resolution":{"observed_at":"2026-07-01T19:16:00.543053Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2606.07508","last_updated":"2026-06-05T17:57:32Z","snapshot_observed_at":"2026-08-03T10:42:24.485829Z","submitted_at":"2026-06-05T17:57:32Z","title":"Streaming Video Generation with Streaming Force Control","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T22:14:32.465663Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2606.07508"},"observation_digest":"sha256:89f14a247c7da3f3b06cfe23bbf8b198f1524ace56ab62c9346092eee6ad2490","observation_id":"e517b4e0-dba0-4f18-a000-163c857f7277","resolution":{"observed_at":"2026-07-02T17:07:12.425890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2606.22370","last_updated":"2026-06-21T07:39:37Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T07:39:37Z","title":"Towards Error-Free Long Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T10:49:36.838492Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2606.22370"},"observation_digest":"sha256:7162355fb5cd066cbeb4f34d29be25120003b11ddd06b1fe90b2631f1ab42156","observation_id":"4339dd7b-7c9d-463d-b2de-e6ea4fb0fd9c","resolution":{"observed_at":"2026-07-04T08:59:42.135414Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":"2410.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-04T08:59:42.133975Z","title":"LA VIE: High- quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 2024a","venue":null,"work_id":"457cd406-74c8-475f-8866-399412f2913b","year":2024},"citing_paper":{"arxiv_id":"2606.31326","last_updated":"2026-06-30T08:29:29Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:29:29Z","title":"Bridging Video Understanding and Generation in a Unified Framework","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-01T05:57:54.653504Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2606.31326"},"observation_digest":"sha256:011590fd6fedd93510a60ca3a9a34eaa8105771ed74c4850120decee0480e172","observation_id":"7624b5da-d2a8-474a-b6c4-83e8f3175c03","resolution":{"observed_at":"2026-07-01T10:05:40.345090Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-07-12T01:59:48.820112Z","title":"Loong: Generating minute-level long videos with autoregressive language models.arXiv preprint arXiv:2410.02757,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03509","last_updated":"2026-07-03T17:34:14Z","snapshot_observed_at":"2026-08-02T07:31:16.311305Z","submitted_at":"2026-07-03T17:34:14Z","title":"Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T01:59:48.820112Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2607.03509"},"observation_digest":"sha256:34c41fbd9c972e824f339fb287798340ad66dd4d973fbd84dce1f3e485e96afe","observation_id":"d0ac97ba-c813-4b6a-9385-ec4ecb60ab98","resolution":{"observed_at":"2026-07-12T01:59:48.820112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-08T17:36:05.895482Z","title":"Loong: Generating minute-level long videos with autoregressive language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05237","last_updated":"2026-08-05T13:54:31Z","snapshot_observed_at":"2026-08-09T09:09:59.315526Z","submitted_at":"2026-08-05T13:54:31Z","title":"In-Context Forcing: Uncovering Context Effects in Autoregressive Video Diffusion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T17:36:05.895482Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2608.05237"},"observation_digest":"sha256:fa5428625c5813113492d3f43d0c19345b7523a2ebbe78911f8706f47d79c8a7","observation_id":"43049303-1777-48e5-a9e9-f660684b8476","resolution":{"observed_at":"2026-08-08T17:36:05.895482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.02757/citation-record","integrity":"/paper/2410.02757/integrity","json":"/paper/2410.02757/citation-record.json","paper":"/paper/2410.02757"},"outbound":[],"paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 30 inbound Pith citation observations for arXiv:2410.02757."}