{"as_of":"2026-08-11T20:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:306cb0c6949cd8c1d00ccf3195b5e9f053b6c02d9534d267b06896b28fc5118a","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T16:43:08.574966Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:03:20.460990Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T07:27:08.875128Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09856","snapshot_observed_at":"2026-08-07T14:03:20.460990Z","title":"Lingen: Towards high-resolution minute-length text-to-video generation with linear computa- tional complexity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:20.460990Z"},"links":{"cited_paper":"/paper/2412.09856","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:225d6c6afc9b5330ee1287e08cdcfe211e8033bc501ef7e3e1b676e42deb63f9","observation_id":"0b237622-2fa2-45f5-8386-99bd91f8cf11","resolution":{"observed_at":"2026-08-07T14:03:20.460990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09856","snapshot_observed_at":"2026-08-07T10:28:41.279115Z","title":"Lingen: Towards high-resolution minute-length text-to-video generation with linear compu- tational complexity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.279115Z"},"links":{"cited_paper":"/paper/2412.09856","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:5e3c16d364cfab73356f4defead1a54fca0eaf8e59763710ad3615e7d6d9f3d6","observation_id":"0c076b86-9971-4220-859b-86de36be2480","resolution":{"observed_at":"2026-08-07T10:28:41.279115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09856","snapshot_observed_at":"2026-08-07T10:29:04.156409Z","title":"Lingen: Towards high-resolution minute-length text-to-video generation with linear computational complexity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05340","last_updated":"2025-06-06T17:59:47Z","snapshot_observed_at":"2026-08-08T23:57:15.811108Z","submitted_at":"2025-06-05T17:59:40Z","title":"Exploring Diffusion Transformer Designs via Grafting","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:04.156409Z"},"links":{"cited_paper":"/paper/2412.09856","citing_paper":"/paper/2506.05340"},"observation_digest":"sha256:71fe2331f3880b47bbf8c2d6f4126d61266730077408372254b57bcfb1f7a341","observation_id":"de71e09f-eb27-4bd3-bf72-0227ef3f457e","resolution":{"observed_at":"2026-08-07T10:29:04.156409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09856","snapshot_observed_at":"2026-08-07T04:21:19.044277Z","title":"Lingen: Towards high-resolution minute-length text-to-video generation with linear computational complexity.arXiv preprint arXiv:2412.09856, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-11T17:57:29.943777Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.044277Z"},"links":{"cited_paper":"/paper/2412.09856","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:44ae082eac736fd48e569824dff8b16ed04343189094bf069a0e6dfa8ec31861","observation_id":"a8fe1376-17c3-4580-a606-0c671997fc7a","resolution":{"observed_at":"2026-08-07T04:21:19.044277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"cited_work":{"arxiv_id":"2412.09856","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09856","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lingen: Towards high-resolution minute- length text-to-video generation with linear computational complexity","venue":null,"work_id":"05a946c3-128b-4972-b09e-65191eb37b5d","year":2024},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-08-08T19:39:46.308514Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2412.09856","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:8a151bc4b60d38b75c6197148930cb90e41af1c60555326cf7b84fa02bf90a4e","observation_id":"d2d1e529-6b84-4fb0-92c2-28dede2602f8","resolution":{"observed_at":"2026-05-19T07:27:08.877210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09856","snapshot_observed_at":"2026-08-06T21:34:04.914075Z","title":"Lingen: Towards high-resolution minute-length text-to-video generation with linear computational complexity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23858","last_updated":"2025-06-30T13:52:31Z","snapshot_observed_at":"2026-08-08T15:17:52.819952Z","submitted_at":"2025-06-30T13:52:31Z","title":"VMoBA: Mixture-of-Block Attention for Video Diffusion Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:04.914075Z"},"links":{"cited_paper":"/paper/2412.09856","citing_paper":"/paper/2506.23858"},"observation_digest":"sha256:ada91fdded799662e1b6482251b160cfa9a638cfd1cb8d83098e399c5a778063","observation_id":"17f7f2af-7ba3-415a-84f0-f6c164e11758","resolution":{"observed_at":"2026-08-06T21:34:04.914075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.09856/citation-record","integrity":"/paper/2412.09856/integrity","json":"/paper/2412.09856/citation-record.json","paper":"/paper/2412.09856"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.969998Z","title":"Video generation models as world simu- lators","venue":null,"work_id":"63dc1547-d391-4029-b922-5ac83443daf2","year":null},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.180513Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:2bc46c1d86efc3bd0a24892ba17224971d93ecdaee602878ae339b6119ef4ca4","observation_id":"67be81be-11f0-4b4e-b2e0-c5f26f9a2a65","resolution":{"observed_at":"2026-08-11T16:43:09.974969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-10T20:17:19.785772Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-11T16:43:08.187386Z","title":"VideoCrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.187386Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:fddef72a35769f46efb9b167b48b7c833c33049a4a2e3215ee980c32dc03cb35","observation_id":"4546eec7-2c32-4ebc-8dde-fd71c16bff2a","resolution":{"observed_at":"2026-08-11T16:43:08.187386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.953989Z","title":"VideoCrafter2: Overcoming data limitations for high-quality video diffu- sion models","venue":null,"work_id":"cb166c11-1b53-4ce6-8ee7-34d3f6040f66","year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.192920Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:109027748ea7dbca7cb563865677f1ed0fe8b5ad0e01b29bc148ddf436c092be","observation_id":"df97383c-259c-4653-9fba-4ce95c81c15d","resolution":{"observed_at":"2026-08-11T16:43:09.959193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11427","last_updated":"2022-10-20T17:16:37Z","snapshot_observed_at":"2026-08-01T15:07:11.635426Z","submitted_at":"2022-10-20T17:16:37Z","title":"DiffEdit: Diffusion-based semantic image editing with mask guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11427","snapshot_observed_at":"2026-08-11T16:43:08.198731Z","title":"DiffEdit: Diffusion-based seman- tic image editing with mask guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.198731Z"},"links":{"cited_paper":"/paper/2210.11427","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:fe235bbaaad596bb23da278b8092de763c11246208d549d91b59fdf6b8a7384c","observation_id":"8f8f8991-fcd0-4764-9516-13c1a0eae939","resolution":{"observed_at":"2026-08-11T16:43:08.198731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15807","last_updated":"2023-09-27T17:30:19Z","snapshot_observed_at":"2026-08-02T11:54:13.342379Z","submitted_at":"2023-09-27T17:30:19Z","title":"Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15807","snapshot_observed_at":"2026-08-11T16:43:08.204201Z","title":"EMU: Enhanc- ing image generation models using photogenic needles in a haystack","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.204201Z"},"links":{"cited_paper":"/paper/2309.15807","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:c6775f690249ec26efd42357bee51fd3ceccab224eb8fba0d00d35abe00da2fc","observation_id":"3fa3e2dc-c0a3-451d-ac0c-e511652471a0","resolution":{"observed_at":"2026-08-11T16:43:08.204201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-11T16:43:08.210442Z","title":"Transformers are SSMs: General- ized models and efficient algorithms through structured state space duality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.210442Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:2cc1613fc4a679bc38281afbe9547364e347c0f65c969656b54851c4648c253a","observation_id":"1a6c9d8d-052b-4f2b-82a6-6806e2bd1ac3","resolution":{"observed_at":"2026-08-11T16:43:08.210442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.936634Z","title":"FlashAttention: Fast and memory-efficient exact attention with IO-awareness","venue":null,"work_id":"1921d1d5-706a-4800-80a8-a5c51f0865d5","year":2022},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.216087Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:55033bf2bf52043b354164d95fd9610d1a200385b68da2c1cd348d087d12d742","observation_id":"434e6069-d101-43fc-a7de-3ca178f17454","resolution":{"observed_at":"2026-08-11T16:43:09.941900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.921255Z","title":"Alabdul- mohsin, et al","venue":null,"work_id":"f0dd3b6d-62df-4bca-b35f-f8f37f3510ff","year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.221900Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:dd3d4f125166c809e18bf424fa4096f6df4ed4b871bce8942778473b2e4677b5","observation_id":"f707be84-4ea5-4a18-8d5c-5e57d64d9060","resolution":{"observed_at":"2026-08-11T16:43:09.926042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T16:43:08.228074Z","title":"The LLaMa 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.228074Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:4dee6ebb0a97fa7d742c7ed8bd52593eeae77b83ec03cfd6f9472044468aad54","observation_id":"98cbeb64-83b5-48aa-82dc-8039ff9a7c47","resolution":{"observed_at":"2026-08-11T16:43:08.228074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03025","last_updated":"2024-05-10T08:30:07Z","snapshot_observed_at":"2026-08-06T17:14:58.934575Z","submitted_at":"2024-05-05T18:36:45Z","title":"Matten: Video Generation with Mamba-Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03025","snapshot_observed_at":"2026-08-11T16:43:08.233267Z","title":"Matten: Video generation with Mamba- attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.233267Z"},"links":{"cited_paper":"/paper/2405.03025","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:7019f399bb0b808503522dd0042cb4e220aa693b36448eef13da44e3c36ebfae","observation_id":"f72e4609-bef2-4b9f-a8f0-2769afa8be51","resolution":{"observed_at":"2026-08-11T16:43:08.233267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-02T11:56:15.393496Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-11T16:43:08.238185Z","title":"EMU Video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.238185Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:d46d110fbd2618dbd486a4e6654b0b64433fc0f4be01fca662551541a9a37ae2","observation_id":"e1c7108d-86e9-429d-a487-cdda0b005945","resolution":{"observed_at":"2026-08-11T16:43:08.238185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-11T16:43:08.245160Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.245160Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:e1ae35e9ae72f685919cbf0bb00bbc4fd6676025b6d310986b7ceb0a0cf6388d","observation_id":"a39fe9b4-09d7-466f-aa97-d98a4220b74b","resolution":{"observed_at":"2026-08-11T16:43:08.245160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.904848Z","title":"HiPPO: Recurrent memory with optimal polyno- mial projections","venue":null,"work_id":"0e2248b5-76ec-4f81-ad9a-47c88568bddf","year":2020},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.250778Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:c716b2b8e8443784d8165f8cb6df25e301d686e6f6abd48185168505b20312df","observation_id":"87fb6a4b-1dda-4eb5-b2e8-90a140483ca2","resolution":{"observed_at":"2026-08-11T16:43:09.910237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-11T16:43:08.255538Z","title":"Efficiently modeling long sequences with structured state spaces","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.255538Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:b7b6169943b1f4ca5b0943ac91ce704daa5f934877508bd59658333e161ddca9","observation_id":"1f31fdff-1860-4e54-b596-3d9f364712c7","resolution":{"observed_at":"2026-08-11T16:43:08.255538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06564","last_updated":"2025-03-09T15:56:38Z","snapshot_observed_at":"2026-07-06T17:57:56.632041Z","submitted_at":"2024-04-09T18:28:55Z","title":"MambaAD: Exploring State Space Models for Multi-class Unsupervised Anomaly Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06564","snapshot_observed_at":"2026-08-11T16:43:08.260634Z","title":"MambaAD: Exploring state space models for multi-class unsupervised anomaly detec- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.260634Z"},"links":{"cited_paper":"/paper/2404.06564","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:d89054220c41aafb2935c109f4dafbf714ac5765833d53c093b2437c9cc3e5cc","observation_id":"8016844c-8074-43e6-ac6c-97465382bbf7","resolution":{"observed_at":"2026-08-11T16:43:08.260634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:08.265594Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.265594Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:93d6fca3e792c84e937992b8e8a4290a7c08746edd9bfe0073e5248daa773c3d","observation_id":"69c39173-1b98-43c4-bfcd-3fc74f86e966","resolution":{"observed_at":"2026-08-11T16:43:08.265594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-11T16:43:08.270287Z","title":"Kingma, Ben Poole, Mohammad Norouzi, David J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.270287Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:92309594a489649e80fb080c04b33f34e4ccb1378bc6082da079cdd80dcb4d19","observation_id":"73af2afb-1f10-42fb-abe2-0fb5db852272","resolution":{"observed_at":"2026-08-11T16:43:08.270287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-11T16:43:08.276151Z","title":"CogVideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.276151Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:eb4a1f8799b404eb18583bf0ff619f27eaff6a66cb0da8f3c968d35c8ab238aa","observation_id":"5584c0cd-a842-4134-932b-2bfe21d80aea","resolution":{"observed_at":"2026-08-11T16:43:08.276151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13802","last_updated":"2024-11-24T14:25:05Z","snapshot_observed_at":"2026-07-06T17:47:51.284226Z","submitted_at":"2024-03-20T17:59:14Z","title":"ZigMa: A DiT-style Zigzag Mamba Diffusion Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13802","snapshot_observed_at":"2026-08-11T16:43:08.281382Z","title":"ZigMa: Zigzag Mamba diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.281382Z"},"links":{"cited_paper":"/paper/2403.13802","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:6ce96f48a6834d587a4d4aef668cf976d1e71319d9dd8557c97b9cb3f0f5a7e6","observation_id":"b87f8b7d-304b-4486-a080-f9a33cad1989","resolution":{"observed_at":"2026-08-11T16:43:08.281382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:08.286787Z","title":"VBench: Com- prehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.286787Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:f83b24c8b5b633a575b04e27a1f2d14622fa933b4f5cc3069d6380a222f91ef7","observation_id":"93a6088d-2350-4891-84b1-d660d273be6d","resolution":{"observed_at":"2026-08-11T16:43:08.286787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06358","last_updated":"2024-07-08T19:58:59Z","snapshot_observed_at":"2026-08-07T01:27:15.618968Z","submitted_at":"2024-07-08T19:58:59Z","title":"MiraData: A Large-Scale Video Dataset with Long Durations and Structured Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06358","snapshot_observed_at":"2026-08-11T16:43:08.291243Z","title":"MiraData: A large-scale video dataset with long durations and structured captions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.291243Z"},"links":{"cited_paper":"/paper/2407.06358","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:f109cd58749e9b763d0cf500b1e4720aa9c0495e57087d12f51d0a80c8bf3b21","observation_id":"ebc306c6-34c7-4484-8efc-8ab750767b79","resolution":{"observed_at":"2026-08-11T16:43:08.291243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:08.295497Z","title":"Imagic: Text-based real image editing with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.295497Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:841676fa03201d52bc499757ee02cfe45760d3bc7de7e7f29d832d55121221c1","observation_id":"304a5e6a-d94e-4091-ac81-b411f442c56b","resolution":{"observed_at":"2026-08-11T16:43:08.295497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15798","last_updated":"2024-12-02T12:58:23Z","snapshot_observed_at":"2026-07-06T15:33:06.904026Z","submitted_at":"2023-05-25T07:28:28Z","title":"BK-SDM: A Lightweight, Fast, and Cheap Version of Stable Diffusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15798","snapshot_observed_at":"2026-08-11T16:43:08.300020Z","title":"BK-SDM: A lightweight, fast, and cheap version of stable diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.300020Z"},"links":{"cited_paper":"/paper/2305.15798","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:82f19944e5562d65769e78253b3cf19d3babf1f627d6ae68c58839018ca2cc8f","observation_id":"c8adbf2d-ef64-428e-be91-d8aabb0f3530","resolution":{"observed_at":"2026-08-11T16:43:08.300020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.855601Z","title":"Kling AI: Next-generation AI creative studio","venue":null,"work_id":"4b0ab207-2ddf-41d7-9817-90c69a27ef0f","year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.305666Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:db074c6d879b94a2c3d09369c3221117e575b2095e8a851caa658a3076428109","observation_id":"4338dae4-dca8-43f4-9558-30ae7b5529c1","resolution":{"observed_at":"2026-08-11T16:43:09.861129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-11T16:43:08.311136Z","title":"VideoPoet: A large language model for zero-shot video gen- eration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.311136Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:8bb6baefbcd7950c6c4b45b75e425c687fedbc33857c45b3ae6751d462b596aa","observation_id":"096d883a-35b0-4f2e-ae7c-ebe3d2b8644d","resolution":{"observed_at":"2026-08-11T16:43:08.311136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.838102Z","title":"Pika labs","venue":null,"work_id":"f6f3cc57-5092-4fff-b228-e79522a90881","year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.317114Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:ea511c240c875920990aceddcbf1ec3b926437cb4c6350ddd90f2982b2473e53","observation_id":"2d3acca8-e53b-4e2b-8c1e-65fb9a39e256","resolution":{"observed_at":"2026-08-11T16:43:09.843977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.822167Z","title":"xFormers: A modular and hackable trans- former modelling library","venue":null,"work_id":"661c7d22-d00a-4447-b327-dec637f6e467","year":2022},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.322165Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:cee57595ec2880aa6ee369ca92849369acc812e1ff4c8ac50b7100b3fb27d0f5","observation_id":"dced3c44-002a-4e03-9d1e-b8d38aaf19b1","resolution":{"observed_at":"2026-08-11T16:43:09.826627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18750","last_updated":"2024-10-11T07:50:49Z","snapshot_observed_at":"2026-08-08T11:19:14.293609Z","submitted_at":"2024-05-29T04:26:17Z","title":"T2V-Turbo: Breaking the Quality Bottleneck of Video Consistency Model with Mixed Reward Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18750","snapshot_observed_at":"2026-08-11T16:43:08.327092Z","title":"T2V- Turbo: Breaking the quality bottleneck of video consis- tency model with mixed reward feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.327092Z"},"links":{"cited_paper":"/paper/2405.18750","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:5699748cc678e8be73c92bc340df55d042b5454eff432ddd66a455bf562508b5","observation_id":"49a8df5e-1cf7-4675-a3cd-d7887bad7f70","resolution":{"observed_at":"2026-08-11T16:43:08.327092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:08.332179Z","title":"T2V- Turbo-v2: Enhancing video generation model post-training through data, reward, and conditional guidance design.arXiv preprint arXiv:2410.05677, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.332179Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:91abbf66581527791b15d428efd025f9e89378957ec5f9732cbfcc8ba9d56705","observation_id":"e5c55d33-5deb-4072-9510-1050b5d2165c","resolution":{"observed_at":"2026-08-11T16:43:08.332179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-11T16:43:08.337755Z","title":"Chen, Heli Ben-Hamu, Maximil- ian Nickel, and Matt Le","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.337755Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:892ec6bf3c127cdb2af09281535b00e9051b55fc5b8155753179a2b4a020e78b","observation_id":"9d4794f3-5e65-4028-a7b2-3285f26d365e","resolution":{"observed_at":"2026-08-11T16:43:08.337755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.807013Z","title":"Swin Transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"39ba6adf-7c16-494b-a1a1-a619581cbca8","year":2021},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.342684Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:2376221db5250b9551d4f27674391141d221b7357e0a590c4c80cc53dbb4673c","observation_id":"6c9fc96a-32fe-40db-b94b-5173b6635299","resolution":{"observed_at":"2026-08-11T16:43:09.811957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-08-11T16:43:08.347341Z","title":"VDT: General-purpose video diffusion transformers via mask modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.347341Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:b67e4e3b590cf930a2960e29903eec2c5f3bf399d33e196b8ec3e619053511bc","observation_id":"aba8da3d-3592-41ea-862f-9e30436b6564","resolution":{"observed_at":"2026-08-11T16:43:08.347341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.790961Z","title":"Dream machine","venue":null,"work_id":"a027f521-4898-4f7f-9c5f-b21191143b25","year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.351882Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:bcc8c794624ea049ecda95132f334776559c6f69980e1a9f1ae9767c4f68e402","observation_id":"52824075-8794-4904-a44b-b57723da92ab","resolution":{"observed_at":"2026-08-11T16:43:09.796124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.774601Z","title":"Diffusion probabilistic models for 3D point cloud generation","venue":null,"work_id":"ab485cdd-bc7d-4268-8b3b-134b8c355cc4","year":2021},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.356402Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:78bf8a9a2a9e35f7a56e95f97b52b76cd23267cc7ad0c1ad77a5b69f06b2a89d","observation_id":"93f206e9-c541-4573-9808-e797e531f9dc","resolution":{"observed_at":"2026-08-11T16:43:09.780129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04378","last_updated":"2023-10-06T17:11:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-06T17:11:58Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04378","snapshot_observed_at":"2026-08-11T16:43:08.362974Z","title":"Latent Consistency Models: Synthesizing high- resolution images with few-step inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.362974Z"},"links":{"cited_paper":"/paper/2310.04378","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:8b7fe4ecc2c97c169f6b730f3f499ee4d8f2dc01a3fe4cb8354c7b2fc851c650","observation_id":"45ec4db2-4e09-4354-9913-ae343f0d2ee1","resolution":{"observed_at":"2026-08-11T16:43:08.362974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:08.368317Z","title":"On distillation of guided diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.368317Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:7a7aaabd007789d31050fefd1f8ca4ce7b4e5ef7f484658f72566b41ec380a3d","observation_id":"9f108b34-3684-43b0-9e5b-1acf437d6dd6","resolution":{"observed_at":"2026-08-11T16:43:08.368317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15881","last_updated":"2024-05-24T18:50:27Z","snapshot_observed_at":"2026-08-05T12:38:35.366695Z","submitted_at":"2024-05-24T18:50:27Z","title":"Scaling Diffusion Mamba with Bidirectional SSMs for Efficient Image and Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15881","snapshot_observed_at":"2026-08-11T16:43:08.374170Z","title":"Scaling diffusion Mamba with bidirectional SSMs for efficient image and video gener- ation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.374170Z"},"links":{"cited_paper":"/paper/2405.15881","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:10820354ab6443a5b3ee5a521287e5d496e219abffc844c40523bf45b05df96e","observation_id":"3271f270-fff0-492f-893e-ee838cc80e68","resolution":{"observed_at":"2026-08-11T16:43:08.374170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09494","last_updated":"2022-05-09T17:02:49Z","snapshot_observed_at":"2026-07-06T12:49:14.981089Z","submitted_at":"2022-03-17T17:48:32Z","title":"Transframer: Arbitrary Frame Prediction with Generative Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09494","snapshot_observed_at":"2026-08-11T16:43:08.379341Z","title":"Transframer: Arbitrary frame prediction with generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.379341Z"},"links":{"cited_paper":"/paper/2203.09494","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:3490baba856f6ba46d92edc6b3d93979217490120222a842416998e96ac76266","observation_id":"1d66c585-fee5-45db-bbc1-d996606ef9bb","resolution":{"observed_at":"2026-08-11T16:43:08.379341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:08.384349Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.384349Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:7bceb93ff6265c6ffa4d2a4999da16f569abfb6683ed39cf0e55c4636242106c","observation_id":"1fd1fe16-4527-444e-9c70-efd6d6929ca6","resolution":{"observed_at":"2026-08-11T16:43:08.384349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-11T16:43:08.389315Z","title":"SDXL: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.389315Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:854b2e0c19343fb2f3a1372dfaeebcf690bb07f09200d8c37098da4ddbbc8223","observation_id":"93b99cae-553e-4607-b021-cf266fc24959","resolution":{"observed_at":"2026-08-11T16:43:08.389315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-10T21:41:31.247717Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-11T16:43:08.395562Z","title":"Movie Gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.395562Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:4c50e36f1cfb34173b5a3fa56af695d67e2df01557ed1fd963e0278083548726","observation_id":"9a67080f-8ff0-4101-b294-704c6b458a16","resolution":{"observed_at":"2026-08-11T16:43:08.395562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.734471Z","title":"RawFilm: 8k cinematic royalty-free stock footage","venue":null,"work_id":"0fa0333d-716f-4993-93ca-68378f294494","year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.401196Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:1bc313424a8909b4ad3e2887d0f5e50a83b0128291488935390964f24e3da1e7","observation_id":"94240f2a-ecc1-4110-b093-b3a8473e482f","resolution":{"observed_at":"2026-08-11T16:43:09.739126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07522","last_updated":"2025-02-28T02:20:49Z","snapshot_observed_at":"2026-08-06T19:04:16.718797Z","submitted_at":"2024-06-11T17:50:51Z","title":"Samba: Simple Hybrid State Space Models for Efficient Unlimited Context Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07522","snapshot_observed_at":"2026-08-11T16:43:08.406817Z","title":"SAMBA: Simple hybrid state space models for efficient unlimited context language mod- eling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.406817Z"},"links":{"cited_paper":"/paper/2406.07522","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:b953ba4e9f6f5cbcd975248b142b68282a132b1bbeebe067fe1b4169f1f37cb5","observation_id":"394572c4-2cf3-4c0e-b9c2-57989059a4f5","resolution":{"observed_at":"2026-08-11T16:43:08.406817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11758","last_updated":"2024-11-26T07:32:19Z","snapshot_observed_at":"2026-08-04T10:27:03.705122Z","submitted_at":"2024-08-21T16:30:45Z","title":"MambaCSR: Dual-Interleaved Scanning for Compressed Image Super-Resolution With SSMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11758","snapshot_observed_at":"2026-08-11T16:43:08.411772Z","title":"MambaCSR: Dual-interleaved scanning for compressed image super-resolution with SSMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.411772Z"},"links":{"cited_paper":"/paper/2408.11758","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:208f1140b30ff5ffbd6a346357517dfeffb1c30d229148974ae49e86ee7c4bc0","observation_id":"a9140747-2199-4b26-803c-511bd120043f","resolution":{"observed_at":"2026-08-11T16:43:08.411772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:08.417340Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.417340Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:1a8c62604afbe17cf75454fe040d9873413198cea60ccae0e6bc65c372bea4f6","observation_id":"2761b435-eb27-4d91-a71d-b347209851f5","resolution":{"observed_at":"2026-08-11T16:43:08.417340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.708271Z","title":"Introducing Gen-3 alpha","venue":null,"work_id":"766883e3-cf0a-4c8e-a854-c748123b72ff","year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.421498Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:948e5df820c1b4f14ac90a07d7ebaa7e61d0d1e1108006f9debb9923d809b9de","observation_id":"6c18eb9f-9ee1-45aa-bc60-eea27b3554e3","resolution":{"observed_at":"2026-08-11T16:43:09.713492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.692181Z","title":"Denton, Kamyar Ghasemipour, Raphael Gontijo Lopes, Burcu Karagol Ayan, Tim Salimans, et al","venue":null,"work_id":"b8e1b785-9199-456c-ad03-1146f4074971","year":2022},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.426432Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:a69deb9ca1100f08079fb1a1c8e9aa14579023010f791d4bdbeef996a5e49959","observation_id":"79c12c70-83fa-4901-885e-a794f0a3b58a","resolution":{"observed_at":"2026-08-11T16:43:09.697332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-11T16:43:08.430805Z","title":"GLU variants improve transformer","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.430805Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:89dc068a6587b0ff3873818374ade35c5883fa1dce9ade38c4e30df59b33187b","observation_id":"3a31a639-25df-401b-bf69-137bad6fdfad","resolution":{"observed_at":"2026-08-11T16:43:08.430805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.674642Z","title":"Emu Edit: Precise image editing via recognition and gen- eration tasks","venue":null,"work_id":"7e2fb1dd-addc-4f49-b1ce-02beddc797f9","year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.435207Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:7043a83436801e03e7a880cc0ff230001e1be017b44e08df2d3195418cb23272","observation_id":"aa30885d-27f4-41ed-8eb5-11bb5c6c12ad","resolution":{"observed_at":"2026-08-11T16:43:09.680306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.09456","last_updated":"2021-11-01T15:34:23Z","snapshot_observed_at":"2026-08-11T00:07:11.399065Z","submitted_at":"2021-10-18T16:47:45Z","title":"NormFormer: Improved Transformer Pretraining with Extra Normalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.09456","snapshot_observed_at":"2026-08-11T16:43:08.440239Z","title":"NormFormer: Improved transformer pretraining with extra normalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.440239Z"},"links":{"cited_paper":"/paper/2110.09456","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:8ec045d5d8f31e4f198832105edee9d4770d4cbff68440e111dd756d046c5d49","observation_id":"ce1f816d-4e84-412c-ba00-2b1ab475e770","resolution":{"observed_at":"2026-08-11T16:43:08.440239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.659101Z","title":"Shutterstock: Stock photos, royalty-free images, graphics, vectors, videos, and music","venue":null,"work_id":"df531ff0-48a5-4830-b0a8-533d5b3818c5","year":null},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.445562Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:e73d635fa2c31cfddac69c3e00928013c0819ed7f388cc01e6133163c0b321f8","observation_id":"64de6b84-dbc5-4660-b28d-ec1d84c83d1e","resolution":{"observed_at":"2026-08-11T16:43:09.664288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-11T16:43:08.450278Z","title":"Make-a-Video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.450278Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:424740827a507b0be2bb234e0cbf629595419f240adddcca53ead910e794ae6e","observation_id":"cfdc7c31-2fd1-45d8-9e8f-c630d5920afc","resolution":{"observed_at":"2026-08-11T16:43:08.450278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.642044Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"2676ce94-40fc-43ea-ac05-16fae06201a0","year":2015},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.455265Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:541b70c50e840b2d18214b4f301b0d3d83a74074e6627048065b3bced379950f","observation_id":"5b0c444a-68c3-4be6-b776-e0ef90e36fed","resolution":{"observed_at":"2026-08-11T16:43:09.647984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01469","last_updated":"2023-05-31T06:17:10Z","snapshot_observed_at":"2026-07-06T14:58:02.852672Z","submitted_at":"2023-03-02T18:30:16Z","title":"Consistency Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01469","snapshot_observed_at":"2026-08-11T16:43:08.461195Z","title":"Consistency models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.461195Z"},"links":{"cited_paper":"/paper/2303.01469","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:e641976638599dbbb662373a89772a51bc5465ed2cc48b0f82dbf4cc120b9f9a","observation_id":"66110414-57a4-40c8-851e-b00797916aa4","resolution":{"observed_at":"2026-08-11T16:43:08.461195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05131","last_updated":"2023-02-28T17:20:36Z","snapshot_observed_at":"2026-08-08T23:22:00.655876Z","submitted_at":"2022-05-10T19:32:20Z","title":"UL2: Unifying Language Learning Paradigms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05131","snapshot_observed_at":"2026-08-11T16:43:08.467829Z","title":"UL2: Unifying language learning paradigms","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.467829Z"},"links":{"cited_paper":"/paper/2205.05131","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:83c53ab1b57760ab40c78d28c6304b46a060bc3a157bd9e79b338a448e09955c","observation_id":"9b74f8bf-1982-4a81-ab30-b09496863bc0","resolution":{"observed_at":"2026-08-11T16:43:08.467829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.626128Z","title":null,"venue":null,"work_id":"7d338cb6-6703-4bde-840a-aa66454d7718","year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.473388Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:142614a6d2973905fcc864394ec810b51807673a3386b169d23c32c987126981","observation_id":"4ccbca24-6cc3-449e-9468-ba4b5f26a920","resolution":{"observed_at":"2026-08-11T16:43:09.630832Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14224","last_updated":"2024-07-10T09:02:11Z","snapshot_observed_at":"2026-08-11T16:42:27.203303Z","submitted_at":"2024-05-23T06:53:18Z","title":"DiM: Diffusion Mamba for Efficient High-Resolution Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14224","snapshot_observed_at":"2026-08-11T16:43:08.478362Z","title":"DiM: Diffusion Mamba for efficient high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.478362Z"},"links":{"cited_paper":"/paper/2405.14224","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:38e739555da0af9410c8ebfbc1f77ba0dc2b1d380a53bd1c826b6767db5284f1","observation_id":"6edfc395-e805-48a7-9f56-300d4160948b","resolution":{"observed_at":"2026-08-11T16:43:08.478362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.608515Z","title":"LION: Latent point dif- fusion models for 3D shape generation","venue":null,"work_id":"577b00bf-f993-4b7d-81ed-a81448302d76","year":2022},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.484763Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:b9c9e0af6148a05fd25383178447e0b728f588f65afaec267c5cad7396ecff72","observation_id":"93cf7088-e7da-40bf-9ff8-692f012afd68","resolution":{"observed_at":"2026-08-11T16:43:09.613422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:08.489615Z","title":"Phenaki: Variable length video generation from open domain textual descriptions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.489615Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:f2fc6052da2c0e1180f049b8ad7098d7d668189d788af5e0c779e7ec1f922268","observation_id":"ff7a6544-0c04-43ad-a68e-435c6c98d6f4","resolution":{"observed_at":"2026-08-11T16:43:08.489615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07887","snapshot_observed_at":"2026-08-11T16:43:08.494872Z","title":"An empirical study of Mamba-based language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.494872Z"},"links":{"cited_paper":"/paper/2406.07887","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:43d9f8e28096629549fe892a4de60bbc9ccc6791d459429e962adb123ece1a73","observation_id":"5e2ed4d1-b2d8-4131-ad92-1a0a21c701cc","resolution":{"observed_at":"2026-08-11T16:43:08.494872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.583341Z","title":"Jha, and Yuchen Liu","venue":null,"work_id":"c604ea51-c3c4-4050-8180-ac6b0b3d44d2","year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.499943Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:89ca83774abc2aac486d742b903a71528b32a654fc7bad0ae0276bcefdce8478","observation_id":"50e6d2a5-ff15-4a22-9ce9-9b479f9317e5","resolution":{"observed_at":"2026-08-11T16:43:09.587749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-10T01:52:30.999213Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-11T16:43:08.504673Z","title":"ModelScope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.504673Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:90e33432bdcb224f7c1d34928bf8d52140eafa4a4b99579a32f2d84bbffe8da6","observation_id":"1f44977b-4c10-4806-8cf6-d2f2b9a797bd","resolution":{"observed_at":"2026-08-11T16:43:08.504673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09109","last_updated":"2023-12-14T16:45:36Z","snapshot_observed_at":"2026-08-05T19:13:07.732946Z","submitted_at":"2023-12-14T16:45:36Z","title":"VideoLCM: Video Latent Consistency Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09109","snapshot_observed_at":"2026-08-11T16:43:08.509845Z","title":"VideoLCM: Video latent consistency model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.509845Z"},"links":{"cited_paper":"/paper/2312.09109","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:a1761fcff70524cc02a8f76b239afa72022edc460a0f05a49a36cbbf1ac0954d","observation_id":"b87730bf-0482-421d-9086-c9aec0aed188","resolution":{"observed_at":"2026-08-11T16:43:08.509845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-11T16:43:08.514912Z","title":"LA VIE: High-quality video genera- tion with cascaded latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.514912Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:0daf773b52f5ac94ba0df040dcb0983153428ef5ae49975043d9cca193c4d719","observation_id":"fc670c36-7bbe-4b30-b704-235d62799298","resolution":{"observed_at":"2026-08-11T16:43:08.514912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-11T16:43:08.519752Z","title":"Loong: Generating minute-level long videos with autoregressive lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.519752Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:a3dd1c716b49a46a4dcfe93d22b43885b4b3c6b3d657d4c7776f9495e0fed21b","observation_id":"13f00a1f-ca3e-4c96-9bb6-99320135d3d4","resolution":{"observed_at":"2026-08-11T16:43:08.519752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08151","last_updated":"2025-05-18T06:43:40Z","snapshot_observed_at":"2026-08-10T11:26:38.428251Z","submitted_at":"2024-10-10T17:36:15Z","title":"Progressive Autoregressive Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08151","snapshot_observed_at":"2026-08-11T16:43:08.525261Z","title":"Progressive autoregressive video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.525261Z"},"links":{"cited_paper":"/paper/2410.08151","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:c76d190d873bf94f5c268a1f58640ef0f11967f258e380a00d2acbb77b2e7ed2","observation_id":"986da5f9-b3bf-4441-a306-b32c54140b37","resolution":{"observed_at":"2026-08-11T16:43:08.525261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-02T18:24:11.208164Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16671","snapshot_observed_at":"2026-08-11T16:43:08.531267Z","title":"Demystify- ing clip data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.531267Z"},"links":{"cited_paper":"/paper/2309.16671","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:ace0e93a76d46298e1ea1eccafdfc7499b2c309f5e2b993c023a0be662c56722","observation_id":"30536006-04cb-4964-9e3c-614def0e3e23","resolution":{"observed_at":"2026-08-11T16:43:08.531267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.568562Z","title":"ByT5: Towards a token-free future with pre-trained byte- to-byte models","venue":null,"work_id":"85a7a85c-f2b5-4479-994c-e08dfc19352a","year":2022},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.536061Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:f709d8d5fd5d297d01d921913fe4504cfa31f357b6ad0403828e3bdc5d4d1b29","observation_id":"c4ec7859-8615-4d98-a3d8-131b31574633","resolution":{"observed_at":"2026-08-11T16:43:09.573235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.552824Z","title":"Dif- fusion models without attention","venue":null,"work_id":"ea671788-5d70-49f9-ac18-e81a4d961add","year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.541049Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:0510163b955c77f7d471a9aae9cfc470b480b2f368b4e1c7650860feb453c5d5","observation_id":"b5b75df8-c35b-4007-8684-bcf332f3247a","resolution":{"observed_at":"2026-08-11T16:43:09.558055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-07-06T11:02:11.424356Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-11T16:43:08.545220Z","title":"VideoGPT: Video generation using VQ-V AE and transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.545220Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:98a33cfd6488c9a936cdfe2f1e1920b7c19718a89db3c90aaef3b3b6923551ac","observation_id":"a3c68c58-0f51-48e8-9131-ed880c767a6d","resolution":{"observed_at":"2026-08-11T16:43:08.545220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:08.550153Z","title":"Paint by example: Exemplar-based image editing with diffusion mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.550153Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:4824ae1cdceb6dacbc1c2fdad94825c8e35ad27bea0f6f0eed740217ae4fb953","observation_id":"bfa55274-aaff-4222-8c16-acdcc4db6dd9","resolution":{"observed_at":"2026-08-11T16:43:08.550153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-11T16:43:08.554893Z","title":"CogVideoX: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.554893Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:94ec34c65037cd19b8c61f10f01876e4605f13de5e53209df0d43cc87cfe5cf9","observation_id":"f16bd07c-6c7e-4ddc-89cb-47d5a430be8b","resolution":{"observed_at":"2026-08-11T16:43:08.554893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.526440Z","title":"Hauptmann, Ming- Hsuan Yang, Yuan Hao, Irfan Essa, et al","venue":null,"work_id":"b107f483-4a10-4ca2-8f1f-3695ee0c3450","year":2023},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.559795Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:498c034b1bb2cfecf65b472ef55585f91089b4bf1f2ee2225b55791f70ef9334","observation_id":"bbb8c895-b74a-43b8-a0dd-8d11a7d08921","resolution":{"observed_at":"2026-08-11T16:43:09.531284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.510400Z","title":"Root mean square layer nor- malization","venue":null,"work_id":"feda1ef8-c650-438a-ab9f-0294d421bd0a","year":2019},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.565377Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:28797458bcdf4ee07210367db655c1888a89738e493f6ba7a7f57b54ce7e96b0","observation_id":"e90ea079-7759-4fd6-9fc4-a3250ced6a98","resolution":{"observed_at":"2026-08-11T16:43:09.515407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.494560Z","title":"Show-1: Marrying pixel and latent diffusion models for text-to-video generation","venue":null,"work_id":"16976eb1-4ec2-44dc-9bb3-7e8619bf8e6a","year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.570224Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:f34083e0b673b75787d1de25d8c0ab1ccb6f824132d20cb9cea724aaa03b90c9","observation_id":"d4003444-edac-41d9-9900-71d939834724","resolution":{"observed_at":"2026-08-11T16:43:09.499522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:43:09.476413Z","title":"Open-Sora: Democratizing efficient video production for all","venue":null,"work_id":"2846b5df-025f-47bc-87c7-604234dde587","year":2024},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.574966Z"},"links":{"citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:9dea372d5f29dd7920974aee3f0e6ea69ee1af0b5d61ecd2c9d532d17a43e993","observation_id":"5bb90295-a349-43af-bedc-e0295fb25444","resolution":{"observed_at":"2026-08-11T16:43:09.483317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T16:36:44.848065Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 6 inbound Pith citation observations for arXiv:2412.09856."}