{"as_of":"2026-08-08T22:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b29cd41474096b94ca4802f69381f0682b7fd46a61fd30ef93ff3509ebd8fcc6","coverage":[{"denominator":97,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":97,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T21:07:32.496573Z","state":"measured"},{"denominator":109,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":109,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T19:40:21.175552Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T13:31:36.510544Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04896","snapshot_observed_at":"2026-08-07T19:40:21.175552Z","title":"Goku: Flow based video genera- tive foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.175552Z"},"links":{"cited_paper":"/paper/2502.04896","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:73c44ed690699397b3c41ccd57b33ff630118553f085f90393de75add69f9abf","observation_id":"71b37e6c-4cb2-4c83-90b0-407a482a8972","resolution":{"observed_at":"2026-08-07T19:40:21.175552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"cited_work":{"arxiv_id":"2502.04896","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04896","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Goku: Flow based video generative foundation models","venue":null,"work_id":"bfd9c809-eb38-4821-9b56-4ac8276cd1bd","year":2025},"citing_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T00:53:53.855965Z"},"links":{"cited_paper":"/paper/2502.04896","citing_paper":"/paper/2503.07598"},"observation_digest":"sha256:29dd7c6c6d371b4656ced5fcb5ba6cb592283faacc5cc78aebcff59d29853444","observation_id":"db7427bf-25e3-4924-8688-59dfdea8ab36","resolution":{"observed_at":"2026-05-16T00:53:54.139725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04896","snapshot_observed_at":"2026-08-07T04:21:18.937837Z","title":"Goku: Flow based video generative foundation models.arXiv preprint arXiv:2502.04896, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-07T04:11:40.231309Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.937837Z"},"links":{"cited_paper":"/paper/2502.04896","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:0e03aa1191d9ae41accbf3e8665ce98e6c3adb6240005f14e545fa97b47e23f9","observation_id":"b2836212-e280-4e41-aa74-47852d59b0ec","resolution":{"observed_at":"2026-08-07T04:21:18.937837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04896","snapshot_observed_at":"2026-08-06T23:20:07.782664Z","title":"Goku: Flow based video generative foundation models.arXiv preprint arXiv:2502.04896, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-08T15:15:43.495121Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:07.782664Z"},"links":{"cited_paper":"/paper/2502.04896","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:f4c30030b862e7aa9e3197e49ef6c47f513fd595e3a4c5b2e2bf1ec45c2c8814","observation_id":"548c22ba-b600-4b5a-bf1d-30c42a03901e","resolution":{"observed_at":"2026-08-06T23:20:07.782664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04896","snapshot_observed_at":"2026-08-06T22:18:38.262151Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21962","last_updated":"2025-06-27T07:09:46Z","snapshot_observed_at":"2026-08-08T06:04:42.250587Z","submitted_at":"2025-06-27T07:09:46Z","title":"AnyAni: An Interactive System with Generative AI for Animation Effect Creation and Code Understanding in Web Development","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:38.262151Z"},"links":{"cited_paper":"/paper/2502.04896","citing_paper":"/paper/2506.21962"},"observation_digest":"sha256:0d802516bd09e41ee2898c55a2cb6a30c1b6c2c33a181d7f4c868528b59a2eec","observation_id":"77913306-8d72-4d9a-9682-8c0c09aed13c","resolution":{"observed_at":"2026-08-06T22:18:38.262151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04896","snapshot_observed_at":"2026-08-05T20:20:20.049659Z","title":"Goku: Flow based video generative foundation models.arXiv preprint arXiv:2502.04896, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:20.049659Z"},"links":{"cited_paper":"/paper/2502.04896","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:b313e451e12c2e3ee51473e2bd6525e2e16fcf79481e7570b59ae66884c7ed70","observation_id":"da65e6d6-5bcd-40e6-9e80-76ea5c5d9830","resolution":{"observed_at":"2026-08-05T20:20:20.049659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04896","snapshot_observed_at":"2026-08-05T20:17:44.619825Z","title":"Goku: Flow based video generative foundation models.arXiv preprint arXiv:2502.04896, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10860","last_updated":"2025-08-14T17:31:18Z","snapshot_observed_at":"2026-08-07T19:46:00.567985Z","submitted_at":"2025-08-14T17:31:18Z","title":"From Black Box to Transparency: Enhancing Automated Interpreting Assessment with Explainable AI in College Classrooms","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T20:17:44.619825Z"},"links":{"cited_paper":"/paper/2502.04896","citing_paper":"/paper/2508.10860"},"observation_digest":"sha256:516f226fff8e1e810a907c216bca54bb46e7385291eb7630810a08fdb1d4ec70","observation_id":"343d2a48-e967-478b-9f55-9d38b4aae68e","resolution":{"observed_at":"2026-08-05T20:17:44.619825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04896","snapshot_observed_at":"2026-08-04T20:35:30.238979Z","title":"Goku: Flow based video generative foundation models.arXiv preprint arXiv:2502.04896, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-07T20:58:14.689758Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.238979Z"},"links":{"cited_paper":"/paper/2502.04896","citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:0733b8ff88d78f5fc6832c3b49be4eb3abe65fd799eb30f8bb0a989dd2cdf70f","observation_id":"6cff7969-361a-4ced-bf5a-e069987fa478","resolution":{"observed_at":"2026-08-04T20:35:30.238979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04896","snapshot_observed_at":"2026-08-04T18:58:10.893526Z","title":"arXiv preprint arXiv:2502.04896","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-08T21:36:02.523510Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.893526Z"},"links":{"cited_paper":"/paper/2502.04896","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:5939220a43389418f8ff91274d39c37093f8f76879d3d232186d4fa13ca04e33","observation_id":"26eb7b67-5785-468d-ba32-3b6f849bf9e8","resolution":{"observed_at":"2026-08-04T18:58:10.893526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"cited_work":{"arxiv_id":"2502.04896","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04896","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Goku: Flow based video generative foundation models","venue":null,"work_id":"bfd9c809-eb38-4821-9b56-4ac8276cd1bd","year":2025},"citing_paper":{"arxiv_id":"2510.17991","last_updated":"2026-05-21T08:36:29Z","snapshot_observed_at":"2026-07-30T04:57:19.929589Z","submitted_at":"2025-10-20T18:11:29Z","title":"Demystifying Transition Matching: When and Why It Can Beat Flow Matching","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T13:27:09.343975Z"},"links":{"cited_paper":"/paper/2502.04896","citing_paper":"/paper/2510.17991"},"observation_digest":"sha256:c118dfcf6f149e2007fe176981e26c353fb587621e70b89a2e74a4ec492bf78c","observation_id":"ac8cb034-2752-4382-ac22-0c3f665f6926","resolution":{"observed_at":"2026-05-22T13:31:36.514398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"cited_work":{"arxiv_id":"2502.04896","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04896","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Goku: Flow based video generative foundation models","venue":null,"work_id":"bfd9c809-eb38-4821-9b56-4ac8276cd1bd","year":2025},"citing_paper":{"arxiv_id":"2512.09646","last_updated":"2026-04-08T15:03:02Z","snapshot_observed_at":"2026-08-03T08:11:41.374378Z","submitted_at":"2025-12-10T13:40:24Z","title":"VHOI: Controllable Video Generation of Human-Object Interactions from Sparse Trajectories via Motion Densification","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T23:30:14.969895Z"},"links":{"cited_paper":"/paper/2502.04896","citing_paper":"/paper/2512.09646"},"observation_digest":"sha256:babb319a09ad0d802e0de83a2e7a6ed7ebbf3cdfd78e67507b5d5d2b1f5ba2ce","observation_id":"a2cecf91-d31b-4a45-a5ce-cedfb6525e2c","resolution":{"observed_at":"2026-05-16T23:31:21.942829Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"cited_work":{"arxiv_id":"2502.04896","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04896","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Goku: Flow based video generative foundation models","venue":null,"work_id":"bfd9c809-eb38-4821-9b56-4ac8276cd1bd","year":2025},"citing_paper":{"arxiv_id":"2604.06339","last_updated":"2026-04-07T18:17:05Z","snapshot_observed_at":"2026-07-06T22:54:53.308309Z","submitted_at":"2026-04-07T18:17:05Z","title":"Evolution of Video Generative Foundations","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-10T18:41:38.616611Z"},"links":{"cited_paper":"/paper/2502.04896","citing_paper":"/paper/2604.06339"},"observation_digest":"sha256:5e49c8a74d0f63f050e0c6386ebeae8f2c6a526028633257a156aa1a9f3948ce","observation_id":"c06e65dc-7ab7-4721-97a2-17e381ada3d1","resolution":{"observed_at":"2026-05-11T00:05:51.885205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.04896/citation-record","integrity":"/paper/2502.04896/integrity","json":"/paper/2502.04896/citation-record.json","paper":"/paper/2502.04896"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-08T21:07:32.156095Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.156095Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:a91b6bf1a55f3d978ca4e32f6fa38181ea8f67d5e4c6f86914ce8c8d8bd392be","observation_id":"85928938-7044-4a89-a653-5151f2f030ab","resolution":{"observed_at":"2026-08-08T21:07:32.156095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.160969Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.160969Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:45f80bd58d60a5af58895bbd489754eb04efac22af8a605681defdd9b43b5f44","observation_id":"2d38cf4e-d8df-428e-a810-9eae06c2630e","resolution":{"observed_at":"2026-08-08T21:07:32.160969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.164935Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.164935Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:a71f4c744e04e4365f58a9b383fef7c325264f6799c85203f40c7ef1f2ac1088","observation_id":"9d92d93f-584c-4cd5-ae7a-93caa93c2744","resolution":{"observed_at":"2026-08-08T21:07:32.164935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-07T18:37:30.995998Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-08T21:07:32.168829Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.168829Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:3cf6b10a35ae152dcfce0a443a363daecb55541d9d1181e241b5637257c26546","observation_id":"b5b4c075-a60f-453f-8102-d9a4c7949249","resolution":{"observed_at":"2026-08-08T21:07:32.168829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.172808Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.172808Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:276dcb9ce5c79cc1c8c18e4fa188ef70875dec4f340f6c4a74a270dd82f90a14","observation_id":"da117d37-8628-4c71-9096-d27e1e0e39d2","resolution":{"observed_at":"2026-08-08T21:07:32.172808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-08T21:07:32.176430Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.176430Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:d170fb52963946efb725dc4c76d9b9085816ae5956a113ab082da5e174c633ab","observation_id":"f85072fd-b7de-4e96-8b84-1afb2dc17ece","resolution":{"observed_at":"2026-08-08T21:07:32.176430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.180257Z","title":"W., Fidler, S., and Kreis, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.180257Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:732ebcb1d87a548a18a664f6754730d5478a555ccac4a762d3e686dc9dbb9288","observation_id":"76c309c2-c5e2-4325-8f5c-017c7b50001b","resolution":{"observed_at":"2026-08-08T21:07:32.180257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.183461Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.183461Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:3a87285034178cb03e5ead7dba240e42e91c766d8cb17f490ed7d2a9137b1e71","observation_id":"292c22cf-1af8-4ce5-a5d8-afd9a7c1e9e4","resolution":{"observed_at":"2026-08-08T21:07:32.183461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.186501Z","title":"and Zisserman, A","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.186501Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:2e5941214d52b216c333c89243f1ca0e09e111013a9432707991f284e9cae3a4","observation_id":"6f5e3547-c421-46a2-9b3c-275a0195b8fc","resolution":{"observed_at":"2026-08-08T21:07:32.186501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.194484Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.194484Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:c3f3cf730ee93d118e74c364404253205f1163c14d15735469bb8d33de667cf7","observation_id":"9b449b54-af7b-4e1d-9e24-5c3fe7c81d74","resolution":{"observed_at":"2026-08-08T21:07:32.194484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-08T21:07:32.198690Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.198690Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:cf78d9a045fe9aa5317269d5a1cca162961ac0ab1ff962ea9311c2b948313217","observation_id":"88d9202a-f2ac-48e6-bd7e-a1922a1a2d92","resolution":{"observed_at":"2026-08-08T21:07:32.198690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.202670Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.202670Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:7338c9e6467e72b289c000bb8b05e17f9229489e8140078bdf6300f93cbc058e","observation_id":"db52cd19-7ec1-424d-a54e-260b0881cc47","resolution":{"observed_at":"2026-08-08T21:07:32.202670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-08T09:03:25.135475Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-08T21:07:32.206179Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.206179Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:01b9c1e8b9e881d06c0af8f6b4e3688c1537b77c873906f7388026cffcc53463","observation_id":"9926333e-c97a-4969-9d3c-436d9d5f9fe9","resolution":{"observed_at":"2026-08-08T21:07:32.206179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.209966Z","title":"E., Fang, Y., Lee, H.-Y., Ren, J., Yang, M.-H., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.209966Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:165fc2f32f8e22632c76ea5567f5d4d16e956b77377a1a6ace93b55fb037f64a","observation_id":"287f122e-827e-4672-92d7-60a9a35e0a41","resolution":{"observed_at":"2026-08-08T21:07:32.209966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-08T21:07:32.213643Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.213643Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:1ea7db35537d4cbefd5ea9cbe54b9ee4722ab4cb098c9059f3014268a5b301a8","observation_id":"724b9978-4478-425d-b9c7-c795f8b6eb7d","resolution":{"observed_at":"2026-08-08T21:07:32.213643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.217281Z","title":"W., Hou, L., Longpre, S., Zoph, B., Tay, Y., Fedus, W., Li, Y., Wang, X., Dehghani, M., Brahma, S., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.217281Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:70a85541e389893f4435b61bb87ec43c36beb431f369526555782e40eb51b930","observation_id":"c64c59a5-7d3d-4a3f-a93e-9f3bdd1bfb0d","resolution":{"observed_at":"2026-08-08T21:07:32.217281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.220626Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.220626Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:2b506726ea3b43a6e25d05f8bec716202cc1918c8d9c5fc4b2e5a131dcfaf4f5","observation_id":"312c2f7f-205d-453c-9ea5-43b1e3afe6f3","resolution":{"observed_at":"2026-08-08T21:07:32.220626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.224458Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.224458Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:ac08143e0a981bc765d911a40488158b4dddc281ab1db502fe089f29901c8887","observation_id":"cd1ef5f2-5e85-4d60-a705-fd1c5bfcdcd2","resolution":{"observed_at":"2026-08-08T21:07:32.224458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.228134Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.228134Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:f3779866bb0151a562d6fe2b8604a7dbd87b65c2a4de216aeba22f0bd4b08f74","observation_id":"ad265a19-ba38-44b1-967f-255418f8bbbe","resolution":{"observed_at":"2026-08-08T21:07:32.228134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.231732Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.231732Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:59911a1bf52e747a2d6a9324689fb6176296d3bd43c06df48711afe39415698e","observation_id":"048df2a9-f637-430e-8382-c4876ae906dd","resolution":{"observed_at":"2026-08-08T21:07:32.231732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.235356Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.235356Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:67012f921a92248d845ee63a86fddfcebf7888c7c80847ae0170fdc79d26b723","observation_id":"90947eb4-e614-47b7-890b-9f03b260ada9","resolution":{"observed_at":"2026-08-08T21:07:32.235356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.239255Z","title":"P., Caron, M., Geirhos, R., Alabdulmohsin, I., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.239255Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:866498b74978a5a6964b4a8c217c720ad61cb116a810ced391c459508183df87","observation_id":"0f4d48bc-3732-493a-9a63-3162b08d92b0","resolution":{"observed_at":"2026-08-08T21:07:32.239255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.242626Z","title":"M., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.242626Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:38e687193765782b74df7bffd3a22c52a528572fefaff17322233344cb6feaf6","observation_id":"c31ed632-55e6-4cab-9d47-3cf6748e069f","resolution":{"observed_at":"2026-08-08T21:07:32.242626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.540035Z","title":null,"venue":null,"work_id":"66f5b606-4427-453e-9ca9-14aa8fa124b5","year":2009},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.246086Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:b691cf318c58d53d3d474d0ffd8510a0ba8ef1e87ea4a585a025a33f2313f86a","observation_id":"94231d16-f670-48bb-9392-051bdcc723c8","resolution":{"observed_at":"2026-08-08T21:07:33.544143Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.527120Z","title":null,"venue":null,"work_id":"2b91f751-ee42-4e73-be76-ecfc8a4d9561","year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.249353Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:2a49827a2afe5e0240252d62cbdf1462d731c442fd974bb4fcfc8adc6f19c086","observation_id":"49a44937-294e-4910-a450-74de70957797","resolution":{"observed_at":"2026-08-08T21:07:33.530919Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.512432Z","title":null,"venue":null,"work_id":"1db41db7-4996-4e9a-ba91-7996d76b283a","year":2021},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.253421Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:616bc434f04dd1f86102f2ab7587230f14fc4173a0ad1a1da10e5843161db706","observation_id":"a9cf8b04-a98f-4383-8542-a1adf4f85014","resolution":{"observed_at":"2026-08-08T21:07:33.516987Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.500138Z","title":null,"venue":null,"work_id":"d99f45d5-f4df-4c18-8895-26fb9805d02e","year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.256997Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:f4e96d9b8c69b1a355567048e6f9651ccd07d05953ee04b93fec05a2c2c99d5a","observation_id":"991920cf-6061-4bc8-bca4-f76fb17905ca","resolution":{"observed_at":"2026-08-08T21:07:33.504200Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.489337Z","title":null,"venue":null,"work_id":"cdbf3590-7568-4605-9056-e168adea06ac","year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.260263Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:9d5cf0f06fbc769121f69348860300ac3056084432a858204a76028734b9fc07","observation_id":"3b643576-0033-4211-bc0c-e4c3d277b61e","resolution":{"observed_at":"2026-08-08T21:07:33.493278Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-02T11:56:15.393496Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-08T21:07:32.265159Z","title":"S., Shah, A., Yin, X., Parikh, D., and Misra, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.265159Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:ba1d9a6ce2ed1ab3344792b7e7730f1a90253dd88dfab5cd1cbba617eb56cd6b","observation_id":"e7d2e53e-9376-4a61-a257-5282fcc8e6c7","resolution":{"observed_at":"2026-08-08T21:07:32.265159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.477641Z","title":null,"venue":null,"work_id":"b1753095-38f4-479b-8297-0fe0e2a8e0e9","year":2014},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.268523Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:cb44dc5365b6351224c642b67b1e28ca09baf13372debdeb5ba91d1e203cf47e","observation_id":"45c45ad3-98d6-4936-9cea-835b5aaf71d4","resolution":{"observed_at":"2026-08-08T21:07:33.481005Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-07-31T21:36:45.596575Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-08T21:07:32.271832Z","title":"and Schmidhuber, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.271832Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:288b43ed7a50abf291a2d59c0734ba785fa04d852b1d85b88f062eee0b704141","observation_id":"8a939db5-652d-43b9-b46b-2fe579fa9ea2","resolution":{"observed_at":"2026-08-08T21:07:32.271832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07667","last_updated":"2024-07-10T13:46:08Z","snapshot_observed_at":"2026-08-07T00:56:39.117883Z","submitted_at":"2024-07-10T13:46:08Z","title":"VEnhancer: Generative Space-Time Enhancement for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07667","snapshot_observed_at":"2026-08-08T21:07:32.275040Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.275040Z"},"links":{"cited_paper":"/paper/2407.07667","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:d5b3d5a1226e186c2155d2c95d9af3364c97a73dbcf996bb2d81ed368021186b","observation_id":"06c03726-37b9-4878-b208-00f7267ed714","resolution":{"observed_at":"2026-08-08T21:07:32.275040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-08T21:07:32.278648Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.278648Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:debab2e7f8b3e247f1f8d303be20a1d278b6646baf254c9abd002b3ddbd4de10","observation_id":"0dedcd94-ac77-41af-a2d6-8d99226e8757","resolution":{"observed_at":"2026-08-08T21:07:32.278648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-08T21:07:32.282426Z","title":"P., Poole, B., Norouzi, M., Fleet, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.282426Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:441ce04af6b9676604f6bacfa14c9302f5ec1d379536282d84714e0a5d03e458","observation_id":"9ce6b1f5-a367-41fe-84bc-9da80dac2359","resolution":{"observed_at":"2026-08-08T21:07:32.282426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.286711Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.286711Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:005933e3cf5f6a61b483d17b6cde66b4bd874cc7c87602f6438a4b075d81ee61","observation_id":"712cf700-f7a2-43c0-8fc4-fa8325c7050f","resolution":{"observed_at":"2026-08-08T21:07:32.286711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.290223Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.290223Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:7673341986fc2be293dd1fea995560ccaf57ec8d5493061f0848cdac8537651b","observation_id":"6a1592d5-84e6-4911-a1c3-58717dabebe3","resolution":{"observed_at":"2026-08-08T21:07:32.290223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-08T21:07:32.293766Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.293766Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:368e7b3bb7a6a01b0126d885c2f25bebcc99516c92b729dfdbf5edd598c9f2ec","observation_id":"4f520216-4449-4543-8b10-5863792bc624","resolution":{"observed_at":"2026-08-08T21:07:32.293766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-08T21:07:32.297208Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.297208Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:373c314e5d82b8fba8ffa4f5e0bde34ce2ba47a40913b05d1c45ef4909629a3b","observation_id":"f9b55a86-b0cc-4130-b488-c0324f425f51","resolution":{"observed_at":"2026-08-08T21:07:32.297208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.455796Z","title":null,"venue":null,"work_id":"0021d141-e0e8-4ca9-9bbf-9bff9c07e321","year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.300640Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:e911765c12383f922647c8a50a477b4821730983f431ec43f0b958e0965f8899","observation_id":"2bc11b78-1d62-4302-861b-f17173c25b1f","resolution":{"observed_at":"2026-08-08T21:07:33.458966Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.446246Z","title":null,"venue":null,"work_id":"df6a734d-bf80-4564-8416-444ef660c79b","year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.304062Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:9400024b9ddb0b3a7ca5053b3174a0a24645668810c0a08e148b72262a926a89","observation_id":"86b662bd-8b69-432b-86ec-6b4edeabc348","resolution":{"observed_at":"2026-08-08T21:07:33.449442Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-08T21:07:32.307439Z","title":"A., Tanaka, M., Zhang, C., Zhang, M., Song, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.307439Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:205ee21bc2e706c8dcfdf39c178c8080008efcefe0cf8fed757b9f0d33788192","observation_id":"9541b182-9783-4ac6-b1d7-c109b5fa2eea","resolution":{"observed_at":"2026-08-08T21:07:32.307439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15156","last_updated":"2024-12-19T18:32:21Z","snapshot_observed_at":"2026-07-06T20:10:24.217625Z","submitted_at":"2024-12-19T18:32:21Z","title":"Prompt-A-Video: Prompt Your Video Diffusion Model via Preference-Aligned LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15156","snapshot_observed_at":"2026-08-08T21:07:32.311442Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.311442Z"},"links":{"cited_paper":"/paper/2412.15156","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:182c127164c466ef4746025b683d248c3ebbe4a02c366ef84421b598e1a50a6d","observation_id":"f8dbea00-6bea-4f05-a705-c245a0ba56d0","resolution":{"observed_at":"2026-08-08T21:07:32.311442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15627","last_updated":"2024-02-23T22:10:59Z","snapshot_observed_at":"2026-07-06T17:34:49.001670Z","submitted_at":"2024-02-23T22:10:59Z","title":"MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15627","snapshot_observed_at":"2026-08-08T21:07:32.315237Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.315237Z"},"links":{"cited_paper":"/paper/2402.15627","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:702f20716cbe280e88db0df1018282b7b7d6e25f29cabeb5900c2de7fdf8838d","observation_id":"5efa6d26-87f3-48ad-9a39-2f07ad1c15a1","resolution":{"observed_at":"2026-08-08T21:07:32.315237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.319173Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.319173Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:ef4c16a8571cbc3647644c2ae47c8869b2a76ff10ea2c16261cf8d0007682fce","observation_id":"b2c1bd69-d3cb-46ea-acf9-aa2e4639bf30","resolution":{"observed_at":"2026-08-08T21:07:32.319173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06358","last_updated":"2024-07-08T19:58:59Z","snapshot_observed_at":"2026-08-07T01:27:15.618968Z","submitted_at":"2024-07-08T19:58:59Z","title":"MiraData: A Large-Scale Video Dataset with Long Durations and Structured Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06358","snapshot_observed_at":"2026-08-08T21:07:32.322663Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.322663Z"},"links":{"cited_paper":"/paper/2407.06358","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:1dd83d1a61a71028346825cf2794a7e9bf0efb9ebe188a5865c45dbf86a114ac","observation_id":"aa3150f1-ec66-4108-8b90-a27ce11fbc2d","resolution":{"observed_at":"2026-08-08T21:07:32.322663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-08T21:07:32.326278Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.326278Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:26d8084b1a1b009519b30e286c9459c89c46b635b9433e4364480b842e4b135d","observation_id":"f1bb6334-e9c3-4b59-a061-ad3e2b7e3e9f","resolution":{"observed_at":"2026-08-08T21:07:32.326278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-08T21:07:32.329782Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.329782Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:ad3b7bd2ceac0e901c86422cb8e6867b694ec386a16137df8e08bc239a406803","observation_id":"61123efe-33a2-4747-8324-863b0db1881c","resolution":{"observed_at":"2026-08-08T21:07:32.329782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.436140Z","title":"A., Casper, J., Lym, S., McAfee, L., Andersch, M., Shoeybi, M., and Catanzaro, B","venue":null,"work_id":"4136575e-da78-49fd-a368-b294464b1c1f","year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.333456Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:1bba9135edee398e4d614010df08a573d7b802f5b313b5b447b57611c14e799b","observation_id":"0b58b973-28e2-45e1-af42-4c48a1e22dbe","resolution":{"observed_at":"2026-08-08T21:07:33.439576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.425701Z","title":"Kling ai","venue":null,"work_id":"5330620b-997a-4e01-a39c-4dc3278208a9","year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.336701Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:afa7cc4558d391b75954d75f74efab3e06b0eb7929c9d38e3922347f2c33d985","observation_id":"7cdf3405-e141-447f-be67-fa09b6aa3f91","resolution":{"observed_at":"2026-08-08T21:07:33.429492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.415945Z","title":"and etc., T","venue":null,"work_id":"ffe62c3e-6fea-4a27-927d-2d6ead17cfcd","year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.340459Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:7e1b06eee70098119edf09ca1f879dfa24e7db22ba8cabc4ef8de43266fcdc60","observation_id":"6baefe28-de8f-4899-aff5-c33be584d63a","resolution":{"observed_at":"2026-08-08T21:07:33.419141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-08T21:07:32.343801Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.343801Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:3a46bfcdbc896b551a02afaa2624264e257ff7c43d46f3873c0fa597a952bb05","observation_id":"2745746e-9eee-48bf-99c8-1b28bb474655","resolution":{"observed_at":"2026-08-08T21:07:32.343801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.347144Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.347144Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:b887ef431bf46e06fb111e51b6d076acd8f1dceaae4863e70ac6291dba2989c2","observation_id":"faf960ae-8933-4801-b37b-1b30c959a0c8","resolution":{"observed_at":"2026-08-08T21:07:32.347144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.350393Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.350393Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:cf286d3c7e07e9ab4fa0a62376aec7a973f6b153104a52eaa71091a2ca5564ae","observation_id":"20201feb-3979-4b04-b8a0-7ba6dc6d1613","resolution":{"observed_at":"2026-08-08T21:07:32.350393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.390959Z","title":"N., Zhu, S.-C., and Gao, J","venue":null,"work_id":"e5b56bab-02f2-494b-a8f9-9cd932494891","year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.353766Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:aa175d613d60a041290944b8d9c92d83376fb435fbfba0a5db664e0b4575fe54","observation_id":"f3fd637d-e874-44ed-9031-f3bced6119d2","resolution":{"observed_at":"2026-08-08T21:07:33.395004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.378628Z","title":null,"venue":null,"work_id":"df8d7a4d-f97a-433a-8862-646432b8c373","year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.357079Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:48de26fd6161d8a10743a8b5fb5438773aff8cf190cfff17d41d9b2ce6714849","observation_id":"0e30da2b-ab38-429f-be58-d98368ca035f","resolution":{"observed_at":"2026-08-08T21:07:33.381963Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.368154Z","title":null,"venue":null,"work_id":"98c8016f-6985-470f-9f21-04ea1ab9823d","year":2022},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.360318Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:373acedf57fbd8062bbbde78b16a0aa7bccdec7e6768d71d95e353531d76a513","observation_id":"1f6b51b3-9e91-45c6-adc9-c4c53c8f4f86","resolution":{"observed_at":"2026-08-08T21:07:33.371750Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-08T21:07:32.364087Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.364087Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:c70b49ffe686597d70842e6bb2a42f4641a0bcedfa459aba491e044cc87eb71d","observation_id":"27c5c51f-3a10-435c-afdd-b3ced2a969f5","resolution":{"observed_at":"2026-08-08T21:07:32.364087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-08T21:07:32.367504Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.367504Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:ac59c50986bff6292fec06e304b091dcaae675141081172bcaf571a4daeaa98c","observation_id":"ed33e448-f73a-48db-ba94-da04dbd50a2d","resolution":{"observed_at":"2026-08-08T21:07:32.367504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.358352Z","title":"and Xie, S","venue":null,"work_id":"86bc1d49-2f4a-4a85-a1b3-8dae0307faaf","year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.370762Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:0c1d4a051a0745291dc1e81073dddffe71e331e7db0b659913ef2ea2385c3bc1","observation_id":"affb7dfc-c912-4bca-91d5-c6ec8c776a8e","resolution":{"observed_at":"2026-08-08T21:07:33.361628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.347584Z","title":null,"venue":null,"work_id":"6de73eda-0b5a-40cc-9ed4-e84c7b41f8ff","year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.373711Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:be5221b5d27ffd288ce3104ef8477f8548d601beda1ebb48987892d79071a6ab","observation_id":"f24d59f3-11f6-46b3-8795-d7148e195f07","resolution":{"observed_at":"2026-08-08T21:07:33.352189Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-08T21:07:32.376585Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.376585Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:334cfa4605eb73503e88eeb475da55fa611eb7cded569ea068c965c7d4cfca7f","observation_id":"ceb4670f-84c7-4f4e-906f-1ad50ad70956","resolution":{"observed_at":"2026-08-08T21:07:32.376585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-08T21:07:32.379704Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.379704Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:8f444f92cba4509ea93e4747cbbbf014b0a6cb9957f1ff411fb85830939a8872","observation_id":"3f5005d0-01bc-49b2-b5a9-bbff2e9cf3bf","resolution":{"observed_at":"2026-08-08T21:07:32.379704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.338197Z","title":null,"venue":null,"work_id":"ed26c202-72aa-4835-b03c-f5b208785de0","year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.383068Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:cecb92a84c40d1cc98ce814e915e09466e9b235b312ed93490ab3a6b5c87e60d","observation_id":"eb363a4c-5ca9-48a3-93a0-a2a39a349a2a","resolution":{"observed_at":"2026-08-08T21:07:33.341571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-08T21:07:32.386294Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.386294Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:5d1d73a9408638a20f2dcac177888ad8c54449bf5d7a16b630ad779e83a33c89","observation_id":"53ae145b-5219-4ecb-9367-750da97db423","resolution":{"observed_at":"2026-08-08T21:07:32.386294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.389832Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.389832Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:b5412b9ab345b0a7cc4d508959a453257f2e76ff8a0c785cf561cee84e7fc022","observation_id":"c18127da-511b-455a-9361-3e0be55450a2","resolution":{"observed_at":"2026-08-08T21:07:32.389832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.320914Z","title":"Gen-2: Generate novel videos with text, images or video clips","venue":null,"work_id":"2bc700a7-8085-48bc-b97c-946be0262372","year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.393379Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:8e4e28aa16eccd59f70df57d6ade58317c5971ae5208484be1a68e55ec65cb45","observation_id":"227ab9bc-8c53-47dc-b12a-6d4784fa87cc","resolution":{"observed_at":"2026-08-08T21:07:33.325225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.311397Z","title":null,"venue":null,"work_id":"b9fb8d7a-fb76-4495-8d23-513c6ba29aa5","year":2022},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.396531Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:1d4643a1cb21c5c33c089b608e9432c93d2ed1442a56d6a62ca01538f3a9f57a","observation_id":"d7a13a44-491f-4a54-89aa-bf53ab125130","resolution":{"observed_at":"2026-08-08T21:07:33.314720Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08608","last_updated":"2024-07-12T22:15:02Z","snapshot_observed_at":"2026-07-06T18:44:53.587276Z","submitted_at":"2024-07-11T15:44:48Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08608","snapshot_observed_at":"2026-08-08T21:07:32.399665Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.399665Z"},"links":{"cited_paper":"/paper/2407.08608","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:23e4276995fcf13ad2cbdb1d43ae2a456d0e2f033fee9e079676ed5be786f187","observation_id":"6dbf5eba-9d91-494a-86d1-2f3f543a0765","resolution":{"observed_at":"2026-08-08T21:07:32.399665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.302439Z","title":null,"venue":null,"work_id":"e1acdc4b-51fe-436a-aa9f-e7c0171e100f","year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.403443Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:47695a78e86eb656afa094603c7205fd17319b4b1e80d3445036846a3ee7eaf9","observation_id":"81c41bf2-a409-4c1e-89d2-5d220dc39076","resolution":{"observed_at":"2026-08-08T21:07:33.305627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.292842Z","title":null,"venue":null,"work_id":"40d77cd7-d35d-4e53-b23b-7806052275d3","year":2022},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.406690Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:ea03011977c835228f71f0f1d8f9081f5b596267c0e5ef583a9125dca3cf5899","observation_id":"684081a6-08a7-497b-b63e-05b9ffc8bff2","resolution":{"observed_at":"2026-08-08T21:07:33.296273Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.283034Z","title":"R., and Shah, M","venue":null,"work_id":"9edf634b-8440-41b3-bfd2-40c213cfec4e","year":2012},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.409921Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:6c66f70fc1d63e29ecf96c2a50f3a308d59f39fdea487905353d6b59f6dc7a64","observation_id":"0bc7182f-816b-4680-ad0e-616a2877e64a","resolution":{"observed_at":"2026-08-08T21:07:33.286483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.413432Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.413432Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:b730cb3937741d4d2d28a7dc9371991fe6bab3be14f6861068945bc8d49c4f52","observation_id":"18520e55-6cef-4cf5-95f4-f8de98c9d5af","resolution":{"observed_at":"2026-08-08T21:07:32.413432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-08T21:07:32.416880Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.416880Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:8541c33d925e2fb205df75668833feaa5e5ca1231f2a65e498db4ee2eb7851e0","observation_id":"c94b2163-d877-4557-ad31-072cbe6d1f64","resolution":{"observed_at":"2026-08-08T21:07:32.416880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.267334Z","title":null,"venue":null,"work_id":"b02b3504-1482-4eac-a73a-b0ef077ef9f1","year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.420673Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:6d1d3f1714ac22c85ba78f05c91ce581d223490afa8c22b29d1a08f0d2ec9ea5","observation_id":"c0840351-cdbc-4498-89e2-a6a74623cd51","resolution":{"observed_at":"2026-08-08T21:07:33.270722Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.257773Z","title":"and Deng, J","venue":null,"work_id":"e94b53e3-177b-4cf9-ada7-b5d36162ded3","year":2020},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.423810Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:5aa9ed260d9529483a7705d904d9e9e5fa6e6ee61d70f9287c0efd0ac6ef8cae","observation_id":"34e34a50-cc64-4cfc-8f84-9ef3959b7b5b","resolution":{"observed_at":"2026-08-08T21:07:33.260949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-08T21:07:32.427087Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.427087Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:8fbdd4eae9509b923e20cf285a895e91a20092558226b9ae43e80a2e2cc4366a","observation_id":"5d36d202-5a1d-4868-a45a-60ecdf3c33d7","resolution":{"observed_at":"2026-08-08T21:07:32.427087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-07-06T19:06:23.640089Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-08-08T21:07:32.430562Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.430562Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:ba48ea5b0dc6b1e7ce138dd4e47ea46692ca46ff3bdd1c27eb17793613dc181f","observation_id":"43582b8d-c3ce-42d3-917e-e2c9084424d6","resolution":{"observed_at":"2026-08-08T21:07:32.430562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:32.434181Z","title":"N., Kaiser, ., and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.434181Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:9f7fca71ddd2d0b31d911f72cc5b534a19e4103d3f2cc004bac0e62c433d7c34","observation_id":"7170e4fa-2b02-499d-9165-bedccd340dc0","resolution":{"observed_at":"2026-08-08T21:07:32.434181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20143","last_updated":"2025-04-02T06:05:23Z","snapshot_observed_at":"2026-07-06T18:53:26.968088Z","submitted_at":"2024-07-29T16:18:20Z","title":"ByteCheckpoint: A Unified Checkpointing System for Large Foundation Model Development","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20143","snapshot_observed_at":"2026-08-08T21:07:32.437322Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.437322Z"},"links":{"cited_paper":"/paper/2407.20143","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:c3195f8a8d3c6f0b3e8dafce0d16d919dfbc24dffa3a92b4678cfb3bc72a6e2a","observation_id":"b349072c-cb86-4629-9f71-4b7d2bed051c","resolution":{"observed_at":"2026-08-08T21:07:32.437322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-07T00:13:25.095002Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-08T21:07:32.440706Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.440706Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:3bf55c74bfe5b5f88f34455cd37b6b6150528f3bbe8acd5059f305f4f992aeb8","observation_id":"63f8375a-2a2e-47a9-a9bf-2f2200751a76","resolution":{"observed_at":"2026-08-08T21:07:32.440706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.242542Z","title":null,"venue":null,"work_id":"85ad32cd-8ab4-4bd1-8b0a-861230f567c9","year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.444535Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:75d5653bd53b9025b83bbd59b4552649c7d0e4f9f8f8fdd201c276e5d372e06b","observation_id":"e6363e88-d4f4-4a21-bc82-4a90c1b5dd1d","resolution":{"observed_at":"2026-08-08T21:07:33.245734Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-08T21:07:32.448083Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.448083Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:36b242d5e00331ddd79c32f60d921b33d18157321268fc7f425aa85b0ee6ca81","observation_id":"adec02e8-67be-45f6-b050-bfc24324d5e5","resolution":{"observed_at":"2026-08-08T21:07:32.448083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-08T21:07:32.451450Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.451450Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:f94e5aada56fd45e636e290f259d14d452471ff6162b30373e54b73678264893","observation_id":"18044e88-1e2a-46ac-bbdf-2208eaf7b3f0","resolution":{"observed_at":"2026-08-08T21:07:32.451450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.232200Z","title":"J., Bjontegaard, G., and Luthra, A","venue":null,"work_id":"09428957-062c-4b1a-bbb0-ebdc5b8a5b1a","year":2003},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.454743Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:1303f14b9d6e7a1bfa873d3893ba632b3520d05523ce9f70dba5399113228ff9","observation_id":"6ef12fc5-94a5-442d-a6b8-3405e026db60","resolution":{"observed_at":"2026-08-08T21:07:33.236083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.221109Z","title":"Z., Ge, Y., Wang, X., Lei, S","venue":null,"work_id":"4043ee1e-e250-43e4-8506-200009b748a9","year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.457851Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:b9b4dfe02939f84cce1cd5e53eba143f0e3eb66aebefd67b8dce27e90f04016e","observation_id":"2c3a20d4-e6a9-4b19-abcf-2bd8a3c7a815","resolution":{"observed_at":"2026-08-08T21:07:33.224730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-08T21:07:32.460861Z","title":"J., Wang, W., Lin, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.460861Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:ff7d35073d7eece62101aef18d8376b2e5dcc73984fce854443055b0134af719","observation_id":"931314ed-1b03-4497-ba8a-9f17b771d97c","resolution":{"observed_at":"2026-08-08T21:07:32.460861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-08T21:07:32.463975Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.463975Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:ba63599149a7d34e95c3533f8bd480a4b3bab57f30e34ebd11698126aec140c0","observation_id":"264616a2-b450-4113-a3b6-1280e0fa363f","resolution":{"observed_at":"2026-08-08T21:07:32.463975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00887","last_updated":"2024-12-01T16:53:02Z","snapshot_observed_at":"2026-07-06T19:59:47.022132Z","submitted_at":"2024-12-01T16:53:02Z","title":"Playable Game Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00887","snapshot_observed_at":"2026-08-08T21:07:32.467088Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.467088Z"},"links":{"cited_paper":"/paper/2412.00887","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:34fb641dacfb8f1e8bbe04725dddddbe4b92a741ba5d542c1160a044aa37985d","observation_id":"5e9a2a0d-db21-44f7-8589-ffd3dfd403b8","resolution":{"observed_at":"2026-08-08T21:07:32.467088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-08T21:07:32.470090Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.470090Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:a8088e422edde7721629d1ab38c4a1446a47f7f087e52477499cb398824b2195","observation_id":"8e64c788-4d03-44b0-9e71-0b70330225ec","resolution":{"observed_at":"2026-08-08T21:07:32.470090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-07-06T20:20:47.146343Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-08T21:07:32.473373Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.473373Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:102d5642a52731e2cc09f3896ff0ba3240c9bf2156069ffc7d1cfeb92f9b0779","observation_id":"ad0af566-b5c3-4249-9bc2-44d4c77eb671","resolution":{"observed_at":"2026-08-08T21:07:32.473373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.211160Z","title":null,"venue":null,"work_id":"85e4ff8b-0c76-4d06-8dbf-2dc675a6172e","year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.476786Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:e1b8021f62b0e940b6957f4a081da0976f86eefefc4f2d1713d6cc53b29da2ed","observation_id":"371b7fe2-e37d-4207-8d3b-e4e066daa7d1","resolution":{"observed_at":"2026-08-08T21:07:33.214561Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.201375Z","title":"and Sennrich, R","venue":null,"work_id":"7cf3c2df-a768-4229-96cf-3061e08d174e","year":2019},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.480002Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:b9750ab0d74b012a83950dad89446bf1d678330793b703caad2303b5c90bdc8b","observation_id":"949d6bc6-3c98-46aa-9519-c88e1398397b","resolution":{"observed_at":"2026-08-08T21:07:33.204618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11700","last_updated":"2024-03-22T08:13:11Z","snapshot_observed_at":"2026-07-06T17:46:15.903070Z","submitted_at":"2024-03-18T11:56:35Z","title":"Virbo: Multimodal Multilingual Avatar Video Generation in Digital Marketing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11700","snapshot_observed_at":"2026-08-08T21:07:32.483129Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.483129Z"},"links":{"cited_paper":"/paper/2403.11700","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:c0e98a372aeda88c3a7173bd341ad80a78d32375041a7a1499e17b7b87d8811e","observation_id":"f893f07b-425f-48eb-a62f-d08423a28771","resolution":{"observed_at":"2026-08-08T21:07:32.483129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.191469Z","title":null,"venue":null,"work_id":"fb2319b1-355e-4b39-8cc5-ac80678d325b","year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.486513Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:2f5dd910a4b4b41f718f7b9ce6b287d8f108f5e29d83248f5f19c8800c9a41f1","observation_id":"edc5f394-9250-40ea-9624-daebd3e9f4bc","resolution":{"observed_at":"2026-08-08T21:07:33.194816Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:07:33.180244Z","title":null,"venue":null,"work_id":"a0db76fd-7e9b-48ca-abd7-303b4c07233a","year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.489710Z"},"links":{"citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:254a7d638522ce81a7e7a2255cb2c37814e27c12c8496260e0b0c94e311f2d26","observation_id":"6bbec044-11b0-45a4-ab52-00293a572d5d","resolution":{"observed_at":"2026-08-08T21:07:33.184559Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-08T21:07:32.493071Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.493071Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:014c2a074a7a5b828f6263b49eb47077462c153abef9e00918a71196c340849b","observation_id":"e04f87c3-426d-4ffb-876a-302e0cedc404","resolution":{"observed_at":"2026-08-08T21:07:32.493071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-08T21:07:32.496573Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.496573Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:c043d464b8ac4849ba7f284e113b79763b0da41cd9cde89a138a3aed393b2252","observation_id":"c11658e1-3d2d-4efb-86c9-9ee57f2f3ad8","resolution":{"observed_at":"2026-08-08T21:07:32.496573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models"},"reference_resolution":{"displayed":97,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":86,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":97},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 97 of 97 outbound references and 12 inbound Pith citation observations for arXiv:2502.04896."}