{"as_of":"2026-08-15T07:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e9333a5ed16160a6f66d14ada9b7de6858f3e8cc3eefa34098230e3db5833c32","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:30:03.942929Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.04452/citation-record","integrity":"/paper/2412.04452/integrity","json":"/paper/2412.04452/citation-record.json","paper":"/paper/2412.04452"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2304.08477","last_updated":"2023-04-18T03:27:52Z","snapshot_observed_at":"2026-08-13T21:55:34.606308Z","submitted_at":"2023-04-17T17:57:06Z","title":"Latent-Shift: Latent Diffusion with Temporal Shift for Efficient Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08477","snapshot_observed_at":"2026-08-11T21:30:03.595252Z","title":"Latent-shift: Latent diffu- sion with temporal shift for efficient text-to-video genera- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.595252Z"},"links":{"cited_paper":"/paper/2304.08477","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:a974fb448b44b80538258e4393e45350afea4e7f3ec33a2c64f5781400c977f2","observation_id":"fa86f80b-4a93-4938-b98c-d8b03c60c694","resolution":{"observed_at":"2026-08-11T21:30:03.595252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12945","last_updated":"2024-02-05T16:36:30Z","snapshot_observed_at":"2026-08-13T04:36:44.594755Z","submitted_at":"2024-01-23T18:05:25Z","title":"Lumiere: A Space-Time Diffusion Model for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12945","snapshot_observed_at":"2026-08-11T21:30:03.602198Z","title":"Lumiere: A space- time diffusion model for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.602198Z"},"links":{"cited_paper":"/paper/2401.12945","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:d01f538acacd4c3bf08051a5038aedf85543cc48aeca2de2608146deea249a5e","observation_id":"6381c8a7-b767-4739-9705-e4a0a24b720e","resolution":{"observed_at":"2026-08-11T21:30:03.602198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T21:30:03.607910Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.607910Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:d06035b34622b4cf325deabfbc23d2698532f9c5e5b22b91d957d6fb157d1cd1","observation_id":"c7633e65-5254-4364-85a8-a7e2253132b1","resolution":{"observed_at":"2026-08-11T21:30:03.607910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:03.613538Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.613538Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:7f285222f547931d53340e8232464e573097bd9425db0622dcf9bc13a33a5629","observation_id":"a7104834-8ac7-419b-b46b-34f49acab452","resolution":{"observed_at":"2026-08-11T21:30:03.613538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:05.006293Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":"a071890f-eaa3-43b9-879b-556fddfab393","year":2023},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.618977Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:4264b74b590907e5f7bab7aca082f344f1498f0a424bf6a0b876fa51bb444e9d","observation_id":"252db8f1-7a76-4f7d-9459-7364a68e970f","resolution":{"observed_at":"2026-08-11T21:30:05.013267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:03.625396Z","title":"A short note about kinetics-","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.625396Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:bf576ac3ea3e110cd5fbe90f0379a34c7789128433e48fda9a5cedbe1666937a","observation_id":"292a12cb-914f-4042-8834-1a702a8f5ff3","resolution":{"observed_at":"2026-08-11T21:30:03.625396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:03.636348Z","title":"Tensorf: Tensorial radiance fields","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.636348Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:cd37e0cd503578102e22ff153f66fa5e92871e4bfeb15897c8c58918d3b63672","observation_id":"0da9b74b-b9b5-4420-bfa9-41350f215fa6","resolution":{"observed_at":"2026-08-11T21:30:03.636348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04202","last_updated":"2023-03-01T00:18:33Z","snapshot_observed_at":"2026-08-13T14:48:56.811001Z","submitted_at":"2022-08-08T15:08:40Z","title":"Analog Bits: Generating Discrete Data using Diffusion Models with Self-Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.04202","snapshot_observed_at":"2026-08-11T21:30:03.640968Z","title":"Analog bits: Generating discrete data using diffusion models with self-conditioning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.640968Z"},"links":{"cited_paper":"/paper/2208.04202","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:70fe1a4297868dc7b0bd4c25cf5c8052908b3a5fb90983162ecde7d7a03c1e4d","observation_id":"4d548e13-3cf5-4307-aa7d-a1ed5689ff5b","resolution":{"observed_at":"2026-08-11T21:30:03.640968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:03.646167Z","title":"3d u-net: learn- ing dense volumetric segmentation from sparse annota- tion","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.646167Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:676de525885931f1d18a3c0963d346b95bf83193ce877d611fa71e1f8428de8b","observation_id":"919f90c8-9b29-4470-bcb4-e15df0c00b7a","resolution":{"observed_at":"2026-08-11T21:30:03.646167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15807","last_updated":"2023-09-27T17:30:19Z","snapshot_observed_at":"2026-08-15T07:12:45.000333Z","submitted_at":"2023-09-27T17:30:19Z","title":"Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15807","snapshot_observed_at":"2026-08-11T21:30:03.651548Z","title":"Emu: Enhanc- ing image generation models using photogenic needles in a haystack","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.651548Z"},"links":{"cited_paper":"/paper/2309.15807","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:d7641f7314d43c267f1c5c08a42b8938f1083d8b54bd39a45718407766ab6b97","observation_id":"056dffed-8d84-4955-a67b-df1451abfcd8","resolution":{"observed_at":"2026-08-11T21:30:03.651548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:04.955486Z","title":"Ldmvfi: Video frame interpolation with latent diffusion models","venue":null,"work_id":"05712316-9062-4477-aada-4feffcde6a4d","year":2024},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.657483Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:095392ea929c1418cf1e3f45dbeee8a59f7f3b43dcb5748c3d81f628041e42e5","observation_id":"8ef58888-fdd5-49b2-81e1-ad6428c58a03","resolution":{"observed_at":"2026-08-11T21:30:04.962108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:03.662268Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.662268Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:dd43a5feb012df53c65f233cac5a26112f87ae9fc953054c1dd24aef789e4658","observation_id":"8946269b-0a5f-4905-97bb-429daa074e00","resolution":{"observed_at":"2026-08-11T21:30:03.662268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:04.926111Z","title":"Video frame interpolation: A comprehensive survey","venue":null,"work_id":"17a32b0c-27c7-4ed2-b74d-06cb5613a1b1","year":2023},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.667877Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:7e100d6b435ba70a7590e7c63c154f75da152508c37752513521c3b13f38ea05","observation_id":"915a0a3d-2d8e-47db-ba08-c64866abea16","resolution":{"observed_at":"2026-08-11T21:30:04.932701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:03.672537Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.672537Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:d24f247007158a27120b61b32144320d2c10905215c9a8ac2c3f96f3fff06363","observation_id":"4c1312d8-7e09-4380-b4ed-1010ae77c4a9","resolution":{"observed_at":"2026-08-11T21:30:03.672537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-11T21:30:03.677424Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.677424Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:36543a9811d9e846cfa0bcc9dff6fefe78d61f9a3a8e83cc0f8b8693c431f193","observation_id":"d6d89e8b-9947-4e00-ae07-5eaec08b4dce","resolution":{"observed_at":"2026-08-11T21:30:03.677424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:03.682506Z","title":"K-planes: Explicit radiance fields in space, time, and appearance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.682506Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:ee50faab3e8de9fa7185601eef89d53ccac6dc3d984a05b5ac2aeb2782fb0c08","observation_id":"680b2c94-eb65-4f5b-aa50-da2e203ccc21","resolution":{"observed_at":"2026-08-11T21:30:03.682506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-11T21:30:03.687129Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.687129Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:63fabdd0417f4c52d3e2b676defaf0c0c090e3d776de2c1e34022008b5d4f2df","observation_id":"ec7def8e-cb2a-45f5-80aa-6db2cea31c5e","resolution":{"observed_at":"2026-08-11T21:30:03.687129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-12T14:50:50.360929Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-11T21:30:03.692294Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.692294Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:e5275fbd940c8859989a796f37a51c4ebe263d34673b174852d8f6286e94421a","observation_id":"ada504c2-6454-43ac-9c76-7cd4c02c325c","resolution":{"observed_at":"2026-08-11T21:30:03.692294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:04.886740Z","title":"Photorealistic video generation with diffusion models, 2023","venue":null,"work_id":"cf099169-f343-4470-9fd5-454dd1c3fbcf","year":2023},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.697190Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:f6b6d807460866045739951fe87ab7b64545104ac546c953e72b460c45bfecdd","observation_id":"ddd0a472-6b8d-4915-97ba-73361a3e8439","resolution":{"observed_at":"2026-08-11T21:30:04.892252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:03.702493Z","title":"Latent video diffusion models for high-fidelity long video generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.702493Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:c2f689437dbefd2bf4907f828e87d0ee16feddbd62d67d0bca8b0ceaff7db1c6","observation_id":"3e6476b8-a059-42c3-99b7-b13be2bf68a2","resolution":{"observed_at":"2026-08-11T21:30:03.702493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:04.858712Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"fd83673f-1258-4822-aeee-e9637182fdfc","year":2020},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.707231Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:f730a950d51f9f9c41403309e2d3cd63756cba304ce493dbdfbd9f0c59ef45bf","observation_id":"3c6490a1-daed-47ad-8345-694d17d96753","resolution":{"observed_at":"2026-08-11T21:30:04.863702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-11T21:30:03.712385Z","title":"Imagen 9 video: High definition video generation with diffusion mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.712385Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:77124a95dead4b9050e2502b66ead1c679caa95b174e60f4290f7ebc7863c957","observation_id":"801cfd4f-9a6a-458c-a650-270d12715f80","resolution":{"observed_at":"2026-08-11T21:30:03.712385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:04.843082Z","title":"Video dif- fusion models","venue":null,"work_id":"84ebc51d-6e57-4d2f-b519-a9b007ea284c","year":2022},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.717471Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:77d882c8bba620d27022d980b54a8d5e8a626b21598d556d6e4c3509ae7e3057","observation_id":"78898a73-5e60-4ba1-9608-794b6c61d323","resolution":{"observed_at":"2026-08-11T21:30:04.848158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:04.825493Z","title":"sim- ple diffusion: End-to-end diffusion for high resolution im- ages","venue":null,"work_id":"b4773f18-399e-419e-a81b-be7a7ef96d2a","year":2023},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.723528Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:26349122c290119609391278ec009a03b843d6b92b14f1a6fe99af52f637a467","observation_id":"1b856818-4376-43aa-bc60-d19b3f88d29a","resolution":{"observed_at":"2026-08-11T21:30:04.831083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:04.806728Z","title":"Real-time intermediate flow estimation for video frame interpolation","venue":null,"work_id":"b88dc5cd-ec6c-497a-ac9b-244dc250b4d3","year":2022},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.728419Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:304924f4a0f9958cd6c6f807eb76eadd3cc422b8692835aa4468fb181de09b77","observation_id":"9362dd53-fa6a-4d1f-9d57-cec8d5f3bce2","resolution":{"observed_at":"2026-08-11T21:30:04.812209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.11972","last_updated":"2023-06-14T03:32:57Z","snapshot_observed_at":"2026-08-13T13:15:36.821586Z","submitted_at":"2022-12-22T18:55:45Z","title":"Scalable Adaptive Computation for Iterative Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.11972","snapshot_observed_at":"2026-08-11T21:30:03.733845Z","title":"Scalable adap- tive computation for iterative generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.733845Z"},"links":{"cited_paper":"/paper/2212.11972","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:d396a8194161f1f5bdbc96419761c00bae70de3113e4daf827775960902839da","observation_id":"976a8bc2-a48b-481e-b797-9d52053868cd","resolution":{"observed_at":"2026-08-11T21:30:03.733845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:04.790240Z","title":"Video inter- polation with diffusion models","venue":null,"work_id":"4392a8cf-d9ef-4f9e-8511-c212c46bc979","year":2024},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.739217Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:a5383b9a117b0fec4902e12128ee5866514970891de708237675a4b44607ad2c","observation_id":"c8ce54be-f3a3-4d1f-8a32-23131d49d0ae","resolution":{"observed_at":"2026-08-11T21:30:04.795613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:04.771274Z","title":"Video interpolation with diffu- sion models","venue":null,"work_id":"d8effb29-67a3-4e6a-a536-d637c1b92d3b","year":2024},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.743897Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:b181592985d5a61d34b5f287af6d04bb6de488715eb7df242fae083a976b6938","observation_id":"19eada01-7cd1-459b-bd51-37fe7aea1571","resolution":{"observed_at":"2026-08-11T21:30:04.776767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17128","last_updated":"2024-03-25T19:13:12Z","snapshot_observed_at":"2026-08-13T00:45:19.771152Z","submitted_at":"2024-03-25T19:13:12Z","title":"Benchmarking Video Frame Interpolation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17128","snapshot_observed_at":"2026-08-11T21:30:03.749078Z","title":"Benchmarking video frame interpolation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.749078Z"},"links":{"cited_paper":"/paper/2403.17128","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:ea8e0074f0a03a460f0386b9c400d68a9a7e00a8ffc9a4bbfd20b7d9a9d0d89d","observation_id":"ed0cd23e-6710-42dc-96e3-cac0cbe6b52c","resolution":{"observed_at":"2026-08-11T21:30:03.749078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:04.754252Z","title":"Hybrid video diffusion models with 2d triplane and 3d wavelet rep- resentation","venue":null,"work_id":"2ab26ad5-c16b-4130-891b-c2978fcaed53","year":2024},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.754098Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:8362d3f97dc25eef8a4228bc63c8ef6d3ba277a57f972e483d019b5cf11c7250","observation_id":"16e0ded2-3661-43db-b8a3-d3bd1ae3457d","resolution":{"observed_at":"2026-08-11T21:30:04.759875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-11T21:30:03.759220Z","title":"Auto-encoding varia- tional bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.759220Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:855ba2eab09451c1cadd26c91210d9142212327689379b5f16ea917b4a6fa766","observation_id":"d67c5c52-ba39-4c39-a17b-f81b38f57dc1","resolution":{"observed_at":"2026-08-11T21:30:03.759220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:04.737426Z","title":"Semcity: Semantic scene gener- ation with triplane diffusion","venue":null,"work_id":"8916ba6e-2f6c-4841-8c60-f7ffb8282bd1","year":2024},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.766452Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:df95dbf4cde3c1e1b612fb900970c82be1c938c4577cc49f803671fff473d53a","observation_id":"bcf71a2e-c152-455f-b5f9-b1154d11911f","resolution":{"observed_at":"2026-08-11T21:30:04.742631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:03.771423Z","title":"Amt: All-pairs multi-field transforms for efficient frame interpolation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.771423Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:199498a4b196322a0f7820ed519e634b9e897c7ff5f605c1439492ef41d1beda","observation_id":"4d88f02c-cbb5-42d7-93c8-b30f7f7bf6c8","resolution":{"observed_at":"2026-08-11T21:30:03.771423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17459","last_updated":"2025-04-11T12:31:07Z","snapshot_observed_at":"2026-08-14T09:18:04.526275Z","submitted_at":"2024-11-26T14:23:53Z","title":"WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17459","snapshot_observed_at":"2026-08-11T21:30:03.776579Z","title":"Wf-vae: Enhancing video vae by wavelet-driven energy flow for latent video diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.776579Z"},"links":{"cited_paper":"/paper/2411.17459","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:1a5a6e08add31d7ca760bbdf691b06c93127d795f7dce4cb0c91b8fada36db41","observation_id":"e20f972a-40a2-4087-8ac8-b9f900513c40","resolution":{"observed_at":"2026-08-11T21:30:03.776579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-08-13T21:19:07.777045Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-11T21:30:03.782354Z","title":"Open-sora plan: Open-source large video generation model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.782354Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:c8cee6ac31d134455eb188630aedaaf7824ae47b442a7f7a91e6cdbd680958b0","observation_id":"80853de7-8dda-4104-adcf-8d6a7741b96a","resolution":{"observed_at":"2026-08-11T21:30:03.782354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:04.710480Z","title":"Common diffusion noise schedules and sample steps are flawed","venue":null,"work_id":"d8cfed3b-6b1c-4f65-a262-2056d5d68ae3","year":2024},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.788060Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:3e7b755dca0b3310873ccb0f0fe301ed2df3b56657b20e3db04dc49655775de6","observation_id":"58eeaaf1-0466-4cbb-8d24-8f5a961ff568","resolution":{"observed_at":"2026-08-11T21:30:04.715688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-11T21:30:03.793892Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.793892Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:f6d6cb543f9ddf410a66716380662a2adf4ffef2513af151e6babb0715032727","observation_id":"89dd405f-52e9-498f-a10b-eb176716b5ad","resolution":{"observed_at":"2026-08-11T21:30:03.793892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-14T11:08:32.950294Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-11T21:30:03.799772Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.799772Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:c2428e60248d605ed7342c274a574f58f444264a37f54355f0ea37bd7d98174e","observation_id":"3b70a688-6960-43da-928f-3946a17155e5","resolution":{"observed_at":"2026-08-11T21:30:03.799772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:03.806000Z","title":"Gener- ating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.806000Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:c34aecadc3d864bbe4c154c083eaa4bc073767ed4ab9bd111466742402577e83","observation_id":"c779d7a1-778d-4067-961f-066afe942f17","resolution":{"observed_at":"2026-08-11T21:30:03.806000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:04.684042Z","title":"Film: Frame inter- polation for large motion","venue":null,"work_id":"90613f00-9cd6-4e6e-8fdd-7f31fabe9f88","year":2022},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.811064Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:772b0dd46e10626c0db34f96b8a4eca294d90cf300e1a1d1c10f6b617cc95f45","observation_id":"0ee18d90-2f2a-4e4d-8eab-ce93d9dc9c78","resolution":{"observed_at":"2026-08-11T21:30:04.688919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:04.667460Z","title":"High-resolution image syn- thesis with latent diffusion models, 2021, 2021","venue":null,"work_id":"b4756089-f41b-4b7c-89ca-dac0c2e397c1","year":2021},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.815511Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:5dc5fc1e561b71d136f69b87ac8dbb4fae9bf0d96b13d01c2d5eb0ab77affa5d","observation_id":"0652cc0b-39ec-47ce-9408-5143ba09a015","resolution":{"observed_at":"2026-08-11T21:30:04.673254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:03.821864Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.821864Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:bf306a968043ed57e9591c669aa60695db704cdefaae2b4ead6eb8d857ee7014","observation_id":"39daf284-1542-433c-bb7e-1efee45d9b3d","resolution":{"observed_at":"2026-08-11T21:30:03.821864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:03.827317Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.827317Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:fb71c27a340ba76beac1429b2efcfd09109ae65220f71b5a01793a4a5caa74e2","observation_id":"dd149793-971a-4dd7-bb34-f8035c81d2b3","resolution":{"observed_at":"2026-08-11T21:30:03.827317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-08-12T01:14:44.484432Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-11T21:30:03.833018Z","title":"Progressive distillation for fast sampling of diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.833018Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:a77b81e7a5c81022457ee9a74e6daa1a3d46b2de00e1e4a67e48258925349e95","observation_id":"c24de059-c635-4dea-9e8e-938683fe7d93","resolution":{"observed_at":"2026-08-11T21:30:03.833018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:04.630267Z","title":"Ryan Shue, Eric Ryan Chan, Ryan Po, Zachary Ankner, Jiajun Wu, and Gordon Wetzstein","venue":null,"work_id":"a57418e6-4f65-4748-afb4-7bd1393292cf","year":2023},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.837917Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:47e9abb303a7a820e044f0375d0cc96abc7ea425610f0f3c7886f0bd762d9fbb","observation_id":"fc48e18a-a25a-4b4c-8049-058f110e5773","resolution":{"observed_at":"2026-08-11T21:30:04.635684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-11T21:30:03.843325Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.843325Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:0c69da809111e84742ff5956017180857f3e5f69becd8df6e697f319beb0ef16","observation_id":"01088514-0af1-4035-bf64-2e370a04a4b8","resolution":{"observed_at":"2026-08-11T21:30:03.843325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-13T22:00:40.727122Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-11T21:30:03.848635Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.848635Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:b37a285fac82173733bcf0db11058deff1a6a0ae66e51592f2bbe51747aea823","observation_id":"172af5ce-4c50-4693-a9c7-856b48ed7dfd","resolution":{"observed_at":"2026-08-11T21:30:03.848635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:03.854150Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.854150Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:aac27f2dffbb8898934205004b6e8b642d1ea77917107ea36128d04471f1894b","observation_id":"d46bc2f2-ea24-488c-9762-519615c0e090","resolution":{"observed_at":"2026-08-11T21:30:03.854150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:03.859862Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.859862Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:2189df9aa49a6a06ace3cc40633e5934f862a49b44cdda9015854cffe22d3a95","observation_id":"d4ebc61a-f597-4bf0-aa69-05b2246b6621","resolution":{"observed_at":"2026-08-11T21:30:03.859862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:03.865128Z","title":"Attention is all you need","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.865128Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:4196baf159c435ed8d4f9ebc21c83e0048c2bb08e8e32f5110a4195e132b4d32","observation_id":"52817f95-b4a4-445d-a685-505eb40dbac1","resolution":{"observed_at":"2026-08-11T21:30:03.865128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:04.580999Z","title":"Phenaki: Variable length video generation from open domain textual descriptions","venue":null,"work_id":"0c59ffbe-a4af-44d8-a9f0-c06dd124e6a7","year":2022},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.870267Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:065da3b541953aba82b9b834ea2c0cb0728097108bf65122069cb271bff14151","observation_id":"9b1af98f-a6f0-4a51-867e-7489a0ae56f9","resolution":{"observed_at":"2026-08-11T21:30:04.586719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:04.562050Z","title":"Omnitokenizer: A joint image-video tokenizer for visual generation","venue":null,"work_id":"a66063f4-78fe-44d4-8b42-8051575d5318","year":2024},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.874943Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:28af3672334cb154300a7470d2931d5813dedb53c9b913e6762fa53221834c67","observation_id":"f0dbc5c7-6fb3-43ce-a36e-a3d2cadf78d2","resolution":{"observed_at":"2026-08-11T21:30:04.568768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:03.880228Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.880228Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:65c17ac1f007f03e22f597f6b74d0f242c19c4a3a6830299baf82ba555cc5572","observation_id":"7f20194b-eaa8-449b-a935-6ab099d44eea","resolution":{"observed_at":"2026-08-11T21:30:03.880228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15399","last_updated":"2024-02-21T01:25:36Z","snapshot_observed_at":"2026-08-13T11:34:10.055589Z","submitted_at":"2023-05-24T17:57:15Z","title":"Sin3DM: Learning a Diffusion Model from a Single 3D Textured Shape","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15399","snapshot_observed_at":"2026-08-11T21:30:03.885358Z","title":"Sin3dm: Learning a diffusion model from a single 3d tex- tured shape","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.885358Z"},"links":{"cited_paper":"/paper/2305.15399","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:4c3a269d656684be575454a23d0107972469b2e692380dcaa3ca5f24c8e930ca","observation_id":"acfc32a9-a8e4-4c21-9880-38064b6f6149","resolution":{"observed_at":"2026-08-11T21:30:03.885358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-11T21:30:03.892204Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.892204Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:379bae04d9d3a6c07476a4409c1533a3196a19635f475037362b5ed17547c640","observation_id":"f0648488-85b3-4d10-8001-0b30b4e4dd01","resolution":{"observed_at":"2026-08-11T21:30:03.892204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:04.534523Z","title":"Magvit: Masked generative video transformer","venue":null,"work_id":"3d2cd0fc-a532-4b37-9960-a6be51b985ca","year":2023},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.897772Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:5bce61dd0a6256b5648392a04e1cd37da6469c1d4273f973b1dc616a33aaeafc","observation_id":"b7a1ad7b-ef8a-4421-beca-78e70988da9a","resolution":{"observed_at":"2026-08-11T21:30:04.539734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-11T21:30:03.903667Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.903667Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:585bb15172cb6b5842c8e5e9e247f8078fa77ae56b061baaf6e041e8110b4f74","observation_id":"3e09ef54-2a39-4041-b5c2-ee92ba68c1e5","resolution":{"observed_at":"2026-08-11T21:30:03.903667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:04.516676Z","title":"Language model beats diffusion - tokenizer is key to visual generation","venue":null,"work_id":"a716f8b6-9563-4d86-92a0-cc3fc95ae540","year":2024},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.910211Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:42872d710f08a91401138dc100577f863e96a0f0e989da35e0628ab109481a5b","observation_id":"ef971c59-9385-43bd-8e89-e9c6f5e0118c","resolution":{"observed_at":"2026-08-11T21:30:04.522805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:03.915062Z","title":"Video probabilistic diffusion models in projected latent space","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.915062Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:5dc4f3280fb2eb9be910d010e2b6c88a26935174aa1ea4d360f31eefd5f9b933","observation_id":"a636f1e9-ef7f-48a5-8d75-9d10fbf6c495","resolution":{"observed_at":"2026-08-11T21:30:03.915062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:04.488770Z","title":"Video probabilistic diffusion models in projected latent space","venue":null,"work_id":"2f7aa350-e218-4844-b4ca-c421f953ed58","year":2023},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.919956Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:cbd3f465a257150890afbe3374a50c90850c3a87235f6adcec01201c473974b3","observation_id":"221e7fb3-0296-4240-b001-28019e484271","resolution":{"observed_at":"2026-08-11T21:30:04.493940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14148","last_updated":"2024-03-21T05:48:48Z","snapshot_observed_at":"2026-08-13T04:51:27.655213Z","submitted_at":"2024-03-21T05:48:48Z","title":"Efficient Video Diffusion Models via Content-Frame Motion-Latent Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14148","snapshot_observed_at":"2026-08-11T21:30:03.925490Z","title":"Efficient video diffusion mod- els via content-frame motion-latent decomposition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.925490Z"},"links":{"cited_paper":"/paper/2403.14148","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:3c950898c033d1e75e818f593771ae878a26305de0b0654615db31379db97ae4","observation_id":"d4d32f16-ae4c-44cc-9bc6-61362294856b","resolution":{"observed_at":"2026-08-11T21:30:03.925490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:04.471366Z","title":"Cv- vae: A compatible video vae for latent generative video mod- els","venue":null,"work_id":"8aab88ec-046e-49ec-84e8-10f5215cfd75","year":2025},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.930974Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:054dfe2963a041a716203f70c32a8d9cb47c833a416ede195d40aabd4c5ec0a6","observation_id":"b23fa786-5c1f-4aaa-8aa9-facd31e6f960","resolution":{"observed_at":"2026-08-11T21:30:04.477573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:04.435453Z","title":null,"venue":null,"work_id":"f28a394b-8e4c-4e5d-abed-206ae0cc7457","year":null},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.942929Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:2f6afc6c326a5421a05b1cf5f1a48c7dc6fab2316cea431301319c986ae43e8c","observation_id":"9ef45027-92b3-45df-a3e2-1f450dd6999e","resolution":{"observed_at":"2026-08-11T21:30:04.442723Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:04.454315Z","title":"For the video interpolation task, the autoencoder is 2 trained for 450, 000 iterations with the same batch size of","venue":null,"work_id":"8bd350a6-fc61-484b-8319-911d3b257110","year":null},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":256,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.937509Z"},"links":{"citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:e3dd30015474dc6c20b0205a0ac9b70ba8f5856d949af5e17b7ea75727eb8a83","observation_id":"e6b022e0-87ef-404b-b8cc-f93dc781bac3","resolution":{"observed_at":"2026-08-11T21:30:04.460419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.01340","last_updated":"2018-08-03T20:17:05Z","snapshot_observed_at":"2026-08-14T18:44:38.993682Z","submitted_at":"2018-08-03T20:17:05Z","title":"A Short Note about Kinetics-600","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.01340","snapshot_observed_at":"2026-08-11T21:30:03.630717Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":600,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.630717Z"},"links":{"cited_paper":"/paper/1808.01340","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:0cad2f9e55e38c98c099b2912cfe38bdd6886062f9b57fc6234cfcadb958e611","observation_id":"25b2559b-ba51-4350-9f14-9132c51ec185","resolution":{"observed_at":"2026-08-11T21:30:03.630717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T13:17:22.592181Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2412.04452."}