{"as_of":"2026-08-15T22:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:47d89170e9df3982d32a39087fe1a8a76f6c37ba290a9503ae7d6c8d39b3b52a","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:20:15.177498Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:16:07.523981Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-10T05:30:23.456663Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-10T05:30:23.456663Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17726","snapshot_observed_at":"2026-08-07T05:47:17.395406Z","title":"Vidtwin: Video vae with decoupled structure and dynamics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07136","last_updated":"2025-06-08T13:30:11Z","snapshot_observed_at":"2026-08-09T23:29:32.319934Z","submitted_at":"2025-06-08T13:30:11Z","title":"Hi-VAE: Efficient Video Autoencoding with Global and Detailed Motion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:17.395406Z"},"links":{"cited_paper":"/paper/2412.17726","citing_paper":"/paper/2506.07136"},"observation_digest":"sha256:ab911642db7ec727d23d93bffc8b8f2db62c148faa4bb528b526d6cb319b40cd","observation_id":"abf58d5f-9249-463d-8ac4-8bed29cccf68","resolution":{"observed_at":"2026-08-07T05:47:17.395406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"cited_work":{"arxiv_id":"2412.17726","doi":"10.48550/arxiv.2412.17726","metadata_source":"pith","pith_arxiv_id":"2412.17726","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","venue":"cs.CV","work_id":"b2d90e1c-0508-4014-b22e-dff5270cd25d","year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-15T15:00:20.346279Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.101777Z"},"links":{"cited_paper":"/paper/2412.17726","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:be117d64881d953f7e9fba9210634d6bcce4926a1f678b9e3fdd10fb8894f379","observation_id":"ef828168-849f-4259-8d45-f7f2490571e5","resolution":{"observed_at":"2026-08-06T18:10:15.572551Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17726","snapshot_observed_at":"2026-08-14T04:16:07.523981Z","title":"Omnitokenizer: A joint image-video tokenizer for visual generation.Advances in Neural Information Processing Systems, 37:28281–28295, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T21:17:57.338891Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.523981Z"},"links":{"cited_paper":"/paper/2412.17726","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:141a0ac77d7651cebcd7f82a9eb229e257e0cd9172245b950979d3f45904d80d","observation_id":"c0fc0f33-5340-4164-8dc2-b8294f5720c0","resolution":{"observed_at":"2026-08-14T04:16:07.523981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.17726/citation-record","integrity":"/paper/2412.17726/integrity","json":"/paper/2412.17726/citation-record.json","paper":"/paper/2412.17726"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.849226Z","title":"Lumiere: A space-time diffusion model for video generation, 2024","venue":null,"work_id":"f4cd2c04-9a2d-44cd-8d4f-39c5002f9b8e","year":2024},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.833300Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:f4cb0169d003c066929385dcabba18e7a71295a2e222656a67586b76955c48d8","observation_id":"8a51b4b6-f82f-4d7f-b317-1a0eb6b7b637","resolution":{"observed_at":"2026-08-11T05:20:15.853191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:14.837783Z","title":"Is space-time attention all you need for video understanding?,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.837783Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:6c1a52e8e2da8b0b2b0626bf7fa4d8ba6dce6faf7d743697f571dcf363956300","observation_id":"30d6ea7a-aead-4b23-a065-0511bdb92929","resolution":{"observed_at":"2026-08-11T05:20:14.837783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:14.841446Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.841446Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:0af92b43fe0c00c23925f3e6fb355f305d5244c584cec09c2250cff6e7527f90","observation_id":"939985a1-b585-43e3-9ab6-fefbafdc4aef","resolution":{"observed_at":"2026-08-11T05:20:14.841446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.824690Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models, 2023","venue":null,"work_id":"f500eaf7-ad4a-4e9d-b3ff-81ab22dc0449","year":2023},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.845203Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:df919cefe28c8d124f622ce08c54c5f877ce98f746e9b6cdb653364a932404ef","observation_id":"d2eef4d4-36a9-40b1-a6ea-a63e82f60e8a","resolution":{"observed_at":"2026-08-11T05:20:15.828952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:14.849034Z","title":"Pixart-α: Fast training of dif- fusion transformer for photorealistic text-to-image synthesis,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.849034Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:a370244544ee10b4486026780c452e389af8573b5319cd1cee428e50419ea7c3","observation_id":"980c2f6a-7b27-4840-ab6d-b60eaa290259","resolution":{"observed_at":"2026-08-11T05:20:14.849034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.804782Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation, 2024","venue":null,"work_id":"4198f946-81ed-4081-a283-1cafc377de38","year":2024},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.852749Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:b168e20be109797a085d311444c4c8cdbe12060d970b12f75e3a8a06534c5162","observation_id":"cb0d2dec-3db4-4df9-b48c-670b8462b578","resolution":{"observed_at":"2026-08-11T05:20:15.809393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.792567Z","title":"Od-vae: An omni-dimensional video compressor for im- proving latent video diffusion model, 2024","venue":null,"work_id":"dfdf1520-175d-4b9e-8233-5f2e24869e38","year":2024},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.856343Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:53130e26a1f6a10aed2d3a8d8012ae84272b97d4bb8edfe528209b8783cd30ac","observation_id":"750ba4ef-76fb-4dab-812e-639e7d5dcd1c","resolution":{"observed_at":"2026-08-11T05:20:15.797126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.778030Z","title":"Taming transformers for high-resolution image synthesis, 2021","venue":null,"work_id":"a681733d-1dea-42bd-b9ac-32f9fb814642","year":2021},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.860340Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:36509a2678c1bb0592c1f11df659bd95f424365912584f2f33e111e7068d4106","observation_id":"4d5d1d0a-8ddd-4672-975a-c0a0b3bbf3d6","resolution":{"observed_at":"2026-08-11T05:20:15.781948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:14.863936Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.863936Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:4692fa08e20715368ebf526aa6966fac3266cef636acbe34641809aac41e04c5","observation_id":"d699f7fd-9bbd-415c-958b-8c504c887a79","resolution":{"observed_at":"2026-08-11T05:20:14.863936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.757994Z","title":"Long video generation with time-agnostic vqgan and time- sensitive transformer, 2022","venue":null,"work_id":"dfb78e54-40de-416c-8e92-8de1158c0798","year":2022},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.867316Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:124ab3d7f959e363fc0c97632b8459381c74aab82edb92d0324fb803deb22bd9","observation_id":"efee463a-179c-40b3-9e4b-37ce0ec7c838","resolution":{"observed_at":"2026-08-11T05:20:15.762397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.745282Z","title":"Maskvit: Masked visual pre-training for video prediction, 2022","venue":null,"work_id":"4d0be39a-55c0-469f-aeba-dce80513bdef","year":2022},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.871468Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:c38740986839da713aeece142582ce354a76a8099ce8146e0392d1768b3fba2c","observation_id":"13b4bfdb-4174-4c7c-9044-17e10ffb8402","resolution":{"observed_at":"2026-08-11T05:20:15.749581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.733962Z","title":"Gaia: Zero- shot talking avatar generation, 2024","venue":null,"work_id":"aed0d955-4a6a-45fd-8568-34326d487245","year":2024},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.874515Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:db2bbc480ca93a7dfb86d677a995414fe456e7454d0c6ecd2f289746a74a796e","observation_id":"22e6ec2a-5d76-49bf-bcb7-d0e3395697c4","resolution":{"observed_at":"2026-08-11T05:20:15.737987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.722864Z","title":"Latent video diffusion models for high-fidelity long video generation, 2023","venue":null,"work_id":"c0393c24-629b-487b-be97-69618333d116","year":2023},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.877971Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:a12892fa358d6f8abb66ae73f6997c9e6293f7c4c1bf7c90a8fee1905ecd77ff","observation_id":"6a815379-8151-4e1c-b1ff-8546141cf11b","resolution":{"observed_at":"2026-08-11T05:20:15.726603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.711772Z","title":"Classifier-free diffusion guidance, 2022","venue":null,"work_id":"30553997-e597-4abc-8721-9662b86bc8de","year":2022},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.881304Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:2f971c05b449d08a91ca2daeff9e59ac19ec8cd02e0c221e12bc98fe7081dab0","observation_id":"cc329618-d09e-4155-b6d9-3801ce893388","resolution":{"observed_at":"2026-08-11T05:20:15.715863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.699924Z","title":"Denoising diffu- sion probabilistic models, 2020","venue":null,"work_id":"afffeff8-1dcc-47ca-aaa8-aea9343555c6","year":2020},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.884748Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:fd76df3896ae1d088c3928576f7030f4435c3d267eaa427429da375dbed25f38","observation_id":"9a5eca5c-96dc-49aa-8ed2-5b40b5dbfbb3","resolution":{"observed_at":"2026-08-11T05:20:15.704214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.686246Z","title":"Kingma, Ben Poole, Mohammad Norouzi, David J","venue":null,"work_id":"1e479035-63e0-4d8c-98f0-940dd98dbaa0","year":2022},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.888244Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:6a12908da2bc9589ef95eb7010ae15504fa77a1174807288907da0d7b2f11520","observation_id":"5817e66a-784b-44d6-a5b1-96bb176da9db","resolution":{"observed_at":"2026-08-11T05:20:15.691580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.673236Z","title":null,"venue":null,"work_id":"b85d3271-4615-4eaf-a5c6-a982ec42505d","year":2022},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.892694Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:f3c62034c3d404e21a1dc0e3bb6c8753d1d7edf356092b60302b4bca117e9180","observation_id":"3bdea22d-7a28-4964-ab87-2f792ddb7244","resolution":{"observed_at":"2026-08-11T05:20:15.677462Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:14.896687Z","title":"Image quality metrics: Psnr vs","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.896687Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:3bc00c82c76dc143bba0fbdfaacc95c6c7f3d73d229328d7b49dc59cc5e022a5","observation_id":"b7084fb8-1a02-47d7-8ede-a0f0cea68e7f","resolution":{"observed_at":"2026-08-11T05:20:14.896687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.655815Z","title":"Dive: Dit-based video generation with enhanced control, 2024","venue":null,"work_id":"1583f5a5-9a7c-49ae-8df8-a638dc78919c","year":2024},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.900677Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:6956cbfd6c0afbfb02f44a60b10f6dbe869de8f43cb6c7186553414ea8358c2a","observation_id":"a4262265-11ba-48d2-82e6-473c74470020","resolution":{"observed_at":"2026-08-11T05:20:15.659864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.644502Z","title":"Video-lavit: Unified video-language pre-training with decoupled visual-motional tokenization, 2024","venue":null,"work_id":"6d6146c7-0e3c-41c3-ac23-ddee6f59fd22","year":2024},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.904194Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:d55b3c9b0b6149814927dd34fe5a9bd27fce2ae1242d059a5d57caa6f4bc6094","observation_id":"cb2d66d6-ce0b-47b0-97a8-8a025b5a5259","resolution":{"observed_at":"2026-08-11T05:20:15.648763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.633195Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"9ea4c027-6549-41f5-be65-8c234ad0c5f2","year":2017},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.908332Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:a3d4db7db074b0a09cfd54f2da5edec4d8ba0ce98a0648d8ebc7994dc63b2ba6","observation_id":"423a01fb-3249-47f8-bdad-d8586f9bae21","resolution":{"observed_at":"2026-08-11T05:20:15.636751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.622685Z","title":"Auto-encoding varia- tional bayes, 2022","venue":null,"work_id":"0bdc818f-96ea-4a38-a298-74f8f5cba025","year":2022},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.911730Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:60068417eb83d212d7b634dc22470240c835cb56297afce4a9ea2364c0d11eeb","observation_id":"455d1cb4-25aa-493a-b752-b233614df139","resolution":{"observed_at":"2026-08-11T05:20:15.626363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.610466Z","title":"Mpeg: A video compression standard for multimedia applications","venue":null,"work_id":"a2be8336-22fe-4113-87e3-1a3b78671bbf","year":1991},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.914950Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:e1473e49684e6fb25c48e36bf4a1803b17ba77aef7bca2f0d72b68d946e4a23a","observation_id":"8f0fb8fa-0c4a-43da-903d-3a7751493cea","resolution":{"observed_at":"2026-08-11T05:20:15.614945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.598964Z","title":"Disentangled motion modeling for video frame interpolation, 2024","venue":null,"work_id":"74809fdb-38d0-406e-9ff4-49da6286518e","year":2024},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.918319Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:3ba0c8edb46b1c0f446031144683d7fe6125b04ebc62e439350db46e8fb8248c","observation_id":"9de07438-a2cb-4fb5-b457-f70e028a892c","resolution":{"observed_at":"2026-08-11T05:20:15.603104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.585781Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models, 2023","venue":null,"work_id":"58eee423-bbfb-4c7c-b47d-832cad129fcd","year":2023},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.921385Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:49104f34f4ca7faa90b2e33aad7698c2a1a81db8fad61e039cf1fae719bd03bb","observation_id":"052ce252-8499-4549-a593-102c8f8c9028","resolution":{"observed_at":"2026-08-11T05:20:15.591056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.574504Z","title":"Wf-vae: Enhancing video vae by wavelet-driven energy flow for latent video diffusion model, 2024","venue":null,"work_id":"577fb138-001f-44b7-9f0f-c7e28b0948d5","year":2024},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.924690Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:1f018dba1dc4465bc3f47a8e6ea8d4b58c56510a186b5122653d33fea2b196e6","observation_id":"924c9bcf-4a3a-45d8-a213-923bbb3b3393","resolution":{"observed_at":"2026-08-11T05:20:15.578327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.563947Z","title":"Open-sora plan: Open-source large video generation model, 2024","venue":null,"work_id":"44ed8d97-dcda-4efd-a1ca-6bed9e4b5c35","year":2024},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.928859Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:f9136b30943676826d6c801ea80daf25dbb10c07e38f05fa63ce913c2cf482c3","observation_id":"bd3a3ad6-4eda-4771-9c63-771799d62655","resolution":{"observed_at":"2026-08-11T05:20:15.567787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.552456Z","title":"Finite scalar quantization: Vq-vae made simple, 2023","venue":null,"work_id":"77adfe63-44e0-422b-9627-d7e7a32c950b","year":2023},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.932598Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:b8489b85923914478411630d695127ddc9e0921a9f4d051b799be5ce0d075f5f","observation_id":"87ad3afc-bb50-4f2d-b28f-78a0058a8530","resolution":{"observed_at":"2026-08-11T05:20:15.556722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.541395Z","title":"Video generation models as world simulators","venue":null,"work_id":"eeb0806c-26aa-4ea2-842e-e05ecfc5a1b0","year":null},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.936454Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:a0d3dc371294cfa11f09e8a36a961ba16a2abe3caa29af0b37877ac07c600256","observation_id":"e510d70c-295b-438a-b4cd-be509f36a39e","resolution":{"observed_at":"2026-08-11T05:20:15.545131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.528085Z","title":"Scalable diffusion models with transformers, 2023","venue":null,"work_id":"bb50b400-6e6a-44e2-a8c2-6b98a0b8ab07","year":2023},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.940095Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:44703600408c2ad88bced7841cf216fea9271e5aa01152f6edfc92bd49f9c71e","observation_id":"173455d7-a39f-4480-b391-802264b326a1","resolution":{"observed_at":"2026-08-11T05:20:15.532675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:14.943702Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.943702Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:f6979ba46571add797857b85c46b7cf36bb2cc7cae9c64c24eb76dfc4eac1c63","observation_id":"ad9038f8-7450-447d-81e5-5dc39d72f040","resolution":{"observed_at":"2026-08-11T05:20:14.943702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:14.947305Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.947305Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:6094fe35f78ba90da8d6cca6a6fc786215a9ccd375c2d2bcbad5a57170401278","observation_id":"6643c645-fc39-491d-8589-c90136903690","resolution":{"observed_at":"2026-08-11T05:20:14.947305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:14.950692Z","title":"U-net: Convolutional networks for biomedical image segmentation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.950692Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:c3c3ffecaa2e6efbacf60e094baf27b01c441263550065cc2babb92ed959ac5e","observation_id":"37570def-13f5-445f-892b-59827a87c91f","resolution":{"observed_at":"2026-08-11T05:20:14.950692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.499558Z","title":"Adversarial diffusion distillation, 2023","venue":null,"work_id":"bc7920e2-61dc-415e-8268-20464ce373d0","year":2023},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.954196Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:6230d611de006c5f47ea0a2680ba6918f3485e5089310b22fc81920bad798540","observation_id":"51ee7803-ea9c-44c0-abdc-a0cd568b579f","resolution":{"observed_at":"2026-08-11T05:20:15.503772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:14.957686Z","title":"Motion-i2v: Consistent and controllable image-to-video generation with explicit motion modeling, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.957686Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:0d18dee538d81231324174d5e961064d07195cc2937b9f841f42f2e821ea1068","observation_id":"fe8ac751-be3d-49fb-970b-7726cbe6aedc","resolution":{"observed_at":"2026-08-11T05:20:14.957686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.480472Z","title":"Make-a-video: Text-to-video generation without text-video data, 2022","venue":null,"work_id":"96a39b8b-5ec7-4e8b-955a-4f1b1254b78a","year":2022},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.961306Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:e1c770b5845c6eb35400f690011d7afee74f2bb4568a0134a391e1001b7774f9","observation_id":"97e5951a-f6f9-429e-b587-3d0f9f4bab8a","resolution":{"observed_at":"2026-08-11T05:20:15.485294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.467529Z","title":"Denois- ing diffusion implicit models, 2022","venue":null,"work_id":"fa3b1d57-2d2c-4f73-a9bb-b97001c40c41","year":2022},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.965558Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:aef6a1e648e4d3f63a083118335382eb10ec26eb2040de2912286a2db7f98374","observation_id":"5580f9b1-ae07-4cc5-a575-7fd1d4940c33","resolution":{"observed_at":"2026-08-11T05:20:15.472440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.456356Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild, 2012","venue":null,"work_id":"22fe4157-6c28-4550-986a-b7ba07ea4557","year":2012},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.968894Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:a034fed0548454a3a5d7cb8956ef53905ba2710292913840ac4657c37675dc59","observation_id":"d6b1eed6-8857-47d4-a42f-bab53e265fea","resolution":{"observed_at":"2026-08-11T05:20:15.460313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-15T00:47:48.682708Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13061","snapshot_observed_at":"2026-08-11T05:20:14.972158Z","title":"Vidtok: A versatile and open-source video tokenizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.972158Z"},"links":{"cited_paper":"/paper/2412.13061","citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:0d67ed064952197072d01f1009f3ac6010edde4c625c0acb416fa6bc5d138bda","observation_id":"85fa5572-3bdd-41d3-ba03-3cfb56585fa4","resolution":{"observed_at":"2026-08-11T05:20:14.972158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:14.976149Z","title":"To- wards accurate generative models of video: A new metric & challenges, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.976149Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:ca012dc6097032ed84b9cae336a0ad8db2ed40055847ad7a89d5bce2db7b07e0","observation_id":"19ea52da-1ee8-453c-b874-64c470e31fc4","resolution":{"observed_at":"2026-08-11T05:20:14.976149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:14.979847Z","title":"Neural discrete representation learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.979847Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:6b04013069bc46f6ea93c0ba216db16c7c3c1041bf7d40b7ee8ca5941731e832","observation_id":"d9876e47-d21f-4e97-a5f6-1c5cacd4a381","resolution":{"observed_at":"2026-08-11T05:20:14.979847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.430479Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"9a160b48-a741-4041-ad20-5844b2f79137","year":2023},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.983668Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:aebe772faf8ae53ca2f6fe57309f0cb50dc0fbb187fe57f46fe08bb85d32bf3f","observation_id":"d987cf8c-d8e6-4114-9d4d-f3c0598db836","resolution":{"observed_at":"2026-08-11T05:20:15.435576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.417396Z","title":"Phenaki: Variable length video generation from open domain textual description, 2022","venue":null,"work_id":"5a443447-bb5e-4a15-b349-b7b4ed3da3d3","year":2022},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.986907Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:d5bc424a4e68ae680fdfb5a4c3125a5c4b1b656323163c8678b101b50ec2ed0c","observation_id":"ca92a608-5a65-4c86-9430-df41fdc0d127","resolution":{"observed_at":"2026-08-11T05:20:15.421657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.406133Z","title":"Mcl-jcv: a jnd-based h","venue":null,"work_id":"3a031a3f-7f8a-4e74-8cbf-d45e79e240b7","year":2016},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.990360Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:2dc7d2f42f355e4e29385b56875bf56093bb6d848d2b2be103bbd869fab7238f","observation_id":"807e9664-9048-4004-b4f8-8fcc69693e8c","resolution":{"observed_at":"2026-08-11T05:20:15.410180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.394623Z","title":"Bevt: Bert pretraining of video transformers,","venue":null,"work_id":"6676900e-9a07-4b3b-bed3-5693722f439d","year":null},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.994040Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:29e1c2dbc33260632b653115a41bb0816501abab559322305c04234950425085","observation_id":"7de20dd2-15e5-4a32-8ee6-42a7acf73a27","resolution":{"observed_at":"2026-08-11T05:20:15.398791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.383220Z","title":"Emu3: Next-token prediction is all you need, 2024","venue":null,"work_id":"65173632-a8a4-4165-9e04-2d49ae344f86","year":2024},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:14.997845Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:bb3e86ec2c11a6086b27c7cb485bc42786bd749c6ac12976c5715d503c541a8d","observation_id":"9f6493ea-3575-49f0-a9dd-a49a5b66912f","resolution":{"observed_at":"2026-08-11T05:20:15.387109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.372550Z","title":"Instructavatar: Text- guided emotion and motion control for avatar generation,","venue":null,"work_id":"04be35d7-ba74-4be3-8400-5232fcaca458","year":null},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:15.002566Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:2a8d42101fdba531ea1a8c86505bc5f6cb244ed77c218c8ff335554dffdda9e1","observation_id":"6290c8bc-e4ca-4e51-b91b-6673e02eda3e","resolution":{"observed_at":"2026-08-11T05:20:15.376176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.007189Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:15.007189Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:92223a1af2e990eb2ff9965032c272a176f9035ba540c076e816836b2db57fc2","observation_id":"795e550f-68be-4473-b774-9977d0adb0a3","resolution":{"observed_at":"2026-08-11T05:20:15.007189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.012795Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:15.012795Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:f99311487a094c135785105b5915094fa5b043b605fb76b3ef343f47b93df5f7","observation_id":"74505f1e-79ca-43f0-bd80-31a878d1698e","resolution":{"observed_at":"2026-08-11T05:20:15.012795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.350363Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and genera- tion, 2024","venue":null,"work_id":"c6214c07-03e6-4cf2-b450-3c0ec89bfea3","year":2024},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:15.018731Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:d7c06652714a76ae3051b56d39e52c01ee5bdaebc0cd9c3d8db73fafcaad3aab","observation_id":"5c843c61-c080-42dc-86c6-f7357543a426","resolution":{"observed_at":"2026-08-11T05:20:15.354098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.339633Z","title":"ivideogpt: Interactive videogpts are scalable world models, 2024","venue":null,"work_id":"91569475-0214-413b-93e5-42094c337d14","year":2024},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:15.023218Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:116939bdae8692adce103c9951e7ddf2392c756a5a10f4911922e55ab5053cf4","observation_id":"03644ed3-7253-4b81-aa0c-fc0cb8e1b16e","resolution":{"observed_at":"2026-08-11T05:20:15.343791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.328822Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":"29df7920-24a4-4e91-a725-4303af661c4b","year":2023},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:15.027510Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:0095fe08afb1a6d28ee1eb3793538fef6f7dfd438bcfb19addc345f797985030","observation_id":"1c4b000f-6b2b-4dc8-8f70-c2d6a6fe5f46","resolution":{"observed_at":"2026-08-11T05:20:15.332469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.318791Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer, 2024","venue":null,"work_id":"5e9891c6-b105-4769-be5f-9510e6306bd7","year":2024},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:15.031917Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:37e3873ec3d97e0b7052f4174a39c29dc899d29849aa5923e2a1eb70b99fd495","observation_id":"8fe3a8d6-92aa-4ce5-963c-5cbf606de626","resolution":{"observed_at":"2026-08-11T05:20:15.322537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.036343Z","title":"Vector-quantized image modeling with improved vqgan, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:15.036343Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:d8842e1eb1e587a03b95756351065aef5d99013d97b2024418db40de9b375822","observation_id":"dda1ea4e-8b0b-4d2f-a6fe-193a372632fc","resolution":{"observed_at":"2026-08-11T05:20:15.036343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.299280Z","title":"Hauptmann, Ming- Hsuan Yang, Yuan Hao, Irfan Essa, and Lu Jiang","venue":null,"work_id":"8aeb1931-34f0-480d-91e1-43760eb33929","year":2023},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:15.040599Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:a1b6c57c04f2a203832ec65f9bd2b38d05710e8d8fe69de1df56b6dfcd4b6099","observation_id":"7a3dfeba-01ee-499e-b89e-8fd5b3249106","resolution":{"observed_at":"2026-08-11T05:20:15.303409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-11T05:20:15.044896Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:15.044896Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:3c21faa3122539856579b9e4f3fce7c7f8b7544a424eea34286d9f7c62ed3ac9","observation_id":"4acacae4-5516-4dec-8315-c1db71da2988","resolution":{"observed_at":"2026-08-11T05:20:15.044896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.286128Z","title":"Make your actor talk: Generalizable and high-fidelity lip sync with motion and appearance disentanglement, 2024","venue":null,"work_id":"48eabf5b-4e53-4ac5-8420-49929383471f","year":2024},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:15.049116Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:3b2d71b86e3165bd5fc3d93159d00caf3bc82bb08bad293176d17fa304249231","observation_id":"d1bcb5cb-a46b-4c0b-9509-f74b5073fe01","resolution":{"observed_at":"2026-08-11T05:20:15.291433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.274814Z","title":"Efficient video diffusion models via content-frame motion-latent decomposition, 2024","venue":null,"work_id":"d068d675-b0b9-4a61-97c2-a300288b5771","year":2024},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:15.053058Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:c87d1fed11af53620e64e5e10894f3c22f45018b6900a5970009cbc6d69432d3","observation_id":"1347ab3e-fe86-4e52-8d7b-cd36406f7d22","resolution":{"observed_at":"2026-08-11T05:20:15.278532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.056332Z","title":"Efros, Eli Shecht- man, and Oliver Wang","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:15.056332Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:92c8aa2ae9ef21431ce6a779d4cefab6315d7821cd62be619d3f6d1ef56ea066","observation_id":"dfd38271-7304-4290-8088-3d54a0da7dda","resolution":{"observed_at":"2026-08-11T05:20:15.056332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.256511Z","title":"Video in-context learning: Autore- gressive transformers are zero-shot video imitators","venue":null,"work_id":"7d589550-153a-4452-b63a-98befd99707c","year":2025},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:15.059760Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:5607e08c17dde3c65724286fdfdccc1fbbb3904c6c300e972dbdf3a9a1459bd5","observation_id":"e66641f7-ee8c-470f-b8f1-6105676630a9","resolution":{"observed_at":"2026-08-11T05:20:15.261125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.244463Z","title":"Cv-vae: A compatible video vae for latent generative video models,","venue":null,"work_id":"a37a2733-e22d-41ed-8d70-b786bfc1fe4b","year":null},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:15.173588Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:a69db554648321767055457e812a759924125dfcf738ed90a0fbceeaaf1027ac","observation_id":"c4fa64eb-468e-42b6-ad53-0923e4ad0126","resolution":{"observed_at":"2026-08-11T05:20:15.248414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:20:15.231133Z","title":"Open-sora: Democratizing efficient video production for all, 2024","venue":null,"work_id":"f95ab177-6e61-42a0-946f-68bc0080cede","year":2024},"citing_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:15.177498Z"},"links":{"citing_paper":"/paper/2412.17726"},"observation_digest":"sha256:1f18253a21f534c08ffbf28549a1eaa1691711537a44270edf367b01c66dc1ef","observation_id":"b91d5f28-1d4c-458a-96e9-693274ea7182","resolution":{"observed_at":"2026-08-11T05:20:15.237026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":44},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 3 inbound Pith citation observations for arXiv:2412.17726."}