{"as_of":"2026-08-14T10:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1f2625cfa80e44724ddee28f2e3130bae59b749f05e625aa7ec901afd9c4ea0a","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T12:12:57.852352Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:01:07.730833Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T14:01:15.907000Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"cited_work":{"arxiv_id":"2412.14531","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14531","snapshot_observed_at":"2026-08-07T14:01:15.907000Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","venue":"cs.CV","work_id":"3e11a6fb-fa75-43c0-b233-90fff8b33f5b","year":2024},"citing_paper":{"arxiv_id":"2505.20255","last_updated":"2025-07-07T17:56:30Z","snapshot_observed_at":"2026-08-14T10:03:15.306691Z","submitted_at":"2025-05-26T17:32:10Z","title":"AniCrafter: Customizing Realistic Human-Centric Animation via Avatar-Background Conditioning in Video Diffusion Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:01:07.730833Z"},"links":{"cited_paper":"/paper/2412.14531","citing_paper":"/paper/2505.20255"},"observation_digest":"sha256:41c74caa683ffea9a6f5c1e9dbaca4ce84458dae364976fe9ee4c594d2fd2f2c","observation_id":"0f079b54-9d7d-445d-87a1-b775d3881250","resolution":{"observed_at":"2026-08-07T14:01:15.969353Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.14531/citation-record","integrity":"/paper/2412.14531/integrity","json":"/paper/2412.14531/citation-record.json","paper":"/paper/2412.14531"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.467958Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.467958Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:03ab5ce5e047c867f2a82ec5dbeb2f65802c3cae848be849d15dd9f4a456402b","observation_id":"3b3fa548-3614-4917-972a-201c47a0543c","resolution":{"observed_at":"2026-08-11T12:12:57.467958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.944872Z","title":"Conditional gan with discriminative filter generation for text-to-video synthesis","venue":null,"work_id":"50df112c-b2a0-4426-9b6a-9bba9228d6ca","year":2019},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.474392Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:7a99320188ec125b26952c25ed28bdd244de9ff7eefbe25e3e5fe0cf8eab9c89","observation_id":"7c98eda0-28c9-4fb1-b6d4-8f0687717af6","resolution":{"observed_at":"2026-08-11T12:12:58.949517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.930172Z","title":"Person image synthesis via denoising diffusion model","venue":null,"work_id":"a0a6de96-90a8-458e-8436-73876aee0fce","year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.479824Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:c79e989d55f29b41e063552c492c8eb82e94d056b89c7eab91870109c50ed67e","observation_id":"2e544546-efc6-4a21-ac5b-7542beb296fd","resolution":{"observed_at":"2026-08-11T12:12:58.934811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T12:12:57.484538Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.484538Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:842e788d9879445b4bb034a65ec40f887517b71316f5a806af7c7f996b4def5c","observation_id":"9284ef0c-32c4-4670-a428-b1302cb584d7","resolution":{"observed_at":"2026-08-11T12:12:57.484538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.489686Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.489686Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:7292e1f1fa1adfd2652471af0f80d7c691789b46df3b8dea372d64a407252a8e","observation_id":"cc85ddcb-6443-4253-b2a3-3e8b7b6ba01f","resolution":{"observed_at":"2026-08-11T12:12:57.489686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.903302Z","title":"Masactrl: Tuning-free mutual self-attention control for consistent image synthesis and editing","venue":null,"work_id":"6b80472b-165b-4e7b-8ffa-ee8a6a2dc923","year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.494623Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:3a7790ca4362a74352cb212b983dc528b8065acbd573ae104f838a9306be9165","observation_id":"1f26b371-e4cc-4f7a-86b9-d59785843cf7","resolution":{"observed_at":"2026-08-11T12:12:58.908486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.499471Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.499471Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:ece834693ee402ec8cd8acf06e18e8df083c04ffa149c7d5ae4f4f373791d914","observation_id":"59bc1fd1-ad4f-419a-a1fc-89303724cb57","resolution":{"observed_at":"2026-08-11T12:12:57.499471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.877070Z","title":"Pix2video: Video editing using image diffusion","venue":null,"work_id":"50af07af-0437-4787-86d3-6dd12155bd39","year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.504915Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:2a751bc23c71da1f2f8f36a2ee4cfb50e29c70363fc8bd2cbcd364e0b9c71cd3","observation_id":"2d63673b-2c57-4917-807a-535f1073b804","resolution":{"observed_at":"2026-08-11T12:12:58.882431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.861866Z","title":"Everybody dance now","venue":null,"work_id":"95bd3b32-8902-47ac-81dc-ce0f513451f4","year":2019},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.510099Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:0e8c4927d3e072320b770ab5ce01f0257db9e940eb54754ee079c76462668d34","observation_id":"5e465f6e-f97a-42ce-a0a6-b3eeca7a5784","resolution":{"observed_at":"2026-08-11T12:12:58.866637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12052","last_updated":"2024-05-05T05:07:34Z","snapshot_observed_at":"2026-08-13T05:22:44.450942Z","submitted_at":"2023-11-18T10:22:44Z","title":"MagicPose: Realistic Human Poses and Facial Expressions Retargeting with Identity-aware Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12052","snapshot_observed_at":"2026-08-11T12:12:57.514833Z","title":"Magicdance: Realistic human dance video generation with motions & facial expressions transfer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.514833Z"},"links":{"cited_paper":"/paper/2311.12052","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:e1cc167cfce9443c62a344ae2e34c61a84f633103417199161821f04230dae59","observation_id":"3f060444-2005-487e-ab23-b1aa34d35a10","resolution":{"observed_at":"2026-08-11T12:12:57.514833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09481","last_updated":"2024-05-08T03:21:34Z","snapshot_observed_at":"2026-08-13T10:53:07.664749Z","submitted_at":"2023-07-18T17:59:02Z","title":"AnyDoor: Zero-shot Object-level Image Customization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09481","snapshot_observed_at":"2026-08-11T12:12:57.520283Z","title":"Anydoor: Zero-shot object-level image customization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.520283Z"},"links":{"cited_paper":"/paper/2307.09481","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:2c46f9ed15254a8e008ebe16d6c3db4888b889d7c3b5ed1ee36ffd10c9a5abe9","observation_id":"bb6a13b1-01ba-4697-9709-12e96132e3fd","resolution":{"observed_at":"2026-08-11T12:12:57.520283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.847584Z","title":"Viton-hd: High-resolution virtual try-on via misalignment-aware normalization","venue":null,"work_id":"c82910e0-d1e3-452b-bd77-2b54749c44bc","year":2021},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.525417Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:ee338b88d40d76a34693039ab2a82f52c9476d4141c70dae4ea2d04100e11144","observation_id":"9d1bc5b7-2916-4ab2-9cb2-551fbda36462","resolution":{"observed_at":"2026-08-11T12:12:58.852005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05139","last_updated":"2024-07-29T09:15:33Z","snapshot_observed_at":"2026-08-13T01:07:48.543251Z","submitted_at":"2024-03-08T08:12:18Z","title":"Improving Diffusion Models for Authentic Virtual Try-on in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05139","snapshot_observed_at":"2026-08-11T12:12:57.530350Z","title":"Improving diffusion models for virtual try-on","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.530350Z"},"links":{"cited_paper":"/paper/2403.05139","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:9c91481138e5fbd8cb0b9c09f6b8c314e896d2a27cd39682310bf2a781ad4a52","observation_id":"e59961be-d43d-4767-8a46-756c8cf9943c","resolution":{"observed_at":"2026-08-11T12:12:57.530350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.535753Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.535753Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:d06688db86b9340edee34ca4dc75bc0cc1299c89e517ce85e8147f00324e943b","observation_id":"33df9dfc-58cc-4215-92d3-ff04f2c1a4af","resolution":{"observed_at":"2026-08-11T12:12:57.535753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.540253Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.540253Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:620e9abb8739d8f46843ba11a22fc255176b63b9088d81e5d0c6c6b3ca7d757c","observation_id":"febfb330-8dd7-4f7b-ac35-33629bbfa28e","resolution":{"observed_at":"2026-08-11T12:12:57.540253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-11T12:12:57.544680Z","title":"An image is worth one word: Personalizing text-to-image generation using textual inversion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.544680Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:f6d1a7787a55ad0bb09821130f59ea0dc8b996f4fb6ccad0388cefe1fdeb5b25","observation_id":"920ae04d-f9bf-4923-87c7-4f4490c4943a","resolution":{"observed_at":"2026-08-11T12:12:57.544680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.812853Z","title":"Parser-free virtual try-on via distilling appearance flows","venue":null,"work_id":"eedb361d-6412-452c-9150-b0350d21cbe5","year":2021},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.549676Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:f3045bcd2d507c2a69ace3228512ad2bd5d83a4a8399563d08f65bb4cd2c4380","observation_id":"247acfed-e251-4b67-a595-f25f4b98737d","resolution":{"observed_at":"2026-08-11T12:12:58.817264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10373","last_updated":"2023-11-20T10:54:09Z","snapshot_observed_at":"2026-08-13T17:55:49.664545Z","submitted_at":"2023-07-19T18:00:03Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10373","snapshot_observed_at":"2026-08-11T12:12:57.554355Z","title":"Tokenflow: Consistent diffusion features for consistent video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.554355Z"},"links":{"cited_paper":"/paper/2307.10373","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:212da00d36ac26ebfdcbc0c0f183fe241cefb18c7bb017f2182b5938e8e99b7e","observation_id":"3c84103f-ab7f-4212-ba04-e4eb6c7b62cf","resolution":{"observed_at":"2026-08-11T12:12:57.554355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.797024Z","title":"Taming the power of diffusion models for high-quality virtual try-on with appearance flow","venue":null,"work_id":"a965a870-30e4-4733-8efd-894ce3dfcbc0","year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.559452Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:da553e7bad559c9bc8e86f6208b6fa770b7e4848c88dd1adbaa153cd790fb45c","observation_id":"4a382498-32f8-4547-ade3-c8d14f7f5b31","resolution":{"observed_at":"2026-08-11T12:12:58.802187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-12T14:50:50.360929Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-11T12:12:57.563920Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.563920Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:449b169381449773af9ad3bfc29806c19394131ba61447b056e1a5e5f215b0d8","observation_id":"495cf92f-cb20-4126-a7a2-3faa42e65290","resolution":{"observed_at":"2026-08-11T12:12:57.563920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.781568Z","title":"Viton: An image-based virtual try-on network","venue":null,"work_id":"f83674af-b4b2-4c7f-8a0c-a6828cd5c694","year":2018},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.569603Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:3418dc16058b7c8dcb2b5edc7cb5fd49eb251caa37d84c635b4b8cb4fa37baa5","observation_id":"d4a7cb1f-2c3b-473b-aa1c-a495f6db01d7","resolution":{"observed_at":"2026-08-11T12:12:58.786630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.574374Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.574374Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:94917bce3895b5a9becfc643d0f7cad3ca84bd2b816c744cdd3f09ddb0aa81d5","observation_id":"8f3f0f78-ccf0-4bfe-8d29-37bae6c4152a","resolution":{"observed_at":"2026-08-11T12:12:57.574374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-11T12:12:57.579033Z","title":"Prompt-to-prompt image editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.579033Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:52bb35b66180dfd074c2b5d59611fa09208bb481e892ffa95e8f78c846109b2d","observation_id":"15e4f354-1d7c-4f4a-9c5a-bddcca664c73","resolution":{"observed_at":"2026-08-11T12:12:57.579033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.583700Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.583700Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:362ea7e585da303df01dddc384eba8c3daf246c7ffaeba3cd0f58c1ffb1e0d9b","observation_id":"78893b7b-5877-4fb2-8663-04698922644d","resolution":{"observed_at":"2026-08-11T12:12:57.583700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.588391Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.588391Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:e4b99e5c074a31955a2bcb1d86aa194c0c2e003d093fcb88d24f445a76dc1535","observation_id":"893d594a-69c2-4dca-af3d-84a146890037","resolution":{"observed_at":"2026-08-11T12:12:57.588391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-11T12:12:57.593305Z","title":"Imagen video: High definition video generation with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.593305Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:2280d2bf7fdb49015ca686accbc1fd2009909a2391436e0845f75647feaf4392","observation_id":"6285f522-8412-4009-bdc6-220567277c30","resolution":{"observed_at":"2026-08-11T12:12:57.593305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.736840Z","title":"Video diffusion models","venue":null,"work_id":"a6a5ed1d-a2ed-4891-818f-15a07817bb18","year":2022},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.598657Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:65b793d12441fbdff555e051e62a535348c6327bbb733487b87dfec144c4a9aa","observation_id":"e530495d-3c5d-4eaf-a767-943909f66949","resolution":{"observed_at":"2026-08-11T12:12:58.741472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-11T12:12:57.603149Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.603149Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:379d69225ab364ddf9ebc3041d7b5b0057126605602ae8f4f3a71049beb1cf47","observation_id":"6a7a033d-01d3-42c5-b50d-fa2b06a9d8bf","resolution":{"observed_at":"2026-08-11T12:12:57.603149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.608066Z","title":"Image quality metrics: Psnr vs","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.608066Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:8ceeb723a37e0abd4cd702d3f909df69bf9d2e45532d27a59026b7ac280c755b","observation_id":"0415a9bb-8845-4659-85d5-17525280c221","resolution":{"observed_at":"2026-08-11T12:12:57.608066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17117","last_updated":"2024-06-13T06:37:20Z","snapshot_observed_at":"2026-08-13T05:15:29.772394Z","submitted_at":"2023-11-28T12:27:15Z","title":"Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17117","snapshot_observed_at":"2026-08-11T12:12:57.612552Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.612552Z"},"links":{"cited_paper":"/paper/2311.17117","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:21d7b93c5453d45b638fad7da96ea42a6fc1e6cae1ea1cd9b2242ea45b237625","observation_id":"cdd3e95c-ba26-4816-a8cf-9e7880d0b6e7","resolution":{"observed_at":"2026-08-11T12:12:57.612552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09778","last_updated":"2023-02-22T02:14:55Z","snapshot_observed_at":"2026-08-13T12:41:46.198639Z","submitted_at":"2023-02-20T05:48:41Z","title":"Composer: Creative and Controllable Image Synthesis with Composable Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09778","snapshot_observed_at":"2026-08-11T12:12:57.617425Z","title":"Composer: Creative and controllable image synthesis with composable conditions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.617425Z"},"links":{"cited_paper":"/paper/2302.09778","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:5f7c3b68d2bab58f5a69cb579e5201c575152bf74ce10262e910b3401681e6f4","observation_id":"507dae02-1804-4a8e-b978-955e2121e947","resolution":{"observed_at":"2026-08-11T12:12:57.617425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.711231Z","title":"Learning high fidelity depths of dressed humans by watching social media dance videos","venue":null,"work_id":"cdd1b1d6-f5c1-456a-b534-73d89b4d021f","year":2021},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.623296Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:903f6daf27549e6bd2895f68d0b7eaafacc658b4ff72ff918ac1a2000d627e2d","observation_id":"fe8da206-8d16-472a-9e73-f26f2fefa1d0","resolution":{"observed_at":"2026-08-11T12:12:58.716017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.628294Z","title":"Dreampose: Fashion video synthesis with stable diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.628294Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:97ef9ffb52c6b41dada4c2fac4990b3b86c019df86248404f212213b74f944e0","observation_id":"ce5a20c5-a804-4e23-b3ad-2282e97de88e","resolution":{"observed_at":"2026-08-11T12:12:57.628294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.686780Z","title":"Text2video-zero: Text-to-image diffusion models are zero-shot video generators","venue":null,"work_id":"69865bba-e412-4ff3-8e39-37ee8415c262","year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.632961Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:41c48edebad6ed12b0acbbe5b851316c3c5864f628f4970669b0d31422a3e0d3","observation_id":"54352305-1cb9-4753-9ec1-823a7b9e7791","resolution":{"observed_at":"2026-08-11T12:12:58.691538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.638109Z","title":"Stableviton: Learning semantic correspondence with latent diffusion model for virtual try-on, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.638109Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:09c4f0dba5efe47a67a726adc43fcf875e7dfdcf3de7590956c4c200c24f95b0","observation_id":"91fc68b5-3002-4b29-89ed-5ca9d9a15a1c","resolution":{"observed_at":"2026-08-11T12:12:57.638109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-11T12:12:57.642602Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.642602Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:8a8f3f0f072455b87672866b2507f7afba436a5fe74bf3512b369a2581e6f615","observation_id":"6984ef33-bcd5-4397-a105-361951b5b224","resolution":{"observed_at":"2026-08-11T12:12:57.642602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04761","last_updated":"2023-03-08T17:53:49Z","snapshot_observed_at":"2026-08-13T15:52:18.509984Z","submitted_at":"2023-03-08T17:53:49Z","title":"Video-P2P: Video Editing with Cross-attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04761","snapshot_observed_at":"2026-08-11T12:12:57.647242Z","title":"Video-p2p: Video editing with cross-attention control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.647242Z"},"links":{"cited_paper":"/paper/2303.04761","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:071486521eb83cd49db3a11a3754b01a29ade402c5015c7e018b01526911c559","observation_id":"a7d9edc9-c832-4005-a374-ff8164259c21","resolution":{"observed_at":"2026-08-11T12:12:57.647242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01073","last_updated":"2022-01-05T00:07:35Z","snapshot_observed_at":"2026-08-14T03:40:56.071989Z","submitted_at":"2021-08-02T17:59:47Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.01073","snapshot_observed_at":"2026-08-11T12:12:57.651926Z","title":"Sdedit: Guided image synthesis and editing with stochastic differential equations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.651926Z"},"links":{"cited_paper":"/paper/2108.01073","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:732fb15c07d18bfc591967bf9899df5ce618078d4e6080178fd78a7b20cc01b3","observation_id":"39a68eda-6480-4580-9ce2-0cb4580ed316","resolution":{"observed_at":"2026-08-11T12:12:57.651926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.656352Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.656352Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:4fac4dd22ca508e76223415aefa0f4558b75d8a64167cea36481189c5d628716","observation_id":"77b979fb-1be9-4432-976b-67252a0a1805","resolution":{"observed_at":"2026-08-11T12:12:57.656352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-11T12:12:57.661285Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.661285Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:208d5e02d8c259b820d33ca5040395ddb01c137682a456fa488a04c034a41c49","observation_id":"878e0f60-c6cc-4474-be09-fa9d874ebe6a","resolution":{"observed_at":"2026-08-11T12:12:57.661285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.666046Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.666046Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:26280185c4c363cde08793b589dbd4dc064278233c7c07445d1b93c685f0433d","observation_id":"82382d19-4df6-4cb4-8068-8065770118be","resolution":{"observed_at":"2026-08-11T12:12:57.666046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.670382Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.670382Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:1b6856cf6befcb8648d4ac3ac56c8a1a333d308cacefeec1bd624caee2c43aa8","observation_id":"34ba8370-e297-4687-a611-6c12ea3d6726","resolution":{"observed_at":"2026-08-11T12:12:57.670382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.631774Z","title":"Fatezero: Fusing attentions for zero-shot text-based video editing","venue":null,"work_id":"6d302556-a6d6-4438-8e76-edefb5e18be2","year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.674645Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:978d3565f601ff864d77e41f355b1d9a5994ae4164fd6bf4a342e50284b99255","observation_id":"81ecc2d2-5f1b-499e-85ec-ea6a9cba16e2","resolution":{"observed_at":"2026-08-11T12:12:58.636770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.679420Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.679420Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:489370e857d422742fb5f5f6e8819cb8c2bdacbc7d15f0913b76e36b789bed7d","observation_id":"0da1412c-edf4-41b4-bf48-e13b74b7c3bf","resolution":{"observed_at":"2026-08-11T12:12:57.679420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-11T12:12:57.683695Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.683695Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:72ebcdbd546c4c2df905c8ae50ec695785357a78f7513d635ed4bba2bcaa270a","observation_id":"b99669c5-297c-4ab3-a89e-d473e1c94238","resolution":{"observed_at":"2026-08-11T12:12:57.683695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.607595Z","title":"Deep spatial transformation for pose-guided person image generation and animation","venue":null,"work_id":"6de2ca69-849b-4dc8-acf9-06df2a40ada7","year":2020},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.688340Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:a0d2940ab7ca6edc94201ad62a979a2fc406f71be3ec0c8aa7022f11f5908d33","observation_id":"e43fd788-83f5-4a2e-8542-489ada561da5","resolution":{"observed_at":"2026-08-11T12:12:58.612197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.593761Z","title":"Neural texture extraction and distribution for controllable person image synthesis","venue":null,"work_id":"2ad934e4-044d-4b48-8fb1-43650a434656","year":2022},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.692808Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:02213a610c15e2f1bdf80be0b3f53d73ac35ecf80d2db70fbb9e45fb0ac5d9a2","observation_id":"8c5cf574-b9b5-41c2-be72-539878c5b752","resolution":{"observed_at":"2026-08-11T12:12:58.598115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.698600Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.698600Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:130f3898b98a53ba478b69cfd2cc191c6ad45eadc349354aaa6a37767570ae02","observation_id":"98839c3e-314e-46c4-a760-e6343dcf86b8","resolution":{"observed_at":"2026-08-11T12:12:57.698600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.704068Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.704068Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:db9fc5078f3157faaf3d1d9a01878d630f89f853538030bcadabee74a178618c","observation_id":"c00f82e4-5c13-48cc-9283-eb10903ee149","resolution":{"observed_at":"2026-08-11T12:12:57.704068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.708942Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.708942Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:84f3b1013736816a9f8093ca68cf2ae5cff506bdbbb5ec7af177758557e109ae","observation_id":"d7fd9756-8343-41cd-b307-cdbcf5e2c030","resolution":{"observed_at":"2026-08-11T12:12:57.708942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.713812Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.713812Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:50d4ded0f64f1aaaaecb94c20383aa3879198b6a20d4524fd7689cc4497d6356","observation_id":"28105dc5-41b0-4fd7-9f48-4b6d421dfa47","resolution":{"observed_at":"2026-08-11T12:12:57.713812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.722465Z","title":"First order motion model for image animation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.722465Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:91752657e4ea74f358a9b0423ab35ce4ca756af3da8b721f42621869cfc112eb","observation_id":"fbcf799a-1d54-4a31-83dc-91dffd3f9066","resolution":{"observed_at":"2026-08-11T12:12:57.722465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.529589Z","title":"Motion representations for articulated animation","venue":null,"work_id":"e774f90c-0c19-4fa5-b1b4-88c31f63b085","year":2021},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.730806Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:4ef9fe038167114143c02bacd9ae8e94428faf1938f28922a4f281b2eff1f249","observation_id":"979e70fe-843e-462d-9aeb-db6ee3ab1eb7","resolution":{"observed_at":"2026-08-11T12:12:58.534814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-11T12:12:57.735222Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.735222Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:17ee318edc7bbfcb07a86da89e5a6352a4dd927a8c9ebe983ee8383fd8aee0af","observation_id":"90436190-86b3-4a4c-b451-f289d56d31ba","resolution":{"observed_at":"2026-08-11T12:12:57.735222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.740338Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.740338Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:097970ca9da9fb9c505376e7275f0014683a3452150ce51b1e37bb74766801eb","observation_id":"63c74cc8-d089-431b-90fd-ff93b7bca78c","resolution":{"observed_at":"2026-08-11T12:12:57.740338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-11T12:12:57.745035Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.745035Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:a373b77af8c896664cad84488de6bab8ed5243b9485c4efe3078f1c65bf99bc1","observation_id":"798b14cf-d1f4-4380-8557-6ccf65eafef0","resolution":{"observed_at":"2026-08-11T12:12:57.745035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.749422Z","title":"Generative modeling by estimating gradients of the data distribution","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.749422Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:b04c08bd4c8bcdd6611ae17131bf8d724d1f9b66d2d97b9286d494bfe29fd313","observation_id":"c2ea87c6-ef73-4ca9-956a-3adae20946d5","resolution":{"observed_at":"2026-08-11T12:12:57.749422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-11T12:12:57.753568Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.753568Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:f263003dccfb409521bb8b8cfd1d5fc071eb1d662470dc8df7e9028e7bc9934d","observation_id":"47617989-b043-464c-9c12-94d9d3a03da5","resolution":{"observed_at":"2026-08-11T12:12:57.753568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.494365Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":"84c201c6-d831-422e-a67a-2afb41891e14","year":1921},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.758257Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:86e0ea2768b8821309c7f7516e6ee63f54a5fbb5f49fe687e1d9eee96d925950","observation_id":"f2de290f-4692-4ff9-adf3-49e0841c6bf0","resolution":{"observed_at":"2026-08-11T12:12:58.499443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-11T02:30:38.877941Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-11T12:12:57.762919Z","title":"Towards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.762919Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:c8df0ff937827bf4c46148473290f4d0c1626777551f5a60fdbf874582cda454","observation_id":"f82cc421-4a6a-44f6-ad4c-a4bbe997f9e5","resolution":{"observed_at":"2026-08-11T12:12:57.762919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.767501Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.767501Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:fd906afa1e28a4baa281fa6543a5e61142700562d399ff70b77d4972360fe4f6","observation_id":"520b5c83-66fb-416a-93c0-2f2acee2def9","resolution":{"observed_at":"2026-08-11T12:12:57.767501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.470396Z","title":"Disco: Disentangled control for referring human dance generation in real world","venue":null,"work_id":"5b0d1234-57ba-4ae5-adfa-bd66d7e62a33","year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.771508Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:207a957d23ddf1e013771cae064bce3c3b0f0c163f1e4539a9d2bf9151814c00","observation_id":"1da7e844-c39b-41c5-9236-60e4d8c6d779","resolution":{"observed_at":"2026-08-11T12:12:58.474769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.775664Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.775664Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:258a9d4595d4f70eddaaf202e17ed6b0aae2bd60d9f25089779c225a07ca9ff7","observation_id":"1df3eb50-5478-487a-859e-7e2fdd2f591c","resolution":{"observed_at":"2026-08-11T12:12:57.775664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.779895Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.779895Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:85ce8e9e472d38e1f57809af5663682ab961824605bb386bb223af8ffe92f8f5","observation_id":"dde073e1-dcca-46b6-9ce8-cce938358fe9","resolution":{"observed_at":"2026-08-11T12:12:57.779895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.435098Z","title":"Gp-vton: Towards general purpose virtual try-on via collaborative local-flow global-parsing learning","venue":null,"work_id":"68055be6-093c-4b53-9f3a-2723eabcbdbe","year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.783835Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:4b158d679cb5fec04608d531b842039fbefb038417420a22d7b2a08cf787da92","observation_id":"cc8fff43-ae8f-4f7b-a5c1-a8079069c88b","resolution":{"observed_at":"2026-08-11T12:12:58.440246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01779","last_updated":"2024-03-07T06:35:35Z","snapshot_observed_at":"2026-08-13T04:04:21.588263Z","submitted_at":"2024-03-04T07:17:44Z","title":"OOTDiffusion: Outfitting Fusion based Latent Diffusion for Controllable Virtual Try-on","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01779","snapshot_observed_at":"2026-08-11T12:12:57.787677Z","title":"Ootdiffusion: Outfitting fusion based latent diffusion for controllable virtual try-on","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.787677Z"},"links":{"cited_paper":"/paper/2403.01779","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:e03f324435d41af9b34584cb8ba3b1292994acdc8ada97fa34dfdf55df26b15b","observation_id":"32802769-e48f-40e4-8d71-35848afc2341","resolution":{"observed_at":"2026-08-11T12:12:57.787677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16498","last_updated":"2023-11-27T18:32:31Z","snapshot_observed_at":"2026-08-13T05:16:07.868866Z","submitted_at":"2023-11-27T18:32:31Z","title":"MagicAnimate: Temporally Consistent Human Image Animation using Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16498","snapshot_observed_at":"2026-08-11T12:12:57.792023Z","title":"Magicanimate: Temporally consistent human image animation using diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.792023Z"},"links":{"cited_paper":"/paper/2311.16498","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:7014f99564a5ac98093be2ce20ef305b45b3b4c186397459865d7d1c56544a74","observation_id":"21957b3a-71d8-4df2-8cb6-e36e75c55c8b","resolution":{"observed_at":"2026-08-11T12:12:57.792023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.420549Z","title":"Paint by example: Exemplar-based image editing with diffusion models","venue":null,"work_id":"c2e7344b-e7d9-4e88-a772-41f3d5c03c34","year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.796678Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:14a9fd418932adf24bf8973fb9dbdc6697526a8e6bc14a6f9ad5c085b3f2bb34","observation_id":"b88cfc2a-420d-4882-9951-42d1d44b46a5","resolution":{"observed_at":"2026-08-11T12:12:58.424739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.405868Z","title":"Towards photo-realistic virtual try-on by adaptively generating-preserving image content","venue":null,"work_id":"03c64b78-d0c9-4371-9659-e82e4758516a","year":2020},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.800617Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:82ce5e7374000cc892c8f8c72e468f9a83d69b2112845ff489f9a4051376b8c8","observation_id":"04272eb9-d3c1-479f-b938-e19e3b4ad0ba","resolution":{"observed_at":"2026-08-11T12:12:58.410149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.390788Z","title":"Rerender a video: Zero-shot text-guided video-to-video translation","venue":null,"work_id":"46f8fe13-4684-4045-8f35-a6907bd7d4dc","year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.804656Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:bb893d01e2c1212cebdd5ab05a74a3798ef49d1fb4c5ca723329f87ce8df9f1b","observation_id":"095834e5-fb0d-48ec-9eac-3becbc903bc7","resolution":{"observed_at":"2026-08-11T12:12:58.395631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09139","last_updated":"2019-10-21T03:56:51Z","snapshot_observed_at":"2026-08-05T10:08:16.256542Z","submitted_at":"2019-10-21T03:56:51Z","title":"DwNet: Dense warp-based network for pose-guided human video generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.09139","snapshot_observed_at":"2026-08-11T12:12:57.808616Z","title":"Dwnet: Dense warp-based network for pose-guided human video generation","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.808616Z"},"links":{"cited_paper":"/paper/1910.09139","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:f814904db0cc5da82a070b5e9a07687afc95d6fd68ea0ed138d7b0014f0c6432","observation_id":"51b9105c-ad59-4f89-b252-6b93de91467c","resolution":{"observed_at":"2026-08-11T12:12:57.808616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.813042Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.813042Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:4d491dfd30ea7d7090832494e9ee86779c2009cd433c932761f81a814c4752f9","observation_id":"4a12ff71-7252-439d-bfdb-d8c85ca9b1de","resolution":{"observed_at":"2026-08-11T12:12:57.813042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.365174Z","title":"Exploring dual-task correlation for pose guided person image generation","venue":null,"work_id":"cf054e4c-5c5f-4e69-961b-9d4367a305d2","year":2022},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.817271Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:8790782237193acc9bc455032e76ba2dda753ffd2e0bad19c0cd78f99f01face","observation_id":"23b6bab8-b333-434c-b300-33f6f420d40a","resolution":{"observed_at":"2026-08-11T12:12:58.370540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.821441Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.821441Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:725daf2a3376310ef284f97b419b3dac8c39bcfc2dd8e1d510d63e183caf87e6","observation_id":"5a4ecd48-1c69-4ac7-9785-839c1dbf13fb","resolution":{"observed_at":"2026-08-11T12:12:57.821441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.340006Z","title":"Thin-plate spline motion model for image animation","venue":null,"work_id":"471cf4bb-bf71-4a49-aeb8-6933f48796c9","year":2022},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.825942Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:57284c48ae76de166ea67ced8c60282d7c934ba26af81b47a0cafc6c2a79564b","observation_id":"49bc4dd5-06a3-4844-8b0c-213aa504b8e5","resolution":{"observed_at":"2026-08-11T12:12:58.345517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.830349Z","title":"Uni-controlnet: All-in-one control to text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.830349Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:74aaddc6d9ab587ddac37aeaa6c04ada10a06ceb89e89824d8823077c2c11115","observation_id":"a2850227-b6f3-48eb-ada3-6542146a758e","resolution":{"observed_at":"2026-08-11T12:12:57.830349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:58.314931Z","title":"Tryondiffusion: A tale of two unets","venue":null,"work_id":"05f34bdd-4397-4112-be11-0262892dacc4","year":2023},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.834736Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:6448fe01a64f4c936102aa44a7ae00743c917ce8da42bebfb102b8cdf03e46be","observation_id":"a58c1b5a-d90c-4243-8bb2-b6c5add81572","resolution":{"observed_at":"2026-08-11T12:12:58.319981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14781","last_updated":"2024-06-01T08:27:23Z","snapshot_observed_at":"2026-08-13T00:48:24.019003Z","submitted_at":"2024-03-21T18:52:58Z","title":"Champ: Controllable and Consistent Human Image Animation with 3D Parametric Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14781","snapshot_observed_at":"2026-08-11T12:12:57.838913Z","title":"Champ: Controllable and consistent human image animation with 3d parametric guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.838913Z"},"links":{"cited_paper":"/paper/2403.14781","citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:60f94055b9585c480ccd4daee503d016351dae9178df570b08db6e5c2d5afb99","observation_id":"03b7daaa-e2e1-4c9f-bdb2-77230aa35ede","resolution":{"observed_at":"2026-08-11T12:12:57.838913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.843378Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.843378Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:998eb7a080e87413ca67d985c6b82e70317741ea1b4fa46d21d9be1809baa824","observation_id":"2a2c51e2-e288-4626-b14f-3e5bdb5b7dfe","resolution":{"observed_at":"2026-08-11T12:12:57.843378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.847782Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.847782Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:99a54d66456dc5bb6c92c4803f5c37093e5a5d7d11b6f62aacbff1b46bca40fe","observation_id":"64206801-0635-4b0b-b049-fa65514305ab","resolution":{"observed_at":"2026-08-11T12:12:57.847782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:12:57.852352Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-11T12:12:57.852352Z"},"links":{"citing_paper":"/paper/2412.14531"},"observation_digest":"sha256:2eebc8005154597abd7ae1039f4ea572be4079a7ed81f3146731ec9b147e21c5","observation_id":"d581d0bb-41f0-4116-b867-6573d15a43c4","resolution":{"observed_at":"2026-08-11T12:12:57.852352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.14531","last_updated":"2024-12-19T05:02:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T11:11:08.711036Z","submitted_at":"2024-12-19T05:02:30Z","title":"Consistent Human Image and Video Generation with Spatially Conditioned Diffusion"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 1 inbound Pith citation observation for arXiv:2412.14531."}