{"as_of":"2026-08-21T04:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ea14615c70525e3c54afe50c1781380bf9c24a918206344b1870cb1ba6baebe9","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:23:41.484020Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T19:00:44.243335Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"cited_work":{"arxiv_id":"2501.08682","doi":"10.48550/arxiv.2501.08682","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Realvvt: Towards photorealistic video virtual try-on via spatio-temporal consistency","venue":"ArXiv.org","work_id":"c99a32ef-1239-4121-8929-5b051119fec8","year":2025},"citing_paper":{"arxiv_id":"2511.18957","last_updated":"2026-04-13T02:31:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T10:19:56Z","title":"Eevee: Towards Close-up High-resolution Video-based Virtual Try-on","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T06:34:45.045267Z"},"links":{"cited_paper":"/paper/2501.08682","citing_paper":"/paper/2511.18957"},"observation_digest":"sha256:3c2fc90e0491454b1450d3b6b1fcf608947ba373b35f0f4df29fb9894d2637aa","observation_id":"cb931202-32af-476a-97a6-f8f71ed70c7e","resolution":{"observed_at":"2026-05-17T06:39:10.564830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"cited_work":{"arxiv_id":"2501.08682","doi":"10.48550/arxiv.2501.08682","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Realvvt: Towards photorealistic video virtual try-on via spatio-temporal consistency","venue":"ArXiv.org","work_id":"c99a32ef-1239-4121-8929-5b051119fec8","year":2025},"citing_paper":{"arxiv_id":"2512.20340","last_updated":"2026-04-29T12:00:44Z","snapshot_observed_at":"2026-08-02T10:18:36.960036Z","submitted_at":"2025-12-23T13:15:31Z","title":"The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T20:06:30.109866Z"},"links":{"cited_paper":"/paper/2501.08682","citing_paper":"/paper/2512.20340"},"observation_digest":"sha256:89ba1b32c9d703470a7c74bc340ed35b682efc437f1846bc05ff9610323020b9","observation_id":"c504a272-756e-4e04-b20f-0bfaf4d54e58","resolution":{"observed_at":"2026-05-16T20:08:22.943585Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"cited_work":{"arxiv_id":"2501.08682","doi":"10.48550/arxiv.2501.08682","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Realvvt: Towards photorealistic video virtual try-on via spatio-temporal consistency","venue":"ArXiv.org","work_id":"c99a32ef-1239-4121-8929-5b051119fec8","year":2025},"citing_paper":{"arxiv_id":"2604.27958","last_updated":"2026-04-30T14:53:44Z","snapshot_observed_at":"2026-08-10T21:43:59.725969Z","submitted_at":"2026-04-30T14:53:44Z","title":"TripVVT: A Large-Scale Triplet Dataset and a Coarse-Mask Baseline for In-the-Wild Video Virtual Try-On","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-07T05:43:04.644875Z"},"links":{"cited_paper":"/paper/2501.08682","citing_paper":"/paper/2604.27958"},"observation_digest":"sha256:0d2a33ed8808830a9162e586fc53e990ce36ca3e2004bc48b58dfb7ed1620922","observation_id":"e0287f82-ae83-4d57-9d15-1cc25eb3eb4a","resolution":{"observed_at":"2026-05-09T05:05:12.414338Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"cited_work":{"arxiv_id":"2501.08682","doi":"10.48550/arxiv.2501.08682","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Realvvt: Towards photorealistic video virtual try-on via spatio-temporal consistency","venue":"ArXiv.org","work_id":"c99a32ef-1239-4121-8929-5b051119fec8","year":2025},"citing_paper":{"arxiv_id":"2606.08514","last_updated":"2026-08-04T12:17:45Z","snapshot_observed_at":"2026-08-11T09:27:50.623738Z","submitted_at":"2026-06-07T08:40:43Z","title":"OmniTryOn: Video Try-On Anything at Once!","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T19:00:44.243335Z"},"links":{"cited_paper":"/paper/2501.08682","citing_paper":"/paper/2606.08514"},"observation_digest":"sha256:fe38e3a83a6c4afe9d15b4f79445d1e5bb4a8a14a9095bc3da33a2b733feb03c","observation_id":"6058e754-7fc3-4422-bf35-3cb623eac8e9","resolution":{"observed_at":"2026-07-02T22:17:26.409824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.08682/citation-record","integrity":"/paper/2501.08682/integrity","json":"/paper/2501.08682/citation-record.json","paper":"/paper/2501.08682"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-20T09:39:07.545813Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-10T20:23:40.716948Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.716948Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:9492c3f20ad591c27a44bd43938235900f3aba99a600747f3e1468cfc053a6f1","observation_id":"7518a99d-d4de-40b5-8042-847ad32b2daf","resolution":{"observed_at":"2026-08-10T20:23:40.716948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:43.278644Z","title":"Elucidating the design space of diffusion-based generative models,","venue":null,"work_id":"6129a879-c2e4-40e9-a220-48aa61028d94","year":2022},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.733448Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:e50e7fcb50055098e87fd1a7be7c67462ab4d23250ad6ffb329729aa952e90cc","observation_id":"550e779a-d7f2-43a7-b9d4-1e113b29ed14","resolution":{"observed_at":"2026-08-10T20:23:43.284218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-10T20:23:40.739601Z","title":"Auto-encoding variational bayes,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.739601Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:713a419db38c6503765d2f0f96b1ddee033e6f20c648c6acebe648fbeceadd7c","observation_id":"befa29aa-189f-4a4a-b5f7-b7ba7fa4cdde","resolution":{"observed_at":"2026-08-10T20:23:40.739601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:43.261923Z","title":"Single stage virtual try-on via deformable attention flows,","venue":null,"work_id":"d2f096ce-7d97-4ef9-a986-569645347d73","year":2022},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.745924Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:8d8bffe92a680313592e8bb8792b8e2b2de83cf5d681c7869df3a16ffb0fc91b","observation_id":"060082d7-6318-4df1-80e0-7eb74315284f","resolution":{"observed_at":"2026-08-10T20:23:43.267878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:43.200935Z","title":"Sapiens: Foundation for human vision models,","venue":null,"work_id":"e222a627-f5d6-41c9-9ba2-c77e5410be2d","year":2025},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.799954Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:9fb61ffec89888beb7798458bbf8f5ef174fb15964d4e30402e253a675b75b19","observation_id":"48563e53-3878-442d-b91e-0dc33e566a53","resolution":{"observed_at":"2026-08-10T20:23:43.236033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:43.184016Z","title":"Animate anyone: Consistent and controllable image- to-video synthesis for character animation,","venue":null,"work_id":"c117bf77-351c-4fbc-95ac-149bb8ade96e","year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.846489Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:f113c129234d290f9a11061ff3184bf2fc3bb3efc1780f61d6d303c1482b40ef","observation_id":"791e8503-54c9-457f-b44b-3bb8b5e9a340","resolution":{"observed_at":"2026-08-10T20:23:43.189360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:43.126767Z","title":"Dress code: High-resolution multi-category virtual try-on,","venue":null,"work_id":"ff1cdae8-a038-40ec-b1ce-339d0c3be807","year":2022},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.851934Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:8127b865b5567a180bf303b100d8e73b82f5132bc71c42b465ceb7bc5b4e7e44","observation_id":"b29a7acb-c54a-473d-9087-e49e16b3010b","resolution":{"observed_at":"2026-08-10T20:23:43.154725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:43.109855Z","title":"Rerender a video: Zero-shot text-guided video-to-video translation,","venue":null,"work_id":"52d9e596-4aca-4967-a64b-8e84b1d83245","year":2023},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.858531Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:f90dc8648d1b928bea8b381328283b110a014eb3328ede4b5fc7c9f8fc5d8ef6","observation_id":"c6e2d118-5801-42ba-8f0f-1947efebec8d","resolution":{"observed_at":"2026-08-10T20:23:43.115482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:43.030787Z","title":"Diffusion models beat gans on image synthesis,","venue":null,"work_id":"36d59b6c-e17d-49da-8ba5-3afc71709a92","year":2021},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.863638Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:9a329ec5f9fb55e50b7bde6be211941a06014b26db92bbf8567cd32e3f6cdc5c","observation_id":"b1cb9d71-ce1a-440f-a14e-723fc00fd856","resolution":{"observed_at":"2026-08-10T20:23:43.050704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:43.014388Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"03a5ac28-df7b-48f9-ae80-4d8d2cac5ae4","year":2021},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.924733Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:bd9080c9b5bff0354444f633a5e7023e6db08879597165b8e48b466e30ce6cac","observation_id":"f5bdd9a6-5a08-434c-84f0-435e5a41f38b","resolution":{"observed_at":"2026-08-10T20:23:43.019924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-17T14:04:31.230742Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-10T20:23:40.952598Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.952598Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:2b90651a287dc6ee59d50f6b0e29e2910933a647ba331d9fc438f28698b9566b","observation_id":"40034013-c75a-417a-bada-db14c0134e48","resolution":{"observed_at":"2026-08-10T20:23:40.952598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01779","last_updated":"2024-03-07T06:35:35Z","snapshot_observed_at":"2026-08-16T14:13:13.042989Z","submitted_at":"2024-03-04T07:17:44Z","title":"OOTDiffusion: Outfitting Fusion based Latent Diffusion for Controllable Virtual Try-on","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01779","snapshot_observed_at":"2026-08-10T20:23:40.958697Z","title":"Ootdiffusion: Out- fitting fusion based latent diffusion for controllable virtual try-on,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:40.958697Z"},"links":{"cited_paper":"/paper/2403.01779","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:ef1da8a4c10728c8dc03b9c7af1134906bc558b1c0a1e164c3266ff3d203cb41","observation_id":"480e9800-5630-407a-84e5-374a1174f5e9","resolution":{"observed_at":"2026-08-10T20:23:40.958697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.948745Z","title":"Gpd-vvto: Preserving garment details in video virtual try- on,","venue":null,"work_id":"c9555910-4bb0-4da2-b9c6-dfd9c18e0a18","year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.021799Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:05b3224d028e24dc562225005f8f65a73554abdfaae70bc8d1e964840db71a9e","observation_id":"71ef351b-32bf-4cc8-b46d-ffdac378aa70","resolution":{"observed_at":"2026-08-10T20:23:42.983205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-13T10:28:06.516901Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-10T20:23:41.051508Z","title":"Latte: Latent diffusion transformer for video generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.051508Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:cf8ea16c9d964b6d00a94d09d582e6ad64faa6a66d6cd3e50af0bf6cd2b427dd","observation_id":"83084fb9-fac4-43c7-adc0-cd10c3698f56","resolution":{"observed_at":"2026-08-10T20:23:41.051508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.931365Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":"d8bc5680-1455-4741-8f2b-6a517ddc7e8a","year":2022},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.057309Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:74b658fe2644be928e455263dc9aa302e0d03a66f0a1ecf13113f8fe8375fa1c","observation_id":"e010788b-c20d-48e4-9449-70010462bff5","resolution":{"observed_at":"2026-08-10T20:23:42.937876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18326","last_updated":"2024-06-07T16:02:10Z","snapshot_observed_at":"2026-08-16T13:48:33.159094Z","submitted_at":"2024-05-28T16:21:03Z","title":"VITON-DiT: Learning In-the-Wild Video Try-On from Human Dance Videos via Diffusion Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18326","snapshot_observed_at":"2026-08-10T20:23:41.063202Z","title":"Viton-dit: Learning in-the-wild video try-on from human dance videos via diffusion transformers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.063202Z"},"links":{"cited_paper":"/paper/2405.18326","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:274d33329b981988207fac35c9de463cbcb23d138006fd615509380b757bf2b4","observation_id":"798c1a56-b1dc-4320-ac8c-04b2d4b277e7","resolution":{"observed_at":"2026-08-10T20:23:41.063202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.856235Z","title":"Tunnel try-on: Excavating spatial- temporal tunnels for high-quality virtual try-on in videos,","venue":null,"work_id":"62c8768d-ff9c-4ce6-bbbe-20eb0769edcc","year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.068622Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:9c58bf9c0c7f20e350f4beec1a1100deb94d753954323a6d81e6c8e3bcacd46e","observation_id":"d3a4cd6a-4147-4605-9a4a-5bcbf9082ae6","resolution":{"observed_at":"2026-08-10T20:23:42.886479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.840789Z","title":"Clothformer: Tam- ing video virtual try-on in all module,","venue":null,"work_id":"c0646325-08e6-4c7c-8df5-9098aa2b18ae","year":2022},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.073473Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:1dc5fbb110c4530757d632d321c28a1b98678cf2a6a5aec699a5686cdec7e410","observation_id":"69f62e6b-464d-4c5b-b2a9-ba8f1a416c24","resolution":{"observed_at":"2026-08-10T20:23:42.845582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.752992Z","title":"Improving diffusion models for authentic virtual try-on in the wild,","venue":null,"work_id":"12216a17-3394-4100-aaa8-08e93bae6904","year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.077891Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:05b5bc537ca22b935e4a752adf46dfcf70cd9e0f441378386b37d22034517b76","observation_id":"8e9446ca-ff3b-483e-86b0-e44e767e08ed","resolution":{"observed_at":"2026-08-10T20:23:42.819282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.736629Z","title":"Stablevi- ton: Learning semantic correspondence with latent diffusion model for virtual try-on,","venue":null,"work_id":"00595a5e-9838-4366-8a7b-bb41a81872a6","year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.141373Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:3bb8a80e6524afd7697fe8a4c40665553e346db97068486b32088bc2596b1fa0","observation_id":"1c3237f3-1c29-45e4-aeab-6679c72b1333","resolution":{"observed_at":"2026-08-10T20:23:42.742148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.626605Z","title":"Dit: Self- supervised pre-training for document image transformer,","venue":null,"work_id":"13497e3d-7b8e-4096-9868-52d3cab83e6c","year":2022},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.207875Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:a770ca6221ee84d2f6ed49ecfab1126bd657039b972f2839217fd3b25d0b11c7","observation_id":"2ec9f07f-b1bf-487a-83c9-6a5aa6ad3b21","resolution":{"observed_at":"2026-08-10T20:23:42.679155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.610734Z","title":"Flownet: Learning optical flow with convolutional net- works,","venue":null,"work_id":"0bf58746-8bdc-4e53-a7dd-fc662e87ab6e","year":2015},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.212780Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:9826c6fe5b75f09f512333884391b22d485ca5b943e980ffca59e9dbcfbe4f21","observation_id":"7ced8ebe-d9a9-4397-bc07-1699087ad35e","resolution":{"observed_at":"2026-08-10T20:23:42.615996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.527465Z","title":"Shineon: Illuminating design choices for practical video-based virtual clothing try-on,","venue":null,"work_id":"55f3f93a-fc94-492a-a02c-e6e08ba020e3","year":2021},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.218167Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:3c68de9c39ba8bed40856bd31e0c3a50dda2d05812ffb2a72c7618f8c19047a3","observation_id":"572c88e9-71b4-4d9b-827c-a47eb318a226","resolution":{"observed_at":"2026-08-10T20:23:42.599265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.510265Z","title":"Mv-ton: Memory-based video virtual try-on network,","venue":null,"work_id":"e2e5e61e-3a24-4701-81ad-35d05911d609","year":2021},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.223168Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:e7c0c9b396fe9962833a484b305e58cc7ecb70729d7fe8d85e2bda6a53de9a46","observation_id":"5d77c051-aaf5-4a6d-8522-4146242327b9","resolution":{"observed_at":"2026-08-10T20:23:42.515659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.448911Z","title":"Fw-gan: Flow-navigated warping gan for video virtual try- on,","venue":null,"work_id":"a687f267-bf81-469b-b719-d56c81d4b191","year":2019},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.228081Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:ebd0fb06835ac678861011357bc17e835a8c15e733b90d3ad3ec863ad13dbfa2","observation_id":"1f4ad7c9-c713-490d-a639-36fd86fcd7b8","resolution":{"observed_at":"2026-08-10T20:23:42.482507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.424954Z","title":"Gentron: Diffusion transformers for image and video generation,","venue":null,"work_id":"3e23f711-5b0a-41a9-a750-9cd8b3d978e8","year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.233133Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:517e17d9591791081d08b974665e98064631277334ce4850d6e6d94a09027a9c","observation_id":"98820a1f-14bb-422e-a67c-d46580be4b95","resolution":{"observed_at":"2026-08-10T20:23:42.436364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01595","last_updated":"2024-09-03T04:29:59Z","snapshot_observed_at":"2026-08-20T12:47:32.275742Z","submitted_at":"2024-09-03T04:29:59Z","title":"DiVE: DiT-based Video Generation with Enhanced Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01595","snapshot_observed_at":"2026-08-10T20:23:41.238260Z","title":"Dive: Dit-based video generation with enhanced control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.238260Z"},"links":{"cited_paper":"/paper/2409.01595","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:6b6b694e64f80aabc0b846f9d213e2d4b0aabddf41ba58a621e67e1db186b8a1","observation_id":"5ae0294a-2efd-4915-874f-05503c61c6a3","resolution":{"observed_at":"2026-08-10T20:23:41.238260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-10T20:23:41.243874Z","title":"Sora: A review on back- ground, technology, limitations, and opportunities of large vision models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.243874Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:66178d3a8f1451e84cec7af871068da79c4efe944440dd31fa051241629b87ea","observation_id":"6933059d-7d9f-4a4d-acfa-8daed6c78319","resolution":{"observed_at":"2026-08-10T20:23:41.243874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12346","last_updated":"2023-03-22T07:10:09Z","snapshot_observed_at":"2026-08-17T12:43:36.756671Z","submitted_at":"2023-03-22T07:10:09Z","title":"NUWA-XL: Diffusion over Diffusion for eXtremely Long Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12346","snapshot_observed_at":"2026-08-10T20:23:41.249291Z","title":"Nuwa-xl: Diffusion over dif- fusion for extremely long video generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.249291Z"},"links":{"cited_paper":"/paper/2303.12346","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:b98ab994efab5c48fe60fb3d45264d6e5be2d97afb9e4f1b9e304fc6626c60b1","observation_id":"8739ab18-7fd0-4818-be72-d880f5617086","resolution":{"observed_at":"2026-08-10T20:23:41.249291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.339201Z","title":"Trip: Temporal residual learning with image noise prior for image-to-video diffusion models,","venue":null,"work_id":"8d18937c-999a-4bea-92d8-2d644209ed73","year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.254119Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:eb970fec2d6315fc069c1e4941bebf88b652fd175f935a946909633e03e0337d","observation_id":"93c28c2b-f510-4270-ab7e-0afb0e787922","resolution":{"observed_at":"2026-08-10T20:23:42.398694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-17T16:16:01.560363Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-10T20:23:41.258890Z","title":"Latent video diffusion models for high-fidelity long video genera- tion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.258890Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:1b69e43a41461d4d47cf9ecde623ee904df1ab8b0d9442dd8d139dcae40ce8dc","observation_id":"71dd5b71-2eb1-4d9c-b646-7440dc726f38","resolution":{"observed_at":"2026-08-10T20:23:41.258890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.321849Z","title":"Multi-concept customization of text-to-image diffu- sion,","venue":null,"work_id":"5734cead-1afc-431c-8139-29c59b71f87c","year":2023},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.264121Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:1789eb2aa05fb565032d10d9176b3574c1d3ef9ed4705df1b94526fac3fdfc2e","observation_id":"ce4f4262-4437-4568-b641-e7dc5013a8d3","resolution":{"observed_at":"2026-08-10T20:23:42.328075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05967","last_updated":"2024-07-17T18:38:23Z","snapshot_observed_at":"2026-08-16T13:53:57.607926Z","submitted_at":"2024-05-09T17:59:40Z","title":"Distilling Diffusion Models into Conditional GANs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05967","snapshot_observed_at":"2026-08-10T20:23:41.268741Z","title":"Distill- ing diffusion models into conditional gans,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.268741Z"},"links":{"cited_paper":"/paper/2405.05967","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:f869ce3654a3b095719eb479d67dc2ce0ee726c52c70186781181214a8ac2ca4","observation_id":"8ed88b5e-5cc5-43eb-9b1c-cb701fe6c125","resolution":{"observed_at":"2026-08-10T20:23:41.268741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.240397Z","title":"Toward characteristic-preserving image-based virtual try- on network,","venue":null,"work_id":"0f524c18-6c8f-4972-8cce-441554a172b1","year":2018},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.280868Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:c75185cd7229a6b5e093c6723553d45ad20736f698d32dd1ae8079ae1903be39","observation_id":"44fece41-f004-493a-b349-5d3cf8640c70","resolution":{"observed_at":"2026-08-10T20:23:42.302802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.212459Z","title":"High- resolution virtual try-on with misalignment and occlusion- handled conditions,","venue":null,"work_id":"0e53f277-6b1a-4929-9991-b14d8e32c058","year":2022},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.336274Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:d063c1b70b73ddfa27ecfd4d2c8f4c268a7601ff6d18610cf18d22d000da7670","observation_id":"8374b284-19a3-4721-93c4-0c4fc3eb2d0d","resolution":{"observed_at":"2026-08-10T20:23:42.217866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.132273Z","title":"Ladi-vton: Latent diffusion textual- inversion enhanced virtual try-on,","venue":null,"work_id":"d1527c6b-3cf3-4c8a-a172-b31bf7132051","year":2023},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.398737Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:99d3351d0483e557704be3408e4a080768d3a9847b355f6100f779f1fff9eea6","observation_id":"47c9771c-594a-4c43-a5b4-72d9329e894c","resolution":{"observed_at":"2026-08-10T20:23:42.199086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.112146Z","title":"Tam- ing the power of diffusion models for high-quality virtual try- on with appearance flow,","venue":null,"work_id":"35c1fbf1-240a-4020-982c-6a29af0a25b7","year":2023},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.428921Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:f73c66eed5b5f9055e43031c4e9079f2ca9c2ae261b58facfd97195563b985a1","observation_id":"8c839f01-dd03-4c51-995b-338fa2e623cc","resolution":{"observed_at":"2026-08-10T20:23:42.118515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.059384Z","title":"Viton-hd: High- resolution virtual try-on via misalignment-aware normaliza- tion,","venue":null,"work_id":"39d7804a-7455-414e-882f-a11aa7b46e42","year":2021},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.435225Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:b5bd2c9852101bc66e02e832b899670838a454d2534ca093df0230fe79cd77e7","observation_id":"5482fa6b-05da-47f6-8a76-a93a23448634","resolution":{"observed_at":"2026-08-10T20:23:42.083295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-10T20:23:41.440256Z","title":"Sam 2: Segment anything in images and videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.440256Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:9771fdc5bccaccaeb89fee776637e0c1047caa5e6165bfadc8ff4d8b0611d357","observation_id":"647f8ce2-7440-4285-b1af-88ee7cc734b9","resolution":{"observed_at":"2026-08-10T20:23:41.440256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10625","last_updated":"2024-07-15T11:21:03Z","snapshot_observed_at":"2026-08-19T20:00:01.025544Z","submitted_at":"2024-07-15T11:21:03Z","title":"WildVidFit: Video Virtual Try-On in the Wild via Image-Based Controlled Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10625","snapshot_observed_at":"2026-08-10T20:23:41.445965Z","title":"Wild- vidfit: Video virtual try-on in the wild via image-based con- trolled diffusion models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.445965Z"},"links":{"cited_paper":"/paper/2407.10625","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:9e087d8b45fb132a33c9d14cdf210f1b27e33d715abe6177587a4e8094904a49","observation_id":"433d9b05-bee6-4858-89fc-35278f4053e8","resolution":{"observed_at":"2026-08-10T20:23:41.445965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:42.030360Z","title":"Cat-dm: Controllable accelerated virtual try-on with diffu- sion model,","venue":null,"work_id":"10e4e376-f7cf-43b9-ae0a-0ac8491bf32a","year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.451757Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:dc6c3b152e9c64eebf72b8bcbfca9a36ad5d2b06c98c5cf6284b8ae8ed139301","observation_id":"0d4582a0-57f0-4dcf-a4bd-20ca3c36c912","resolution":{"observed_at":"2026-08-10T20:23:42.046765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:41.946428Z","title":"Multimodal garment designer: Human- centric latent diffusion models for fashion image editing,","venue":null,"work_id":"3c5d6ff2-3db0-4113-a2d9-32b08e6acf82","year":2023},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.457069Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:3cfbfcf8e6fcfe38f0d3201723b3b5c5779c8a053656a5bdbb3d537ae888635d","observation_id":"b8168b2c-a642-422c-8268-9603ad672aff","resolution":{"observed_at":"2026-08-10T20:23:41.966118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:41.929424Z","title":"Paint by example: Exemplar-based image editing with diffusion models,","venue":null,"work_id":"02ce08b6-2981-4a72-928d-0002d37d9e5d","year":2023},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.462209Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:c221138dd88daaac4cd86571348e8618c953688cfa7c94e2ec8503ad19802744","observation_id":"ec3d2185-6b87-4195-9aff-73d7949f0f55","resolution":{"observed_at":"2026-08-10T20:23:41.934849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11794","last_updated":"2024-05-28T04:08:09Z","snapshot_observed_at":"2026-08-16T13:51:25.943279Z","submitted_at":"2024-05-20T05:28:22Z","title":"ViViD: Video Virtual Try-on using Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11794","snapshot_observed_at":"2026-08-10T20:23:41.467754Z","title":"Vivid: Video virtual try-on using diffusion models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.467754Z"},"links":{"cited_paper":"/paper/2405.11794","citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:f76f6521f70dde408c185eb4559af3caeb8069a25547fa21afa0d738685de4a9","observation_id":"814bbeae-7d9b-4220-a198-0a969c59d755","resolution":{"observed_at":"2026-08-10T20:23:41.467754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:41.893126Z","title":"Fresco: Spatial- temporal correspondence for zero-shot video translation,","venue":null,"work_id":"3896f0f1-4509-4459-b2f3-e17ca515b9c8","year":2024},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.473455Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:fc91764e8aaca324339180d881f930b2dcaf4dd4a0e2b05de2f2ddfa51ebe380","observation_id":"fd6e0799-3c37-4d05-a737-8bdc91831b0b","resolution":{"observed_at":"2026-08-10T20:23:41.916071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:41.812531Z","title":"Lvcd: reference-based lineart video colorization with diffusion models,","venue":null,"work_id":"0564aa63-dc47-4985-888b-45b7a81cc546","year":null},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.478486Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:1b9d9d9ddc1460b00f0ef5a1414e00249c9693020d452d2386eac224938b7c3d","observation_id":"9c4ea21c-aaf8-448e-ae38-421aefa52545","resolution":{"observed_at":"2026-08-10T20:23:41.819877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:23:41.761964Z","title":"Detectron2,","venue":null,"work_id":"be4ceb0e-0e2f-4f75-8380-80d88d5bfe6b","year":2019},"citing_paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T20:23:41.484020Z"},"links":{"citing_paper":"/paper/2501.08682"},"observation_digest":"sha256:d096d6b7c9e1c5ce9fcb7b1d58c2e314f799af051d9f8647c666ab3368080666","observation_id":"4b5c0654-a605-497c-ab96-a0ab08d6ca5a","resolution":{"observed_at":"2026-08-10T20:23:41.799815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.08682","last_updated":"2025-03-11T10:06:51Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T01:10:40.475669Z","submitted_at":"2025-01-15T09:22:38Z","title":"RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 4 inbound Pith citation observations for arXiv:2501.08682."}