{"as_of":"2026-08-11T09:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4c11ea85b687c3be26e0d25a3c3e1bda4cce474c411037829a9fd3d667809176","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:28:50.661750Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T19:59:50.198365Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11325","snapshot_observed_at":"2026-08-05T19:39:09.389257Z","title":"Catv2ton: Taming diffusion transformers for vision-based virtual try-on with temporal concatenation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12131","last_updated":"2025-08-16T18:50:31Z","snapshot_observed_at":"2026-08-10T04:10:29.400583Z","submitted_at":"2025-08-16T18:50:31Z","title":"DualFit: A Two-Stage Virtual Try-On via Warping and Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:09.389257Z"},"links":{"cited_paper":"/paper/2501.11325","citing_paper":"/paper/2508.12131"},"observation_digest":"sha256:e1eb3b4c2e2b0df9af752cfb4e68c9afea506a42920af1db4869f6a39419f7db","observation_id":"63f48028-f42b-43c5-b052-a43228267e4e","resolution":{"observed_at":"2026-08-05T19:39:09.389257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"cited_work":{"arxiv_id":"2501.11325","doi":"10.48550/arxiv.2501.11325","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.11325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Catv2ton: Taming diffusion transformers for vision-based virtual try-on with temporal concatenation","venue":"ArXiv.org","work_id":"b927cc63-1c57-4aec-acba-8599e8157ea9","year":2025},"citing_paper":{"arxiv_id":"2511.00956","last_updated":"2026-04-26T05:07:45Z","snapshot_observed_at":"2026-07-06T22:34:43.577332Z","submitted_at":"2025-11-02T14:32:31Z","title":"RefTon: Reference person shot assist virtual Try-on","version":6},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T01:39:44.746738Z"},"links":{"cited_paper":"/paper/2501.11325","citing_paper":"/paper/2511.00956"},"observation_digest":"sha256:a25caa770194790f4efe96ab3197825e995c7118fa863a54eb69d17e856a5a24","observation_id":"613250bc-8767-4bed-b8e0-0bf4429eccc1","resolution":{"observed_at":"2026-05-18T01:40:36.945734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"cited_work":{"arxiv_id":"2501.11325","doi":"10.48550/arxiv.2501.11325","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.11325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Catv2ton: Taming diffusion transformers for vision-based virtual try-on with temporal concatenation","venue":"ArXiv.org","work_id":"b927cc63-1c57-4aec-acba-8599e8157ea9","year":2025},"citing_paper":{"arxiv_id":"2511.18957","last_updated":"2026-04-13T02:31:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T10:19:56Z","title":"Eevee: Towards Close-up High-resolution Video-based Virtual Try-on","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T06:34:45.045267Z"},"links":{"cited_paper":"/paper/2501.11325","citing_paper":"/paper/2511.18957"},"observation_digest":"sha256:8f23cc9210e34bedc9e3066bd061831a7dd2e5d5498f6d679f27adcd8f914692","observation_id":"a2edb72d-f071-4f76-968e-086f38f70d1c","resolution":{"observed_at":"2026-05-17T06:39:10.514029Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"cited_work":{"arxiv_id":"2501.11325","doi":"10.48550/arxiv.2501.11325","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.11325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Catv2ton: Taming diffusion transformers for vision-based virtual try-on with temporal concatenation","venue":"ArXiv.org","work_id":"b927cc63-1c57-4aec-acba-8599e8157ea9","year":2025},"citing_paper":{"arxiv_id":"2512.20340","last_updated":"2026-04-29T12:00:44Z","snapshot_observed_at":"2026-08-02T10:18:36.960036Z","submitted_at":"2025-12-23T13:15:31Z","title":"The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T20:06:30.109866Z"},"links":{"cited_paper":"/paper/2501.11325","citing_paper":"/paper/2512.20340"},"observation_digest":"sha256:687143b581903666f7de89f9a260e72bec0fd4ce7565c853477fae89fbd443c0","observation_id":"d01d985a-813b-498b-a54f-d63559ce24eb","resolution":{"observed_at":"2026-05-16T20:08:22.952453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"cited_work":{"arxiv_id":"2501.11325","doi":"10.48550/arxiv.2501.11325","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.11325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Catv2ton: Taming diffusion transformers for vision-based virtual try-on with temporal concatenation","venue":"ArXiv.org","work_id":"b927cc63-1c57-4aec-acba-8599e8157ea9","year":2025},"citing_paper":{"arxiv_id":"2604.27958","last_updated":"2026-04-30T14:53:44Z","snapshot_observed_at":"2026-08-10T21:43:59.725969Z","submitted_at":"2026-04-30T14:53:44Z","title":"TripVVT: A Large-Scale Triplet Dataset and a Coarse-Mask Baseline for In-the-Wild Video Virtual Try-On","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T05:43:04.644875Z"},"links":{"cited_paper":"/paper/2501.11325","citing_paper":"/paper/2604.27958"},"observation_digest":"sha256:61f80f6b4f0256ebd5ff6f7ab3a53546f14624b851f8786d3b5ad4440d5a3d80","observation_id":"b33e6942-0c9e-429d-9529-834e0e36c7bf","resolution":{"observed_at":"2026-05-09T05:05:12.363779Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"cited_work":{"arxiv_id":"2501.11325","doi":"10.48550/arxiv.2501.11325","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.11325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Catv2ton: Taming diffusion transformers for vision-based virtual try-on with temporal concatenation","venue":"ArXiv.org","work_id":"b927cc63-1c57-4aec-acba-8599e8157ea9","year":2025},"citing_paper":{"arxiv_id":"2606.08514","last_updated":"2026-08-04T12:17:45Z","snapshot_observed_at":"2026-08-11T09:27:50.623738Z","submitted_at":"2026-06-07T08:40:43Z","title":"OmniTryOn: Video Try-On Anything at Once!","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T19:00:44.243335Z"},"links":{"cited_paper":"/paper/2501.11325","citing_paper":"/paper/2606.08514"},"observation_digest":"sha256:d68e2005e51a066b4eea0b8f20218e2e3f66d94e8936f7fcbc5a782f23f6d2a5","observation_id":"a6a41355-54d0-40f6-8801-718da040d241","resolution":{"observed_at":"2026-07-02T22:17:26.403243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"cited_work":{"arxiv_id":"2501.11325","doi":"10.48550/arxiv.2501.11325","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.11325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Catv2ton: Taming diffusion transformers for vision-based virtual try-on with temporal concatenation","venue":"ArXiv.org","work_id":"b927cc63-1c57-4aec-acba-8599e8157ea9","year":2025},"citing_paper":{"arxiv_id":"2606.26092","last_updated":"2026-07-03T12:28:57Z","snapshot_observed_at":"2026-08-10T18:41:47.962564Z","submitted_at":"2026-06-24T17:59:06Z","title":"TryOnCrafter: Unleashing Camera Trajectories for Realistic Video Virtual Try-on via a Renderable 4D Try-on Proxy","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-25T19:20:45.217627Z"},"links":{"cited_paper":"/paper/2501.11325","citing_paper":"/paper/2606.26092"},"observation_digest":"sha256:c2c652e81f0c4c24673cd3228ec5757d48225f43c4138c4cb6444cfc10c17654","observation_id":"06f0404a-c56f-40ad-81fc-9c210b9126de","resolution":{"observed_at":"2026-07-04T21:00:08.934039Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11325","snapshot_observed_at":"2026-07-12T12:05:10.800662Z","title":"arXiv preprint arXiv:2501.11325 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26092","last_updated":"2026-07-03T12:28:57Z","snapshot_observed_at":"2026-08-10T18:41:47.962564Z","submitted_at":"2026-06-24T17:59:06Z","title":"TryOnCrafter: Unleashing Camera Trajectories for Realistic Video Virtual Try-on via a Renderable 4D Try-on Proxy","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T12:05:10.800662Z"},"links":{"cited_paper":"/paper/2501.11325","citing_paper":"/paper/2606.26092"},"observation_digest":"sha256:cf920f7fbaac5a3e7a1caede7102c32a129045faaf073344a56a510e22a001d4","observation_id":"475d2fb4-2dbf-4ef1-b6a7-68925d095935","resolution":{"observed_at":"2026-07-12T12:05:10.800662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11325","snapshot_observed_at":"2026-08-04T17:55:19.469516Z","title":"arXiv preprint arXiv:2501.11325 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.469516Z"},"links":{"cited_paper":"/paper/2501.11325","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:69cc99093ca59569f3e0dc3b0aada94ad21ea5cd1b4f9c8d3ae8b6dc6d5e639d","observation_id":"5e1943a3-2872-4aa0-897d-08668255fe95","resolution":{"observed_at":"2026-08-04T17:55:19.469516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11325","snapshot_observed_at":"2026-08-08T00:18:10.195371Z","title":"arXiv preprint arXiv:2501.11325 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05745","last_updated":"2026-08-06T08:29:47Z","snapshot_observed_at":"2026-08-10T23:08:33.739169Z","submitted_at":"2026-08-06T08:29:47Z","title":"UniVVT: A Unified End-to-End Framework for High-Fidelity Video Virtual Try-on","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T00:18:10.195371Z"},"links":{"cited_paper":"/paper/2501.11325","citing_paper":"/paper/2608.05745"},"observation_digest":"sha256:fe6c348b0b2d1dc10370a3fc1e37373e75c76ef23565c2ac959937be5ad5baa3","observation_id":"5e46ed22-d538-4b1c-8a72-b8cbaec1f2b9","resolution":{"observed_at":"2026-08-08T00:18:10.195371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11325","snapshot_observed_at":"2026-08-10T19:59:50.198365Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06836","last_updated":"2026-08-07T05:54:47Z","snapshot_observed_at":"2026-08-11T09:10:42.505372Z","submitted_at":"2026-08-07T05:54:47Z","title":"GOPI: Generation-Oriented 3D Pose Inference for Furniture Insertion from Single-View RGB-D Indoor Scenes","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T19:59:50.198365Z"},"links":{"cited_paper":"/paper/2501.11325","citing_paper":"/paper/2608.06836"},"observation_digest":"sha256:8fa75f1d269d9ff4f0eca2074500dbc59de59bfac23d521e03c9372411267123","observation_id":"b963571b-dc01-41fe-a345-5c92519dca3e","resolution":{"observed_at":"2026-08-10T19:59:50.198365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.11325/citation-record","integrity":"/paper/2501.11325/integrity","json":"/paper/2501.11325/citation-record.json","paper":"/paper/2501.11325"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.396565Z","title":"Sutherland, Michael Arbel, and Arthur Gretton","venue":null,"work_id":"1f464534-4648-4006-9c87-db52456eba94","year":2021},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:49.460751Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:cf71acb78a4781dbb6617a89c09df1dc86f1418fc9f0e83ba4188d81eda9c5f0","observation_id":"7a561bb7-defa-44f7-b2dc-e9a9832a40ee","resolution":{"observed_at":"2026-08-10T18:28:51.401929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.382306Z","title":null,"venue":null,"work_id":"6e90aab1-c4b4-4c9d-af2f-272b198f549b","year":2019},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:49.493259Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:a0061acc09e32fc687e00839bf05e9d8dfbe4958408f54f00673472524c7ab79","observation_id":"345b28ac-bf28-4e90-bda9-df33f20ebccb","resolution":{"observed_at":"2026-08-10T18:28:51.387469Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.370260Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset, 2018","venue":null,"work_id":"79aa23a2-a4ce-4ea3-bf90-74b0f67b5aff","year":2018},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:49.496985Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:e2d92d285c0d2c7efadc83ffb6968f03db35332190c21f193ef94ccb84a40b64","observation_id":"80d55974-8f20-481c-a38b-c609b0c365a5","resolution":{"observed_at":"2026-08-10T18:28:51.374420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.356698Z","title":"Stable- video: Text-driven consistency-aware diffusion video edit- ing","venue":null,"work_id":"65d2b0fc-210f-4f84-8323-93b5815ac309","year":2023},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:49.500942Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:68c03754c331fa79f125c48064cf3f02bd0e4e883f174d8e3833aa426ff84423","observation_id":"83289c2f-0b53-42e7-b87e-108b0baf897f","resolution":{"observed_at":"2026-08-10T18:28:51.361501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12965","last_updated":"2024-03-19T17:59:52Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Wear-Any-Way: Manipulable Virtual Try-on via Sparse Correspondence Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12965","snapshot_observed_at":"2026-08-10T18:28:49.506731Z","title":"Wear-any-way: Manip- ulable virtual try-on via sparse correspondence alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:49.506731Z"},"links":{"cited_paper":"/paper/2403.12965","citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:0b1e6ce1c96efc720df54a35c184c904dcf922885ccf2eb455349dc7cd427cae","observation_id":"30c02353-98f4-4a12-a692-eb16fa68f509","resolution":{"observed_at":"2026-08-10T18:28:49.506731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.342990Z","title":"Viton-hd: High-resolution virtual try-on via misalignment-aware normalization","venue":null,"work_id":"22d98bf6-a6de-43c1-9eab-56c37fa394fc","year":2021},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:49.511978Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:a21f153cb3851312b32a1376481ba1970fc28c6a9f0d6778842392c78e0b991f","observation_id":"8db16c5e-2ee9-4648-8220-5249702834db","resolution":{"observed_at":"2026-08-10T18:28:51.347698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05139","last_updated":"2024-07-29T09:15:33Z","snapshot_observed_at":"2026-07-06T17:41:27.341898Z","submitted_at":"2024-03-08T08:12:18Z","title":"Improving Diffusion Models for Authentic Virtual Try-on in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05139","snapshot_observed_at":"2026-08-10T18:28:49.659080Z","title":"Improving diffusion models for vir- tual try-on","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:49.659080Z"},"links":{"cited_paper":"/paper/2403.05139","citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:e2ec81932715987cfe51af8b9971e62d468d79db2ed5bf31b0fc6dabc05e6d60","observation_id":"60115b94-96f8-4022-a6a4-df2c5ca6aa1a","resolution":{"observed_at":"2026-08-10T18:28:49.659080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15886","last_updated":"2025-02-16T03:41:41Z","snapshot_observed_at":"2026-08-10T19:03:45.164103Z","submitted_at":"2024-07-21T11:58:53Z","title":"CatVTON: Concatenation Is All You Need for Virtual Try-On with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15886","snapshot_observed_at":"2026-08-10T18:28:49.699961Z","title":"Catvton: Concatenation is all you need for virtual try- on with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:49.699961Z"},"links":{"cited_paper":"/paper/2407.15886","citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:a7893fac281ab951c71461008620ab4f3acd9ed51efa4d6b2fd68571d02890b4","observation_id":"b39549e5-aba9-4d06-900c-93b1c543c1a2","resolution":{"observed_at":"2026-08-10T18:28:49.699961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.322898Z","title":"Openmmlab pose estimation tool- box and benchmark","venue":null,"work_id":"59a06138-5490-465a-bfa0-de7b736ec6a2","year":2020},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:49.705155Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:08a2de05d4951cd6e040545cf3c393a2da1abadda853152bfb2445ed55e5617a","observation_id":"2160f86b-42e1-414a-92a4-6689e6bd94cc","resolution":{"observed_at":"2026-08-10T18:28:51.327230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.309656Z","title":"Fw-gan: Flow-navigated warping gan for video virtual try-on","venue":null,"work_id":"ce74335f-f65b-4777-9716-3350311568e5","year":2019},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:49.709275Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:7ae61fb7166cdef6c8a8f7b9062d866601023e492dec1dc6330c32542e74444e","observation_id":"097613e5-3b38-4c5d-ac12-4ba9056aa5de","resolution":{"observed_at":"2026-08-10T18:28:51.314341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.295354Z","title":"Fw-gan: Flow-navigated warping gan for video virtual try-on","venue":null,"work_id":"1aa75929-03fd-493d-901a-dd63d80ad341","year":2019},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:49.713762Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:4bc9aec92b80ab55f6dfa38f3fef63872feab4b4b2a81949f22c82c1cdb76d31","observation_id":"ea2d2b95-82c0-4f89-ae2d-fe90e7d187ac","resolution":{"observed_at":"2026-08-10T18:28:51.299948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:49.718317Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:49.718317Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:52a9de71570eecaa8daea5546865652d3ac3c7d6d2e33f0755a6a7c0695f4ba0","observation_id":"2cef41e5-5bd8-4c8b-8584-acaab768cfc7","resolution":{"observed_at":"2026-08-10T18:28:49.718317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:49.722984Z","title":"Vivid: Video virtual try-on using diffusion models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:49.722984Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:1bd1a579911dd0149ea2bd17697fa6d959b87a369ad5340f7af099b18edcbdd2","observation_id":"44438eb5-a6c4-44be-8411-6123a5d24b5f","resolution":{"observed_at":"2026-08-10T18:28:49.722984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.266221Z","title":"Taming the power of diffusion models for high-quality virtual try-on with appearance flow","venue":null,"work_id":"bf45e95d-e5c0-4e11-9202-75f841131270","year":2023},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:49.733804Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:73de207dd08058b7b4c7b9d13f312dc674eb5f2bc0939aaaddb3e3e7085c2be5","observation_id":"b39bafa2-d45b-4bd8-bd74-623147e10097","resolution":{"observed_at":"2026-08-10T18:28:51.271263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.254789Z","title":"Densepose: Dense human pose estimation in the wild, 2018","venue":null,"work_id":"c82b0e97-5bcc-4a92-ac0e-a886b4cf59eb","year":2018},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:49.821668Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:b97812b02920faea35116339cbd0480916ffdc0240186d71a72968ec9eb30e8f","observation_id":"53693d28-3dd1-4b4a-827a-02c853d67bcb","resolution":{"observed_at":"2026-08-10T18:28:51.258679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10625","last_updated":"2024-07-15T11:21:03Z","snapshot_observed_at":"2026-08-04T16:35:50.550791Z","submitted_at":"2024-07-15T11:21:03Z","title":"WildVidFit: Video Virtual Try-On in the Wild via Image-Based Controlled Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10625","snapshot_observed_at":"2026-08-10T18:28:49.900258Z","title":"Wildvidfit: Video virtual try- on in the wild via image-based controlled diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:49.900258Z"},"links":{"cited_paper":"/paper/2407.10625","citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:87057571efa4915dc28956c2e50297d28c12257c33ab787112cb05e70f996a67","observation_id":"f7e9cb6c-f0b6-4c02-b8d8-eceac790db01","resolution":{"observed_at":"2026-08-10T18:28:49.900258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.242984Z","title":"Classifier-free diffusion guidance, 2022","venue":null,"work_id":"f175de3e-ed97-47a9-88fb-35e9e1508322","year":2022},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:49.905398Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:f9fab2831a37a63943af7c24c88f67f4b1a1817576c9ab4a07caedf4c7367d09","observation_id":"bfa5eaf7-7c83-42fb-b3c2-4af709ca7905","resolution":{"observed_at":"2026-08-10T18:28:51.246948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:49.909345Z","title":"Classifier-free diffusion guidance, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:49.909345Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:8b0f80ba256a6364bea9cd843e5cd6e6585a1d7258a2467eeaa3a1ea4e69be58","observation_id":"48317c8a-2fa0-442f-8486-cd1a3f205184","resolution":{"observed_at":"2026-08-10T18:28:49.909345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.222092Z","title":"Denoising diffu- sion probabilistic models, 2020","venue":null,"work_id":"6078fcb2-a10d-46f9-a740-83752a5a7ac2","year":2020},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:49.912930Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:8b27407d2cd8aaae32748ab334cc83a540c2038b02143139e9538b33d14b3858","observation_id":"17535412-defb-49cf-8917-a7bb2154c837","resolution":{"observed_at":"2026-08-10T18:28:51.227917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-10T18:28:49.916983Z","title":"Imagen video: High definition video generation with diffusion mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:49.916983Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:791e842ae0e7729a874f0a1f737c73ede4738353a218f64d867591d55fa9898e","observation_id":"41813d4d-c6dd-48b3-9d5e-54d4b1dcfd20","resolution":{"observed_at":"2026-08-10T18:28:49.916983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:49.923084Z","title":"Animate anyone: Consistent and controllable image- to-video synthesis for character animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:49.923084Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:25cf50c03b170619ecd60c570a73884f0902d35f6ea49e36d2f5fd8ed51c18cd","observation_id":"392ee7f8-6321-4627-9dab-0fcdd1b20bd7","resolution":{"observed_at":"2026-08-10T18:28:49.923084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.203799Z","title":"Arbitrary style transfer in real-time with adaptive instance normalization, 2017","venue":null,"work_id":"346ae1cb-5f3e-4bd9-8a31-c16a04ecc9c1","year":2017},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.011587Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:971c5eda67f139a1edc2432f6dd529f99b917e76cad0cecd819952542ea131ba","observation_id":"190f2057-8fdf-46a0-b722-ca981efbeba4","resolution":{"observed_at":"2026-08-10T18:28:51.207728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.192509Z","title":"Cloth- former: Taming video virtual try-on in all module","venue":null,"work_id":"0cd19ffd-71c9-476b-9517-b0dacae7abee","year":2022},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.102385Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:d23bb9eed53ae1d4c89343432ec4d02af8cd8deb89cf62bcb58eab8ca1583ac3","observation_id":"d9fcc7b9-80b9-42e4-9323-41abc53f5420","resolution":{"observed_at":"2026-08-10T18:28:51.196215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.181826Z","title":"Stableviton: Learning semantic correspon- dence with latent diffusion model for virtual try-on, 2023","venue":null,"work_id":"ada78cd8-0c97-4802-9029-e05d7a632589","year":2023},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.106625Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:277761f30d5ffe2d5fab4606790bb148f681a702005a9c58d325110bedf9cae9","observation_id":"6fd2622e-8563-452a-be8c-ffa8b30879fc","resolution":{"observed_at":"2026-08-10T18:28:51.185480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03667","last_updated":"2023-12-06T18:34:32Z","snapshot_observed_at":"2026-07-06T16:57:51.263433Z","submitted_at":"2023-12-06T18:34:32Z","title":"WarpDiffusion: Efficient Diffusion Model for High-Fidelity Virtual Try-on","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03667","snapshot_observed_at":"2026-08-10T18:28:50.110511Z","title":"Warpdif- fusion: Efficient diffusion model for high-fidelity virtual try- on","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.110511Z"},"links":{"cited_paper":"/paper/2312.03667","citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:89145d261ba824c1a40735b0f575d299e45389e61ae902a983e3ba1bf1ddaff0","observation_id":"1509bf5c-3251-49e3-9de3-0d371a840499","resolution":{"observed_at":"2026-08-10T18:28:50.110511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.170888Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion trans- former with fine-grained chinese understanding, 2024","venue":null,"work_id":"c3d933cc-1f24-4f2d-b9d8-ce36d8d7c534","year":2024},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.113930Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:41f012a78168ed43e1f93c5ada71715b5da093ff9d3d1bae9e054e6b6a55d9ec","observation_id":"02534ac0-df6e-415a-b573-ba7073244cfb","resolution":{"observed_at":"2026-08-10T18:28:51.174759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:50.119155Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.119155Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:baab2a2f6bfbc538290d0918f7ecd5b2509ba55b1ce6ab780ce060fed1abc885","observation_id":"b8d832fb-b01f-4666-8de0-e2e709f0f8f5","resolution":{"observed_at":"2026-08-10T18:28:50.119155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:50.124902Z","title":"Follow your pose: Pose- guided text-to-video generation using pose-free videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.124902Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:1ad40c44a5c280476973d71f06ef29896132d3c509918537981ebb8f6e8be78c","observation_id":"0badffb3-5b22-4eb0-94c4-12156bce61ac","resolution":{"observed_at":"2026-08-10T18:28:50.124902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01329","last_updated":"2023-02-02T18:58:58Z","snapshot_observed_at":"2026-07-06T14:47:48.494911Z","submitted_at":"2023-02-02T18:58:58Z","title":"Dreamix: Video Diffusion Models are General Video Editors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01329","snapshot_observed_at":"2026-08-10T18:28:50.186762Z","title":"Dreamix: Video diffusion models are general video editors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.186762Z"},"links":{"cited_paper":"/paper/2302.01329","citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:460a1f257910eeb19cde24f7ca8d590894ffb051061d14351bd1950dc8ffafa5","observation_id":"9c84521f-005f-436e-ad1a-a92e06b510b1","resolution":{"observed_at":"2026-08-10T18:28:50.186762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.144976Z","title":"Dress code: High- resolution multi-category virtual try-on, 2022","venue":null,"work_id":"6dce7008-ff97-4fe2-a7fe-bd6c09eadf80","year":2022},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.239005Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:c5a5201e47efdeda256bcd7611ae650d08092835cee6d80ba4b85428b68b617c","observation_id":"8062690f-72a3-418a-9d30-85840fa5e618","resolution":{"observed_at":"2026-08-10T18:28:51.149820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.135254Z","title":"LaDI- VTON: Latent Diffusion Textual-Inversion Enhanced Virtual Try-On","venue":null,"work_id":"a6ddd635-bec6-4ca4-8080-e2bf3ff6cea7","year":2023},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.242926Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:48c9c559edef0599e2a72e358baafd28af2821138274fbd66a62afb035f3439a","observation_id":"34c4b6d4-f91b-4be5-a98a-7b1bc5974741","resolution":{"observed_at":"2026-08-10T18:28:51.138440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-10T18:28:50.247193Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.247193Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:078ded4b10bf2f795509990c7293bed9f0306eb528c54eef70666b06e4c2fa14","observation_id":"74281462-eed0-4155-8315-e704776d07c8","resolution":{"observed_at":"2026-08-10T18:28:50.247193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.124397Z","title":"Controlnext: Powerful and effi- cient control for image and video generation, 2024","venue":null,"work_id":"37989362-8baf-488a-abc3-483b1062c4a4","year":2024},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.252128Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:9e5006ceada4d33cafa7b8eb0c6b074bfa240e3f72c39f92af957608b92a31f2","observation_id":"3147ecc9-ea73-4fd5-9635-7a61e78326f4","resolution":{"observed_at":"2026-08-10T18:28:51.128001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:50.255973Z","title":"Fatezero: Fus- ing attentions for zero-shot text-based video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.255973Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:456a997c5d4eead281a3fac5f8690cdb86203f972cee3d66bd42bdaf8e2ba46c","observation_id":"7dbbdbae-13ab-4799-bf33-026646ae1c22","resolution":{"observed_at":"2026-08-10T18:28:50.255973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:50.259610Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.259610Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:0cf1f2a9564976e38a5048bfdc0a1efc3124cade5d45aa41b0921a41c67590a3","observation_id":"b13176e9-ea3c-4045-b13c-c0e9928d10cf","resolution":{"observed_at":"2026-08-10T18:28:50.259610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:50.263950Z","title":"pytorch-fid: FID Score for PyTorch","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.263950Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:59271b482b6d39f0055eb04ca13a12513e66f248df00e15e4c7cb7c42c3dfd55","observation_id":"b7383985-c694-454d-bdcb-84c9e4c5a7ed","resolution":{"observed_at":"2026-08-10T18:28:50.263950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12705","last_updated":"2024-08-06T13:06:26Z","snapshot_observed_at":"2026-08-09T18:34:17.959690Z","submitted_at":"2024-07-17T16:26:30Z","title":"IMAGDressing-v1: Customizable Virtual Dressing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12705","snapshot_observed_at":"2026-08-10T18:28:50.353671Z","title":"Imagdressing-v1: Customiz- able virtual dressing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.353671Z"},"links":{"cited_paper":"/paper/2407.12705","citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:214eb1e0a50d55a4d0003cfecd047205920f976c6241f0836e660ceaafaa2a7b","observation_id":"173f627c-e658-4975-a7b2-242854d86e56","resolution":{"observed_at":"2026-08-10T18:28:50.353671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-10T18:28:50.433894Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.433894Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:a13b6735484e38f9128287572a6967f94da7efb92a990259810c0aa31a6f3b10","observation_id":"2f562451-ada4-4466-889f-5e139339e909","resolution":{"observed_at":"2026-08-10T18:28:50.433894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:50.440142Z","title":"Roformer: Enhanced transformer with rotary position embedding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.440142Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:3e54eab3b67ee8fa2607beb0731c7b46c90a8a486afa905ede2ebb90f1b65548","observation_id":"30bbabd4-c3a5-4d3e-b22b-fb5669e2184b","resolution":{"observed_at":"2026-08-10T18:28:50.440142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16224","last_updated":"2024-07-23T07:04:42Z","snapshot_observed_at":"2026-07-06T18:50:31.528338Z","submitted_at":"2024-07-23T07:04:42Z","title":"OutfitAnyone: Ultra-high Quality Virtual Try-On for Any Clothing and Any Person","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16224","snapshot_observed_at":"2026-08-10T18:28:50.444165Z","title":"Outfitanyone: Ultra-high quality virtual try-on for any clothing and any person","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.444165Z"},"links":{"cited_paper":"/paper/2407.16224","citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:274e4af8e3cbffae8244fec839ec4f64bc89bffbb9ea91d69c98538babd87679","observation_id":"fbbdf039-56e6-4396-b48b-712576acd5a5","resolution":{"observed_at":"2026-08-10T18:28:50.444165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.088357Z","title":null,"venue":null,"work_id":"594e2b83-f3b1-4f83-9f7f-9b5e2ac59932","year":2020},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.450455Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:486520c13eff1f4da68e2d26b3d5bfaec87550c3712c3a2ddb74449da81dfe64","observation_id":"0408ad54-acd8-43cc-b8c4-c44e983d1e0e","resolution":{"observed_at":"2026-08-10T18:28:51.092095Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08258","last_updated":"2024-09-12T17:55:11Z","snapshot_observed_at":"2026-07-06T19:14:33.669810Z","submitted_at":"2024-09-12T17:55:11Z","title":"Improving Virtual Try-On with Garment-focused Diffusion Models","version":1},"cited_work":{"arxiv_id":"2409.08258","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.08258","snapshot_observed_at":"2026-08-10T18:28:50.887085Z","title":"Improving Virtual Try-On with Garment-focused Diffusion Models","venue":"cs.CV","work_id":"ec56a299-73a6-4550-86bc-75eb1c32c756","year":2024},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.454775Z"},"links":{"cited_paper":"/paper/2409.08258","citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:055ded504d77dd1c9a5609478f86973bb35039e110c4edc081fa5acd367bb8c3","observation_id":"25349d1d-06a5-4c6a-a09d-8d7278cfddb5","resolution":{"observed_at":"2026-08-10T18:28:50.893262Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17364","last_updated":"2025-01-05T14:31:28Z","snapshot_observed_at":"2026-08-08T09:01:45.149806Z","submitted_at":"2024-04-26T12:27:57Z","title":"MV-VTON: Multi-View Virtual Try-On with Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17364","snapshot_observed_at":"2026-08-10T18:28:50.459347Z","title":"Mv-vton: Multi-view virtual try-on with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.459347Z"},"links":{"cited_paper":"/paper/2404.17364","citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:14a8300c298a29f119db3fced5ca37e5a9dca7c0182feeff87aee81e775c904a","observation_id":"ec12c26f-d431-436e-a304-961b283330aa","resolution":{"observed_at":"2026-08-10T18:28:50.459347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10783","last_updated":"2024-03-16T03:05:07Z","snapshot_observed_at":"2026-07-06T17:45:35.519457Z","submitted_at":"2024-03-16T03:05:07Z","title":"StableGarment: Garment-Centric Generation via Stable Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10783","snapshot_observed_at":"2026-08-10T18:28:50.548037Z","title":"Stablegar- ment: Garment-centric generation via stable diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.548037Z"},"links":{"cited_paper":"/paper/2403.10783","citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:f9fea5f935717e41328b38648e67a619a0dc8e0523be4b362fd10bb4aeb18271","observation_id":"ee5b1cc9-383b-420f-9104-f8216d3beda9","resolution":{"observed_at":"2026-08-10T18:28:50.548037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:50.605803Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.605803Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:d8232bd556083adb32c8cfe929ea28ee804c2b545f5bd1a5a3bb1ee3587991c8","observation_id":"27ae57d2-5c1b-4b77-a5af-d134a1d9c466","resolution":{"observed_at":"2026-08-10T18:28:50.605803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:50.610056Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.610056Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:27aa3bd878056a5f7cc3afeb6a15fd2d354407741368d65e744971eda81ad379","observation_id":"a1c09288-cd8e-44d1-ac2b-56bc7d25a428","resolution":{"observed_at":"2026-08-10T18:28:50.610056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.064551Z","title":"Pasta-gan++: A versatile framework for high- resolution unpaired virtual try-on, 2022","venue":null,"work_id":"737d9ffc-fcf4-4e66-93ae-61cbebf8d3a6","year":2022},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.614193Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:abdcb14f2c13e16c6a845f1113fb3e72f04944f70bc3580839eaa60d9a65e3aa","observation_id":"6a09cde0-cc96-4e25-91a6-3f4b1052fddb","resolution":{"observed_at":"2026-08-10T18:28:51.068169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.052920Z","title":"Gp- vton: Towards general purpose virtual try-on via collabora- tive local-flow global-parsing learning","venue":null,"work_id":"b37f230c-9342-4104-b042-cbe0281e58b1","year":2023},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.618403Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:092b39a4170d4a1fb00e4f4fc08c3e8c64cbadf1bdf642cee19138112f7f5bd3","observation_id":"ee5559a9-7664-4f8b-bbce-db6ec935c765","resolution":{"observed_at":"2026-08-10T18:28:51.056818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:50.622147Z","title":"Easyanimate: 10 A high-performance long video generation method based on transformer architecture","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.622147Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:6718e982be4faf264f34a6aa6698ee5306e137055bd80e5f815147a1d30139d7","observation_id":"da042454-960d-4eef-9618-fc2b2ee33e72","resolution":{"observed_at":"2026-08-10T18:28:50.622147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.041148Z","title":"Easyanimate: A high-performance long video generation method based on transformer architecture, 2024","venue":null,"work_id":"8571213b-d6d4-4fac-975f-fbf2545d1f90","year":2024},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.625851Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:2fb0ae0b098f0c53f83becdfe91d8bc411067099c78b3bd9cc7024d3489b6bfe","observation_id":"104817aa-6cde-4a2c-9d94-4114c05c8755","resolution":{"observed_at":"2026-08-10T18:28:51.045417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01779","last_updated":"2024-03-07T06:35:35Z","snapshot_observed_at":"2026-08-10T19:02:55.763306Z","submitted_at":"2024-03-04T07:17:44Z","title":"OOTDiffusion: Outfitting Fusion based Latent Diffusion for Controllable Virtual Try-on","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01779","snapshot_observed_at":"2026-08-10T18:28:50.629353Z","title":"Oot- diffusion: Outfitting fusion based latent diffusion for control- lable virtual try-on","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.629353Z"},"links":{"cited_paper":"/paper/2403.01779","citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:10357063e3f50001020f3318a06e5fc2fb666c0c89c57bea76f0894a58557cd1","observation_id":"43f66974-7fea-4509-afc5-ae5fe05215b9","resolution":{"observed_at":"2026-08-10T18:28:50.629353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17571","last_updated":"2024-04-26T17:55:26Z","snapshot_observed_at":"2026-07-06T18:06:16.139203Z","submitted_at":"2024-04-26T17:55:26Z","title":"Tunnel Try-on: Excavating Spatial-temporal Tunnels for High-quality Virtual Try-on in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17571","snapshot_observed_at":"2026-08-10T18:28:50.633254Z","title":"Tunnel try-on: Excavating spatial-temporal tunnels for high-quality virtual try-on in videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.633254Z"},"links":{"cited_paper":"/paper/2404.17571","citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:28061078c55a4d8fc9bb8b14802b483c9f5cbf22b59653732af0f3d706fc0d1f","observation_id":"b57880bb-d5a5-4557-8143-3c26597510ec","resolution":{"observed_at":"2026-08-10T18:28:50.633254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.030164Z","title":"Magicanimate: Temporally consistent human im- age animation using diffusion model","venue":null,"work_id":"1ccac0cf-d5be-4efc-b1c2-18b4048d02a5","year":2024},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.637380Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:c5e7e4d01a02d65e1efdbc15fb8ec0f60782448aa01fe0dcac87095531aa9e44","observation_id":"576c1648-c070-4d9e-8f88-dfbbde254bd0","resolution":{"observed_at":"2026-08-10T18:28:51.034027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:51.019731Z","title":"MAGVIT: Masked generative video transformer","venue":null,"work_id":"26bb3e88-d77a-4430-880e-1581bf4fc1cc","year":2023},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.641081Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:1972f5673d60dbe93894996c7dd42419d104339a2b68ab4450c881fd9119299d","observation_id":"f34bcf81-5118-4881-8fe9-f2dd272eb96e","resolution":{"observed_at":"2026-08-10T18:28:51.023259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:50.645638Z","title":"Video probabilistic diffusion models in projected latent space","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.645638Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:131647317cc7a8bb953a02f09ff4f617cfe4b8f89aeccab83e6ac0131676f265","observation_id":"1d0baee0-cc22-43e2-9b88-496e397cccd7","resolution":{"observed_at":"2026-08-10T18:28:50.645638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:28:50.650005Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.650005Z"},"links":{"citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:215f6f4ce95d2e1e460d4169efea97c5f0b3d1a21a699f71f2c826d339e68dc3","observation_id":"03f3a1a7-f538-487f-a1d0-f89fb5a654d5","resolution":{"observed_at":"2026-08-10T18:28:50.650005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00448","last_updated":"2024-11-20T09:40:14Z","snapshot_observed_at":"2026-08-09T22:43:59.631815Z","submitted_at":"2024-05-01T11:04:22Z","title":"MMTryon: Multi-Modal Multi-Reference Control for High-Quality Fashion Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00448","snapshot_observed_at":"2026-08-10T18:28:50.653764Z","title":"Mmtryon: Multi-modal multi-reference control for high-quality fashion generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.653764Z"},"links":{"cited_paper":"/paper/2405.00448","citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:da40a4041500efbd7d82cddd3db81eb5af98160aeb8463ec6b9b2e42df490969","observation_id":"13829b45-8a96-42eb-8960-0c107af51299","resolution":{"observed_at":"2026-08-10T18:28:50.653764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18326","last_updated":"2024-06-07T16:02:10Z","snapshot_observed_at":"2026-08-10T19:02:57.409528Z","submitted_at":"2024-05-28T16:21:03Z","title":"VITON-DiT: Learning In-the-Wild Video Try-On from Human Dance Videos via Diffusion Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18326","snapshot_observed_at":"2026-08-10T18:28:50.657750Z","title":"Viton-dit: Learning in-the-wild video try-on from human dance videos via diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.657750Z"},"links":{"cited_paper":"/paper/2405.18326","citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:7843a0e31cc7cae14d3fa617eb7f655fa411c61de99cc42366fec6b4153c93df","observation_id":"8693fb83-3cbd-4f8c-80ef-f8144476624b","resolution":{"observed_at":"2026-08-10T18:28:50.657750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-10T18:28:50.661750Z","title":"Magicvideo: Efficient video generation with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T18:28:50.661750Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2501.11325"},"observation_digest":"sha256:ab14466830b8b9a8ec2bd64a26e14d4249fc5be3a21c465fe358467a188c20d8","observation_id":"09a7d7ec-8e3c-482e-9ef7-3f50616eaacb","resolution":{"observed_at":"2026-08-10T18:28:50.661750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T18:21:45.731748Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":1,"verified_fuzzy":23},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 11 inbound Pith citation observations for arXiv:2501.11325."}