{"as_of":"2026-08-18T02:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:381c9da0413f6f92e75634310e46dd693bd01b0f974b09797e6ffc48489ec185","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:32:32.396118Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.06985/citation-record","integrity":"/paper/2505.06985/integrity","json":"/paper/2505.06985/citation-record.json","paper":"/paper/2505.06985"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-08-17T22:21:14.830063Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-15T22:32:32.146031Z","title":"ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.146031Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:20f45c1a2e13d3463c7f71c780cf9d10a63fea8c59de5a65ba5cd9c771d0cb38","observation_id":"e6837bbc-9aa6-4a8d-ae48-cb324337c052","resolution":{"observed_at":"2026-08-15T22:32:32.146031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-15T22:32:32.151377Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.151377Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:5c3a79213a3741d7f28918f6675a7e8718ba594965eb6ecf30d7c1e68e76d40b","observation_id":"9897dc32-7605-4b47-9ea0-e6cbfae6b2bc","resolution":{"observed_at":"2026-08-15T22:32:32.151377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:33.215844Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":"40e48086-46e7-45b0-80c3-d7eb45fa57fe","year":2023},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.155962Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:1e0b3bea45414e27ed390c2010d6a7d82fd392b85cd1ffe62acdf1c9bfeb17d6","observation_id":"38b634a7-e0c8-4785-a001-264123536f20","resolution":{"observed_at":"2026-08-15T22:32:33.220956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:33.199445Z","title":"Still-moving: Customized video generation without customized video data","venue":null,"work_id":"3800648e-d56f-4899-bfbc-7e2bb1267eb6","year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.160099Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:c547fbb6dc376eee1dcf1f2f7b08b3320d0d64157393df8523d30e4781c48499","observation_id":"5a7b34a8-1fc4-402c-b4f7-5a57946a29ae","resolution":{"observed_at":"2026-08-15T22:32:33.203593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00990","last_updated":"2025-04-14T02:18:19Z","snapshot_observed_at":"2026-08-17T15:31:11.113292Z","submitted_at":"2023-11-02T04:38:50Z","title":"VideoDreamer: Customized Multi-Subject Text-to-Video Generation with Disen-Mix Finetuning on Language-Video Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00990","snapshot_observed_at":"2026-08-15T22:32:32.163885Z","title":"Video- dreamer: Customized multi-subject text-to-video generation with disen-mix finetuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.163885Z"},"links":{"cited_paper":"/paper/2311.00990","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:152c1b6a5de4916ff24184def24476dcb349ce773140d408943c697c2704a1a9","observation_id":"ba8d9ee9-2985-476a-8f1b-91e92336316a","resolution":{"observed_at":"2026-08-15T22:32:32.163885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10790","last_updated":"2025-02-13T16:20:05Z","snapshot_observed_at":"2026-08-16T13:53:17.996542Z","submitted_at":"2024-10-14T17:56:19Z","title":"Sitcom-Crafter: A Plot-Driven Human Motion Generation System in 3D Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10790","snapshot_observed_at":"2026-08-15T22:32:32.168454Z","title":"Sitcom-crafter: A plot-driven human motion generation sys- tem in 3d scenes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.168454Z"},"links":{"cited_paper":"/paper/2410.10790","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:6cf20fdf27cc83b5b3aaee92e6520c59b2456f6b114107f1b129c1bb4e5963ba","observation_id":"2fecdf94-cdac-4d64-a868-7c468560c4bf","resolution":{"observed_at":"2026-08-15T22:32:32.168454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05793","last_updated":"2023-09-11T19:59:43Z","snapshot_observed_at":"2026-08-16T15:01:35.965165Z","submitted_at":"2023-09-11T19:59:43Z","title":"PhotoVerse: Tuning-Free Image Customization with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05793","snapshot_observed_at":"2026-08-15T22:32:32.178322Z","title":"Photoverse: Tuning-free image customization with text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.178322Z"},"links":{"cited_paper":"/paper/2309.05793","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:e4b3602f7636fef17617781aae07e5d5cc005d3554ad7164c4723726363a0c65","observation_id":"34e6bbc9-3769-44db-a465-dc9aed044128","resolution":{"observed_at":"2026-08-15T22:32:32.178322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:32.183522Z","title":"Cats: Cost ag- gregation transformers for visual correspondence","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.183522Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:37091678d44a835917010c502c967b14467f6b6eb9232842efc71ebdeba30b83","observation_id":"ad52f914-6ad9-4ed2-b8c9-0e5af23b63df","resolution":{"observed_at":"2026-08-15T22:32:32.183522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-15T22:32:32.188607Z","title":"An image is worth one word: Personalizing text-to- image generation using textual inversion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.188607Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:ce73f55dc93bb2ea4d0a3c9e46e65e7f6b386f03a87266c69be59e31d9c6753c","observation_id":"0f1cab8b-b986-4e49-995c-fa4e2ac6b114","resolution":{"observed_at":"2026-08-15T22:32:32.188607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-17T14:04:31.230742Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-15T22:32:32.192780Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.192780Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:d1765e456c3461dbebba8ca0d1c99ebaada0a434ebdc32832bbd55c8fd46baab","observation_id":"3f6af155-4830-4b23-8656-15b0325d2000","resolution":{"observed_at":"2026-08-15T22:32:32.192780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:32.199416Z","title":"Svdiff: Compact param- eter space for diffusion fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.199416Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:30aeca514fe321213d2a79d17f042900c95dfb253e50ab10fa207a3cac17f4a1","observation_id":"46b0a418-2498-482b-9707-2f1a477667ff","resolution":{"observed_at":"2026-08-15T22:32:32.199416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00971","last_updated":"2023-12-07T17:49:30Z","snapshot_observed_at":"2026-08-16T15:27:22.842134Z","submitted_at":"2023-06-01T17:58:44Z","title":"ViCo: Plug-and-play Visual Condition for Personalized Text-to-image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00971","snapshot_observed_at":"2026-08-15T22:32:32.204264Z","title":"Vico: Plug-and-play visual condition for personalized text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.204264Z"},"links":{"cited_paper":"/paper/2306.00971","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:1f5832ac0efaf6d9bb7b9e13e12d05cd2adf1e16f689a393d8e886f805ff3dcf","observation_id":"6da2bb06-5e1c-4c2b-9d3b-59360ff52d50","resolution":{"observed_at":"2026-08-15T22:32:32.204264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15275","last_updated":"2024-06-25T16:57:27Z","snapshot_observed_at":"2026-08-16T13:58:25.984156Z","submitted_at":"2024-04-23T17:59:43Z","title":"ID-Animator: Zero-Shot Identity-Preserving Human Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15275","snapshot_observed_at":"2026-08-15T22:32:32.209426Z","title":"Id-animator: Zero-shot identity-preserving human video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.209426Z"},"links":{"cited_paper":"/paper/2404.15275","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:9363e8ded026ba682b60d33142d1510a53ca457a7fbd7788d4d8c7bc181d5ffd","observation_id":"21a000c6-425b-4027-93a9-b9f5c3b234f4","resolution":{"observed_at":"2026-08-15T22:32:32.209426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-17T16:16:01.560363Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-15T22:32:32.214092Z","title":"Latent video diffusion models for high-fidelity long video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.214092Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:ddec8df180af80c62d5d57d855b4b22eace2e626280b470bb2a5d1ba72a60331","observation_id":"3d73be6f-bd59-4eab-8336-f71a82d5a2fa","resolution":{"observed_at":"2026-08-15T22:32:32.214092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-08-17T00:44:11.103098Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-15T22:32:32.220376Z","title":"Prompt-to-prompt im- age editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.220376Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:2d8a6748ec906806157d43c87b940b9556658518d1ea4a884eff392e9da1d4e5","observation_id":"53ad9586-fd62-4cbb-a1e1-052375a64cd3","resolution":{"observed_at":"2026-08-15T22:32:32.220376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:33.172700Z","title":"Neural matching fields: Implicit representation of matching fields for visual correspondence","venue":null,"work_id":"a364f03c-3158-4e29-a35e-b03247662664","year":2022},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.229691Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:7a826aae41a658beb9faad7c7bd2ed2a6306abbfa2690cb7ac9b8bfc95056447","observation_id":"74c277a4-8b37-4b65-b68b-9656ef681800","resolution":{"observed_at":"2026-08-15T22:32:33.176564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:33.160213Z","title":"The hadamard product","venue":null,"work_id":"0f638f92-a875-40d7-a43b-b84112eeaecb","year":1990},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.235271Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:90390926b8d877c35498087e01beac4d668822d109c25c6bbced850f5c455c68","observation_id":"13c17ae7-b9ba-439a-8cdd-edc6a5098c00","resolution":{"observed_at":"2026-08-15T22:32:33.164175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:33.147995Z","title":"A reinforcement learning-based automatic video editing method using pre-trained vision-language model","venue":null,"work_id":"4aa0626a-ba46-42a4-87aa-beb9ab477d3f","year":2023},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.240721Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:35ffc5f14f37d22cbcc915310cb0937154183bae986d5996f9db670338a79be0","observation_id":"3d873e98-d321-4b9e-b6c8-87a2b00873a4","resolution":{"observed_at":"2026-08-15T22:32:33.152880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04925","last_updated":"2024-11-11T13:24:18Z","snapshot_observed_at":"2026-08-16T13:02:01.573262Z","submitted_at":"2024-11-07T18:00:33Z","title":"StoryAgent: Customized Storytelling Video Generation via Multi-Agent Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04925","snapshot_observed_at":"2026-08-15T22:32:32.244929Z","title":"Storyagent: Cus- tomized storytelling video generation via multi-agent collab- oration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.244929Z"},"links":{"cited_paper":"/paper/2411.04925","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:8132518a2558628be703dcc24d1b4e9ffb97edf4e027597495c37592d24e1b0d","observation_id":"eda4bc24-6ccd-4d1a-93bf-9756cef6d866","resolution":{"observed_at":"2026-08-15T22:32:32.244929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:33.136581Z","title":"Videobooth: Diffusion-based video generation with image prompts","venue":null,"work_id":"32b97f7a-6314-42a2-bdf3-976915163e40","year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.248676Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:5edc25e756f28de57f962ab88214e9ab61fd1b91e98fadbe4ce2dec843a1176d","observation_id":"41981e65-9910-45f1-b66f-14f61b1ca7dd","resolution":{"observed_at":"2026-08-15T22:32:33.140441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17048","last_updated":"2025-03-16T01:40:29Z","snapshot_observed_at":"2026-08-14T04:08:07.927353Z","submitted_at":"2024-11-26T02:25:38Z","title":"PersonalVideo: High ID-Fidelity Video Customization without Dynamic and Semantic Degradation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17048","snapshot_observed_at":"2026-08-15T22:32:32.252842Z","title":"Personalvideo: High id-fidelity video customization without dynamic and semantic degradation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.252842Z"},"links":{"cited_paper":"/paper/2411.17048","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:d8fa569048c7c75f6fd158bc3accd10b326dd0253fd62db5b0163cf09afc951b","observation_id":"ba38c28a-d639-4279-ada4-ade8c1a29c19","resolution":{"observed_at":"2026-08-15T22:32:32.252842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05125","last_updated":"2023-03-09T09:16:04Z","snapshot_observed_at":"2026-08-16T15:49:34.994869Z","submitted_at":"2023-03-09T09:16:04Z","title":"Cones: Concept Neurons in Diffusion Models for Customized Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05125","snapshot_observed_at":"2026-08-15T22:32:32.257156Z","title":"Cones: Concept neurons in diffusion models for customized generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.257156Z"},"links":{"cited_paper":"/paper/2303.05125","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:590c098cbc45d29e38bd37ddcde07d8643d94d014c47572c5acd9e32178dd60c","observation_id":"ecf96ebc-3409-4b3d-9008-ad7029298ceb","resolution":{"observed_at":"2026-08-15T22:32:32.257156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:33.123304Z","title":"Videostudio: Generating consistent-content and multi-scene videos","venue":null,"work_id":"3dac9256-facc-469f-a7b8-bf3108d67b53","year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.261554Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:75ef3a04cec268cb8787e1c70b383684497d8bab1bc5bc343d79afb0982159b0","observation_id":"97e01da7-1cca-4189-b60e-dad0fcc75447","resolution":{"observed_at":"2026-08-15T22:32:33.127953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09368","last_updated":"2024-03-20T17:36:35Z","snapshot_observed_at":"2026-08-16T14:18:33.619756Z","submitted_at":"2024-02-14T18:13:51Z","title":"Magic-Me: Identity-Specific Video Customized Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09368","snapshot_observed_at":"2026-08-15T22:32:32.265592Z","title":"Magic-me: Identity-specific video customized diffu- sion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.265592Z"},"links":{"cited_paper":"/paper/2402.09368","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:e8d04274a70ea10cab77616c82620cd6491ea8797f3bc18b768859fe4199a56d","observation_id":"8afb2a4c-f578-4737-8312-648f7bc6fce9","resolution":{"observed_at":"2026-08-15T22:32:32.265592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:33.106572Z","title":"Dreammatcher: appearance matching self-attention for semantically-consistent text-to- image personalization","venue":null,"work_id":"f33073b5-c65e-43cd-838d-eda51378e458","year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.271073Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:a23800ed3e8b2ac9bcf999e61d2c9a52e1cea3ad1db9a7c81d35d510b9112eaf","observation_id":"158a6e24-bced-4717-a3ea-ae8415f28287","resolution":{"observed_at":"2026-08-15T22:32:33.113870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:33.093154Z","title":"Attndreambooth: To- wards text-aligned personalized text-to-image generation","venue":null,"work_id":"256b51a7-1f8c-4e8d-b954-ceffdc2842e2","year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.275319Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:fc82cd7eb3f1fc5b99f3adaeebada94523ad201cf95b3d8d6946805f3d9c7070","observation_id":"64f8f417-6f95-4951-a119-2d4e9b70805c","resolution":{"observed_at":"2026-08-15T22:32:33.097094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:32.280088Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.280088Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:d3686cf3fc62bf9898919527ab68b4897996d840d89e1316e6ec0bb976c36195","observation_id":"78744866-03e8-4b70-b825-1de9cba1a88c","resolution":{"observed_at":"2026-08-15T22:32:32.280088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:32.284807Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.284807Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:96dd039c840b8b2d54698572c7aafce5fe1a670d5ddd38b792c177c64ce4d753","observation_id":"2cf1ca1a-2024-410d-944a-dc5cd0015a42","resolution":{"observed_at":"2026-08-15T22:32:32.284807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-16T14:20:53.093222Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-15T22:32:32.292029Z","title":"Consisti2v: Enhanc- ing visual consistency for image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.292029Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:1ec59fa294a0732a5a0a83d62394b5ddb48ad79b8989bfdb4b2bbef47e74a627","observation_id":"bf9e5834-838b-4c05-9750-bc45d6cea47b","resolution":{"observed_at":"2026-08-15T22:32:32.292029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:32.296068Z","title":"High-resolution image syn- thesis with latent diffusion models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.296068Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:eb55d6bbe9b8dc9f53c0959cdf57617191a022df7dfdc3edf0fb7bd53b6127be","observation_id":"bd0628b8-07b9-488b-a2a1-24c857161d97","resolution":{"observed_at":"2026-08-15T22:32:32.296068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:33.054132Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"954ad38f-c15c-4f9b-bf15-86fc8a5dc536","year":2023},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.300641Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:c35fe55a3845f44dcc9150254f99eea5df22ed40ebb121ed4015a9deb18d38f2","observation_id":"bc82d961-2d3a-4e8a-ab8e-f8cfadf9c847","resolution":{"observed_at":"2026-08-15T22:32:33.058456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06527","last_updated":"2025-02-20T02:55:52Z","snapshot_observed_at":"2026-07-06T20:34:02.031605Z","submitted_at":"2025-02-10T14:50:32Z","title":"CustomVideoX: 3D Reference Attention Driven Dynamic Adaptation for Zero-Shot Customized Video Diffusion Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06527","snapshot_observed_at":"2026-08-15T22:32:32.304969Z","title":"Customvideox: 3d reference attention driven dynamic adaptation for zero-shot customized video diffusion transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.304969Z"},"links":{"cited_paper":"/paper/2502.06527","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:39a479f26f96d70241207fbaadeb159dfa0e0207b5e5c6fdfcc0c22a69407f76","observation_id":"1512356c-f166-41c7-b12a-554ad3f764a4","resolution":{"observed_at":"2026-08-15T22:32:32.304969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-15T22:32:32.309810Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.309810Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:9f96c74496359134b5472144711d91b5d6a812cba1960ae99338dbf1ac9486ec","observation_id":"c5744641-6bb5-4d06-8af3-2ce023a5d7c1","resolution":{"observed_at":"2026-08-15T22:32:32.309810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:33.042156Z","title":"Emergent correspondence from image diffusion","venue":null,"work_id":"d0579f39-607a-4ac9-97ac-fdeb88d64549","year":2023},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.313611Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:00fe6fe622e3f42e36cf435620477b45f27ba825f2f8d6841829400738ad49a3","observation_id":"2efcfbb2-d5b2-451c-b055-c9404b8a3a79","resolution":{"observed_at":"2026-08-15T22:32:33.046269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:33.030772Z","title":"Key-locked rank one editing for text-to-image personaliza- tion","venue":null,"work_id":"1c3a3032-b263-41d3-954c-4e8cefd60c8f","year":2023},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.318014Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:b518f0e68a028e84b93699c42d8e43b2125dcb9a44816abd759857a92ff2aae7","observation_id":"53f83da5-7c47-4830-b937-47a9b89772c1","resolution":{"observed_at":"2026-08-15T22:32:33.034640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:33.018504Z","title":"Pdc-net+: Enhanced probabilistic dense corre- spondence network","venue":null,"work_id":"d3cb1894-0b1f-4a69-b919-54bb84b33aca","year":2023},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.322162Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:881319b4343f922ed2832ca77a19e73adf3ecebade30b78cd71d325539eb4652","observation_id":"9e8821a4-d573-4288-ab92-213b49780666","resolution":{"observed_at":"2026-08-15T22:32:33.022538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:32.326022Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":null,"year":1921},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.326022Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:5ba067ffdbaece83b55236b932a96e960eddaf4f315a09f991990c9f4a12a637","observation_id":"5af2f65e-ad37-46bc-8c7d-e3a8c0842f2a","resolution":{"observed_at":"2026-08-15T22:32:32.326022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03018","last_updated":"2024-09-16T16:02:34Z","snapshot_observed_at":"2026-08-16T14:37:38.473485Z","submitted_at":"2023-12-05T03:16:31Z","title":"DreamVideo: High-Fidelity Image-to-Video Generation with Image Retention and Text Guidance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03018","snapshot_observed_at":"2026-08-15T22:32:32.330115Z","title":"Dreamvideo: High-fidelity image-to- video generation with image retention and text guidance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.330115Z"},"links":{"cited_paper":"/paper/2312.03018","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:15d254253a4b988bb4f0eaebab5f0d6b00fc88eb38e10f82574ba04af49ba331","observation_id":"57f2e0de-6010-4a8f-94ec-ed0055051f76","resolution":{"observed_at":"2026-08-15T22:32:32.330115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13005","last_updated":"2024-09-16T15:56:34Z","snapshot_observed_at":"2026-08-16T13:24:21.975450Z","submitted_at":"2024-08-23T11:48:29Z","title":"EasyControl: Transfer ControlNet to Video Diffusion for Controllable Generation and Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13005","snapshot_observed_at":"2026-08-15T22:32:32.333799Z","title":"Easycontrol: Transfer controlnet to video diffusion for controllable generation and interpolation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.333799Z"},"links":{"cited_paper":"/paper/2408.13005","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:1542f09449fcf3d9f2ae67cf7d60537c8a6b3b0caad96133d194d9c83431e724","observation_id":"b6578885-a84c-4bfc-840d-01ea7dfa1cc6","resolution":{"observed_at":"2026-08-15T22:32:32.333799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:32.998824Z","title":"Uniadapter: All-in-one control for flexible video generation","venue":null,"work_id":"281ef9d0-910f-4c89-bfd8-1bb4bc45cb73","year":2025},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.338346Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:fef37c063b24499ee6b1b3ee2169a9a18b9ab036498050ea526e24477671526a","observation_id":"c28f8a3e-0982-43b2-8d63-c6ab0c7fc6ed","resolution":{"observed_at":"2026-08-15T22:32:33.003110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07209","last_updated":"2025-03-04T06:21:26Z","snapshot_observed_at":"2026-08-16T13:44:12.244281Z","submitted_at":"2024-06-11T12:32:53Z","title":"MS-Diffusion: Multi-subject Zero-shot Image Personalization with Layout Guidance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07209","snapshot_observed_at":"2026-08-15T22:32:32.342607Z","title":"Ms-diffusion: Multi-subject zero-shot im- age personalization with layout guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.342607Z"},"links":{"cited_paper":"/paper/2406.07209","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:dc8d5e53d789cdc26ca8ecaf731bd881ec2f8fe1b7a4d3e51e378367740c1b54","observation_id":"aa235487-63b2-43a4-ae93-ecce87215173","resolution":{"observed_at":"2026-08-15T22:32:32.342607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:32.986710Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models","venue":null,"work_id":"32942ec5-6412-47a4-9ae4-6081c2795631","year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.346306Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:cbb646a248c13ca36df1a3304f034ce944e245638d68027942e1094bbcdda7cd","observation_id":"ee030ea2-cba1-4e37-87a3-3243445315fe","resolution":{"observed_at":"2026-08-15T22:32:32.991072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:32.350536Z","title":"Customvideo: Customizing text-to- video generation with multiple subjects","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.350536Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:5afbac2af88566b4a8bc95996dcef847bf4bef8da812f099e828e9ba55fc2e25","observation_id":"d7d02c94-9f1c-44de-bbc8-f21d5e2a439a","resolution":{"observed_at":"2026-08-15T22:32:32.350536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:32.973875Z","title":"Humanvid: Demystifying training data for camera-controllable human image animation","venue":null,"work_id":"3149e14b-8165-492b-a51e-a80704237f45","year":null},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.354107Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:d9464f8e6a5cbf1178a1b3bb8e4a9e9ddd52103a46c85a306c0029c13181f1c4","observation_id":"d8045e98-08a1-4ef7-979b-f49484cbba52","resolution":{"observed_at":"2026-08-15T22:32:32.978817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:32.962937Z","title":"Dreamvideo: Composing your dream videos with customized subject and motion","venue":null,"work_id":"1b481bba-081f-4bef-9d79-82978e8e854f","year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.358036Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:c9c0defa9448f19ef6ea8d9783a787294caa2c42c79f74b458860fafe462545d","observation_id":"93927882-c175-4b0c-8e13-5aa5afa46117","resolution":{"observed_at":"2026-08-15T22:32:32.966817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13239","last_updated":"2024-12-27T13:58:39Z","snapshot_observed_at":"2026-08-16T13:51:56.014897Z","submitted_at":"2024-08-23T17:26:06Z","title":"CustomCrafter: Customized Video Generation with Preserving Motion and Concept Composition Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13239","snapshot_observed_at":"2026-08-15T22:32:32.362122Z","title":"Cus- tomcrafter: Customized video generation with preserving motion and concept composition abilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.362122Z"},"links":{"cited_paper":"/paper/2408.13239","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:e1f76a892be771c773ba6acbb85ff919484e60dcf4cee3edd023e56ef376d557","observation_id":"b9edad3c-f457-48c1-86c1-be448f19e015","resolution":{"observed_at":"2026-08-15T22:32:32.362122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:32.949821Z","title":"Fastcomposer: Tuning-free multi- subject image generation with localized attention","venue":null,"work_id":"3f06925c-1258-4951-b9ba-3d4b8fc346cc","year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.365812Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:f0544833a64b793ca675971b00d618dda65342023d100e0b2fd1b2dbb77316bc","observation_id":"8ce4b922-e3d9-4d2f-9906-9377f4cc14bb","resolution":{"observed_at":"2026-08-15T22:32:32.954658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:32.937652Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":"63c1dc8d-2dcb-4549-873d-615f7eab4ff8","year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.369430Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:2e5a9331d2f8971972944c0d0d92de3283b48286b07c73461c97914b1aa38cb8","observation_id":"c69a0087-dbbb-4dab-87e3-8ba9d56dbb5e","resolution":{"observed_at":"2026-08-15T22:32:32.942087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-15T22:32:32.372959Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.372959Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:ff4c38d401895aa33394b603c82a6f0bbda987892bade355079fad34ac177b29","observation_id":"d3bb6388-15b8-458d-b95f-4db529907712","resolution":{"observed_at":"2026-08-15T22:32:32.372959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03605","last_updated":"2022-07-11T10:30:29Z","snapshot_observed_at":"2026-08-17T01:41:21.303070Z","submitted_at":"2022-03-07T18:55:26Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03605","snapshot_observed_at":"2026-08-15T22:32:32.376317Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.376317Z"},"links":{"cited_paper":"/paper/2203.03605","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:37bf745f65e15d9ad6b1b37cc3c9aed887b08d210f8e4f8ee245e7e839b2b52e","observation_id":"fe92c7c9-4d02-4ac3-83e5-581befa4ccdf","resolution":{"observed_at":"2026-08-15T22:32:32.376317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:32.924647Z","title":"A tale of two features: Stable diffusion complements dino for zero-shot semantic correspondence","venue":null,"work_id":"f0ccf8e0-671a-4645-8393-7f7868051505","year":null},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.380189Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:b357f5b2d4d6fa64e9cb55d3af83341ef241d366202cca48edb0f284a85c2a8c","observation_id":"73faa472-acc3-4d94-b055-6f2de5618147","resolution":{"observed_at":"2026-08-15T22:32:32.929203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:32.908358Z","title":"Ssr-encoder: Encoding selective subject representation for subject-driven generation","venue":null,"work_id":"702fb1c6-0dea-4cc7-95b0-39ce1c6ebcdf","year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.383756Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:eba181878f9ccc471f1c409968fa3cb0796046f4d821fce02559d673da4cb5be","observation_id":"304e5fe9-8b09-485f-a46e-17606cf35a54","resolution":{"observed_at":"2026-08-15T22:32:32.912662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21705","last_updated":"2025-03-14T03:03:31Z","snapshot_observed_at":"2026-08-16T13:29:29.659732Z","submitted_at":"2024-07-31T15:53:20Z","title":"Tora: Trajectory-oriented Diffusion Transformer for Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21705","snapshot_observed_at":"2026-08-15T22:32:32.387501Z","title":"Tora: Trajectory-oriented diffusion transformer for video genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.387501Z"},"links":{"cited_paper":"/paper/2407.21705","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:a36ff6557588e6b4b05f015a2bd7726ce931ddfede5f171d3edeefc2188dda1b","observation_id":"14db1d33-e577-475e-a926-7c2c0ea3f916","resolution":{"observed_at":"2026-08-15T22:32:32.387501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15957","last_updated":"2024-12-04T12:54:44Z","snapshot_observed_at":"2026-08-16T13:07:25.626052Z","submitted_at":"2024-10-21T12:36:27Z","title":"CamI2V: Camera-Controlled Image-to-Video Diffusion Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15957","snapshot_observed_at":"2026-08-15T22:32:32.391446Z","title":"Cami2v: Camera-controlled image-to-video dif- fusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.391446Z"},"links":{"cited_paper":"/paper/2410.15957","citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:586b26170a076289e57bc118fe29bda73f3f33746c971b7ad8eee2697d289a46","observation_id":"d4078b77-9906-459f-87f4-375807966b91","resolution":{"observed_at":"2026-08-15T22:32:32.391446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:32.892166Z","title":"Vlogger: Make your dream a vlog","venue":null,"work_id":"2ba7383b-87a9-4e19-bf62-ee33384c54ce","year":2024},"citing_paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T22:32:32.396118Z"},"links":{"citing_paper":"/paper/2505.06985"},"observation_digest":"sha256:0b06158551c644f36732b6666d3adbb5741f06a23d0f69a56cef33df687c766f","observation_id":"e6169d5d-2318-4beb-9d85-dafbd81447fc","resolution":{"observed_at":"2026-08-15T22:32:32.898545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.06985","last_updated":"2025-05-11T14:11:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T12:48:20.877546Z","submitted_at":"2025-05-11T14:11:12Z","title":"BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2505.06985."}