{"as_of":"2026-08-09T11:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:51a591fbc272d68354d3e5886d5f177f34fdb55d0b295ddc6ad2993612e42050","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":38,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:59:32.071589Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:19:30.378145Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T00:53:53.855965Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2503.07598"},"observation_digest":"sha256:1cbccfbfb5244f662a1f98bda77da0ad62e0c76ece7fc8e7a9e4f3951dd12e2c","observation_id":"e8ca3bea-1703-4a77-b703-ae6b0d629a7b","resolution":{"observed_at":"2026-05-16T00:53:54.003853Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2504.17816","last_updated":"2026-05-05T15:27:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-23T06:48:31Z","title":"Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T17:51:41.947939Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2504.17816"},"observation_digest":"sha256:22032a2108c47164a8194e04ebc45f937b512954d7795705af937679dade4f69","observation_id":"dab58e75-016b-4c38-b61a-e1ac198ec9ce","resolution":{"observed_at":"2026-05-22T17:51:54.313500Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-07T13:59:32.071589Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.071589Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:c91e0af18095b26a97ab86cf32d833627270515562fa9effe32074a7a82b3a8a","observation_id":"8b4584ab-6c87-4bf6-a062-9600001f2d39","resolution":{"observed_at":"2026-08-07T13:59:32.071589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-07T11:12:10.052472Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.052472Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:aea4bbf7de48d6993dc7f896d448632c434f2cdcf1963aea41f3989b8dfb9a6d","observation_id":"820661d1-558e-4c66-b64a-1d735b45ff39","resolution":{"observed_at":"2026-08-07T11:12:10.052472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-07T05:30:32.974027Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.974027Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:df40bb4214174f1fe3d8b745999a3da90acdf05b7bedfc499586401e860d88db","observation_id":"e62295d4-8fa2-4396-8deb-fac1b7d52bf6","resolution":{"observed_at":"2026-08-07T05:30:32.974027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-07T04:27:39.046915Z","title":"Phan- tom: Subject-consistent video generation via cross- modal alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10568","last_updated":"2025-08-27T03:34:57Z","snapshot_observed_at":"2026-08-08T16:12:04.523586Z","submitted_at":"2025-06-12T10:58:23Z","title":"DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion Transformers","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:39.046915Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2506.10568"},"observation_digest":"sha256:b37339f0865f73c5430b902da9295d319cdd7b4ca54432f0eb1460e90c28a1dc","observation_id":"762ce83a-a2b1-4b2b-b0d3-7452fde4b615","resolution":{"observed_at":"2026-08-07T04:27:39.046915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-06T23:20:09.885970Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment.arXiv preprint arXiv:2502.11079, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-08T15:15:43.495121Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.885970Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:a582698c1cecee9d4509931f54937c57d4372a7afd506de8159c190872270b41","observation_id":"cde2f2fb-60aa-483a-8704-ee42bd252af6","resolution":{"observed_at":"2026-08-06T23:20:09.885970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-06T18:51:27.649430Z","title":"Phantom: Subject- consistent video generation via cross-modal alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-07T10:10:34.633901Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.649430Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:474fe491a178a891b0c90159cd85db9be06c99e96069ee614ff7993943ee8f70","observation_id":"78f0d332-7e44-4678-bd3e-d7f2777dd5a5","resolution":{"observed_at":"2026-08-06T18:51:27.649430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-06T16:39:36.070911Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12956","last_updated":"2025-07-17T09:50:43Z","snapshot_observed_at":"2026-08-07T23:26:25.424237Z","submitted_at":"2025-07-17T09:50:43Z","title":"FantasyPortrait: Enhancing Multi-Character Portrait Animation with Expression-Augmented Diffusion Transformers","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T16:39:36.070911Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2507.12956"},"observation_digest":"sha256:3ab85043af9073072cc10c8b67f156bb7df585d3ebbf3a657f8cef9583569c5a","observation_id":"5684ad4b-79c4-42a7-8685-928f47c503ff","resolution":{"observed_at":"2026-08-06T16:39:36.070911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-05T20:06:47.800330Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11255","last_updated":"2025-08-15T06:43:46Z","snapshot_observed_at":"2026-08-08T07:02:19.422958Z","submitted_at":"2025-08-15T06:43:46Z","title":"FantasyTalking2: Timestep-Layer Adaptive Preference Optimization for Audio-Driven Portrait Animation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:47.800330Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2508.11255"},"observation_digest":"sha256:a9c01c79c16e39b3a5da155bde7dd1e6805da30b9f83d1186dd58dedc42ccb56","observation_id":"d07100f1-754d-40de-b195-94151d481fd2","resolution":{"observed_at":"2026-08-05T20:06:47.800330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-05T12:42:40.992340Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01362","last_updated":"2025-09-01T11:03:13Z","snapshot_observed_at":"2026-08-09T00:52:28.062011Z","submitted_at":"2025-09-01T11:03:13Z","title":"Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T12:42:40.992340Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2509.01362"},"observation_digest":"sha256:a54d2ea17d8261b0032b0fe62fc0bf99e5120e24cf04036f485983e8b1532af4","observation_id":"eeeba291-e2d0-47b9-8c95-6822177149b3","resolution":{"observed_at":"2026-08-05T12:42:40.992340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-04T10:49:48.589583Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-07T16:29:46.498912Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:48.589583Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:56b6170164e5735aa80c234c07b1855d71c20f3a8a4a55fb921c00a6106a85fc","observation_id":"91ed0832-9ef6-4f2a-a878-5ce4e3355301","resolution":{"observed_at":"2026-08-04T10:49:48.589583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2511.22940","last_updated":"2026-05-19T15:28:34Z","snapshot_observed_at":"2026-08-02T05:15:20.627790Z","submitted_at":"2025-11-28T07:30:10Z","title":"One-to-All Animation: Alignment-Free Character Animation and Image Pose Transfer","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T18:25:22.486891Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2511.22940"},"observation_digest":"sha256:de199f3b13c75a6bc6edaafdb1519cb3939092bb009c034be545a164dcd5d9fe","observation_id":"e5d041c1-8351-482f-9b6d-34fad7652cad","resolution":{"observed_at":"2026-05-21T18:25:28.396016Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-03T15:28:55.722892Z","title":"Phantom: Subject-consistent video generation via cross- modal alignment.arXiv preprint arXiv:2502.11079, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.17796","last_updated":"2026-06-24T08:52:20Z","snapshot_observed_at":"2026-08-06T07:44:38.380189Z","submitted_at":"2025-12-18T18:59:18Z","title":"CustomX: Unified Character, Action, and Scene Customization in Video World Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T15:28:55.722892Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2512.17796"},"observation_digest":"sha256:07092ebb02e580d01358b1431b2cc69d569bc58703f7954b37c48cc50d217a7d","observation_id":"b1e13b4c-d732-427f-b594-34f56251ba95","resolution":{"observed_at":"2026-08-03T15:28:55.722892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2602.13669","last_updated":"2026-04-22T07:41:44Z","snapshot_observed_at":"2026-07-06T22:45:53.926021Z","submitted_at":"2026-02-14T08:32:38Z","title":"EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T22:20:16.320171Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2602.13669"},"observation_digest":"sha256:51ffffa1629361351bcc2f43bc476e5389f5974b96fb162a71b32deff110c124","observation_id":"04a016b9-f2f9-4cfa-a631-94fba03f29ea","resolution":{"observed_at":"2026-05-15T22:20:22.455970Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-04T05:51:18.232473Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.232473Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:ec1c8ce547e358be10607893b074b3a71e7a45555de4f581ded2049faca95ecc","observation_id":"b16c105f-f6af-4215-ad0b-6fb297f91cdc","resolution":{"observed_at":"2026-08-04T05:51:18.232473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2604.04934","last_updated":"2026-05-04T04:50:40Z","snapshot_observed_at":"2026-07-06T22:53:46.999911Z","submitted_at":"2026-04-06T17:59:59Z","title":"Vanast: Virtual Try-On with Human Image Animation via Synthetic Triplet Supervision","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T20:33:25.422350Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2604.04934"},"observation_digest":"sha256:4e0ce27930cf40a3c0d290aa5064704daf3732f7f43abd2bb295fc01880f1ca6","observation_id":"60704d15-2282-4390-b433-5a5fe85931b1","resolution":{"observed_at":"2026-05-10T21:55:49.210641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2604.06339","last_updated":"2026-04-07T18:17:05Z","snapshot_observed_at":"2026-07-06T22:54:53.308309Z","submitted_at":"2026-04-07T18:17:05Z","title":"Evolution of Video Generative Foundations","version":1},"reference_index":205,"source":"pdf_text","source_observed_at":"2026-05-10T18:41:38.616611Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2604.06339"},"observation_digest":"sha256:9601abdc5835d518a367242efd27a7c37f17d9bd86d1bb9b3a10ebd8e9a60777","observation_id":"a5ba3bef-7a30-4b49-b8ba-dfc6e2dd5f94","resolution":{"observed_at":"2026-05-11T00:05:51.328734Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2604.10030","last_updated":"2026-04-11T04:59:06Z","snapshot_observed_at":"2026-08-05T11:19:47.532677Z","submitted_at":"2026-04-11T04:59:06Z","title":"Prompt Relay: Inference-Time Temporal Control for Multi-Event Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T15:42:35.693519Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2604.10030"},"observation_digest":"sha256:8fab4dc95f7ec8a046e8786c9286c5a142d235b22ae974c8e26a0323cde85ffd","observation_id":"d4177208-82fc-49ec-9bf1-bed27d5d2af9","resolution":{"observed_at":"2026-05-11T10:01:00.416886Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2604.11244","last_updated":"2026-04-15T07:55:01Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T09:50:36Z","title":"Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T15:07:45.595260Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2604.11244"},"observation_digest":"sha256:4be369f332f7a010ca2d4aa5b22a14e09899b230e3c5f1d0024171a658b289d4","observation_id":"c5df77d7-6e3f-49ed-8acf-5e3c5ddccbe4","resolution":{"observed_at":"2026-05-11T11:11:03.692220Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":141,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:2f9e4d2d4417da4328ea108cb90e1a0b19b734a9aadf9e7586c20ac9107eca0d","observation_id":"8990056c-c55a-4965-b135-a1b03ef9f68b","resolution":{"observed_at":"2026-05-11T08:30:56.950219Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:af663da6b541dee353074a5e5d80be38c10f758d920e5bf823904bc69aa47122","observation_id":"a504db6f-6ef3-4462-bd37-eae9a89ad9b7","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-08-06T16:53:42.723002Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:d0ce8310401c76826395c1295755b600d63d27cedfa6eae9d9b687d22b0bb08e","observation_id":"78cd8348-c81b-4c6c-8519-b0c3160d0004","resolution":{"observed_at":"2026-05-11T11:06:05.893388Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2604.19720","last_updated":"2026-04-21T17:47:26Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T17:47:26Z","title":"ReImagine: Rethinking Controllable High-Quality Human Video Generation via Image-First Synthesis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T02:24:57.882447Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2604.19720"},"observation_digest":"sha256:de37d2ce272edf0fcd3df557e292054e465596984abea579b364d3c7f35d64d6","observation_id":"8020a8c1-a8f7-4b1e-bd94-51dde555e8a1","resolution":{"observed_at":"2026-05-11T13:01:26.592322Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:c908970c2cf739ed91d7d987310adf4791983baf3815735c326ac3c7ccd0195e","observation_id":"9c0c0c03-b5a1-479c-bb2b-3fd35485b6c0","resolution":{"observed_at":"2026-05-11T17:21:09.635204Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2605.15824","last_updated":"2026-06-17T15:16:37Z","snapshot_observed_at":"2026-08-03T19:41:20.540916Z","submitted_at":"2026-05-15T10:25:06Z","title":"FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T20:11:33.277349Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2605.15824"},"observation_digest":"sha256:6beb27ec584598d6a88aee14342ed7e194ff73fbe8bd8898d009f5b2052ba7b4","observation_id":"871d318c-ba5c-438c-ae15-f110cd8a7bac","resolution":{"observed_at":"2026-05-20T20:13:43.610050Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2605.15824","last_updated":"2026-06-17T15:16:37Z","snapshot_observed_at":"2026-08-03T19:41:20.540916Z","submitted_at":"2026-05-15T10:25:06Z","title":"FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T19:23:07.044659Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2605.15824"},"observation_digest":"sha256:2e2590c20528a789adef9a3002eef766344a2072e8d15f8fab0ce1a20f060b7d","observation_id":"66e35ba8-be81-4f43-982a-63b0a576b155","resolution":{"observed_at":"2026-06-30T19:25:00.562996Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2605.22344","last_updated":"2026-05-21T11:30:29Z","snapshot_observed_at":"2026-07-06T23:32:39.761431Z","submitted_at":"2026-05-21T11:30:29Z","title":"Bernini: Latent Semantic Planning for Video Diffusion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-22T06:39:47.124605Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2605.22344"},"observation_digest":"sha256:9ce2700f29e94e1a0677806885e855194672b605593d09a5ef3b3fdcabc74f21","observation_id":"b6a1476b-f6fc-4200-b0fc-087b41a9a896","resolution":{"observed_at":"2026-05-22T06:41:10.542258Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2605.23610","last_updated":"2026-05-22T13:20:29Z","snapshot_observed_at":"2026-08-08T10:04:13.494103Z","submitted_at":"2026-05-22T13:20:29Z","title":"EM-Vid: Training-Free Entity-Centric Memory for Efficient and Consistent Multi-Shot Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-25T04:57:13.479165Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2605.23610"},"observation_digest":"sha256:542946b9775a1595809d27870ff502e472758f0a9bc959158b2ef99c0b9e7c0b","observation_id":"048d38ed-a3bc-4ad6-a5c0-aa4a4bded87a","resolution":{"observed_at":"2026-05-25T05:00:22.425250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-06T07:20:12.233069Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:d8297c0b9fe66589c920adddbe4024e15a151caaac8f389cf4c7d5d34254a576","observation_id":"54d0a592-7bba-47d0-b7f3-a32634311248","resolution":{"observed_at":"2026-07-01T22:56:20.244659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2606.07508","last_updated":"2026-06-05T17:57:32Z","snapshot_observed_at":"2026-08-03T10:42:24.485829Z","submitted_at":"2026-06-05T17:57:32Z","title":"Streaming Video Generation with Streaming Force Control","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T22:14:32.465663Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2606.07508"},"observation_digest":"sha256:c0f7a4c2bbe0f8549e644a7a098b369c3f4c8b2dbce06e6d5e71181fb7620223","observation_id":"610c77d1-d687-469a-abaf-59b53dac25f1","resolution":{"observed_at":"2026-07-02T17:07:12.387385Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2606.10839","last_updated":"2026-06-22T14:44:53Z","snapshot_observed_at":"2026-08-08T03:14:09.273162Z","submitted_at":"2026-06-09T13:26:39Z","title":"HarmoView: Harmonizing Multi-View Constraints for Identity-Consistent Video Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T13:49:50.272650Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2606.10839"},"observation_digest":"sha256:113288e4fda6be9dc8a6312bc59eac8ca90e55078e64a60bd9f2da4167fda0e8","observation_id":"f48bf4c6-21ea-43b5-b88f-86cac9cca637","resolution":{"observed_at":"2026-07-03T04:37:36.648289Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2606.11670","last_updated":"2026-06-10T05:29:09Z","snapshot_observed_at":"2026-08-07T07:14:38.415101Z","submitted_at":"2026-06-10T05:29:09Z","title":"ARGUS: Stacked Multi-View Identity Mosaic Injection for Subject-Preserving Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T10:46:56.871174Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2606.11670"},"observation_digest":"sha256:4fea8404b5d1444c4b4c47cf082dd4f4b1fbbc4329545b19479572ae6593c1b0","observation_id":"24afdf48-3e48-4b2e-a930-603545850b29","resolution":{"observed_at":"2026-07-03T08:17:45.947052Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2606.20799","last_updated":"2026-07-15T15:45:17Z","snapshot_observed_at":"2026-08-02T10:48:03.144592Z","submitted_at":"2026-06-18T18:00:03Z","title":"GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot Scheduling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T18:15:51.862192Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2606.20799"},"observation_digest":"sha256:5f8baf54e651bf116dfdc4ca77e00cfb35d2328c1a3b9bd9f26fb0a5bb29b150","observation_id":"68f86b7d-16e3-4865-a3fa-70fb1297d568","resolution":{"observed_at":"2026-07-04T03:19:30.381652Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-02T10:48:05.537673Z","title":"Phantom: Subject-consistent video generation via cross- modal alignment.arXiv preprint arXiv:2502.11079, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20799","last_updated":"2026-07-15T15:45:17Z","snapshot_observed_at":"2026-08-02T10:48:03.144592Z","submitted_at":"2026-06-18T18:00:03Z","title":"GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot Scheduling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:05.537673Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2606.20799"},"observation_digest":"sha256:4122ba5ae4854cfb6bdec205e025eab096d670683da181c47d57a39e227ced54","observation_id":"73bda7db-f3f1-424c-89bf-43f5dcb8f4a5","resolution":{"observed_at":"2026-08-02T10:48:05.537673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2606.28531","last_updated":"2026-06-26T18:30:00Z","snapshot_observed_at":"2026-07-07T00:02:38.226622Z","submitted_at":"2026-06-26T18:30:00Z","title":"A Good Talk Does not Look Like a Summary, It Teaches You! Measuring Takeaways from Paper-to-Video Talks","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-30T00:59:50.478584Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2606.28531"},"observation_digest":"sha256:fb2938664649e83c2a2b9b6320777fee07876cf59665725cb5d89267bbbf8876","observation_id":"ecf247e4-33a2-4343-bb22-f847989a56a7","resolution":{"observed_at":"2026-07-01T15:45:48.892408Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-01T16:30:02.172800Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17985","last_updated":"2026-07-20T14:16:49Z","snapshot_observed_at":"2026-08-08T15:15:32.999700Z","submitted_at":"2026-07-20T14:16:49Z","title":"Keyframe-Anchored Identity Preservation for Sequential-Action Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T16:30:02.172800Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2607.17985"},"observation_digest":"sha256:b3e90f5256ef528ac7d465055f9d55c86e68d6d39734e2551584d2a2cf926d77","observation_id":"95c4ed9a-fded-45a9-8f3e-332d66048293","resolution":{"observed_at":"2026-08-01T16:30:02.172800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-01T04:27:31.566712Z","title":"arXiv preprint arXiv:2502.11079 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22830","last_updated":"2026-07-24T18:12:58Z","snapshot_observed_at":"2026-08-08T06:26:12.527056Z","submitted_at":"2026-07-24T18:12:58Z","title":"ID-V2V: Identity-Preserving Video Restylization","version":1},"reference_index":191,"source":"arxiv_source","source_observed_at":"2026-08-01T04:27:31.566712Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2607.22830"},"observation_digest":"sha256:d15024483141070dca46eef13a6b1ec044bd7de70d1c1cb3533b1fdae24f766e","observation_id":"d111140e-0430-4dbc-a018-a4527dfbfc31","resolution":{"observed_at":"2026-08-01T04:27:31.566712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.11079/citation-record","integrity":"/paper/2502.11079/integrity","json":"/paper/2502.11079/citation-record.json","paper":"/paper/2502.11079"},"outbound":[],"paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 38 inbound Pith citation observations for arXiv:2502.11079."}