{"as_of":"2026-08-18T14:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:abea21d346cd66250755ab9724e30c3c90797f3daa9d60ed680d609f6279af1a","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:20:12.568377Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T05:01:36.599895Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T22:26:17.493582Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"cited_work":{"arxiv_id":"2506.18851","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18851","snapshot_observed_at":"2026-07-01T22:26:17.493582Z","title":"Phantom-data: Towards a general subject-consistent video generation dataset","venue":null,"work_id":"1cac764a-1a21-4f0f-9064-4bbb73ddb529","year":2025},"citing_paper":{"arxiv_id":"2504.17816","last_updated":"2026-05-05T15:27:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-23T06:48:31Z","title":"Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T17:51:41.947939Z"},"links":{"cited_paper":"/paper/2506.18851","citing_paper":"/paper/2504.17816"},"observation_digest":"sha256:177240b5c0c18af7b7615e6170b895e33d74c610cb170d2c8eca9326a07793dd","observation_id":"d7942705-b27f-4f09-890e-891109501909","resolution":{"observed_at":"2026-05-22T17:51:54.300099Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18851","snapshot_observed_at":"2026-08-05T05:01:36.599895Z","title":"Phantom-Data: Towards a General Subject-Consistent Video Generation Dataset.ArXiv, 2506.18851, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-15T05:55:38.630847Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.599895Z"},"links":{"cited_paper":"/paper/2506.18851","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:5fb5fe9f33c0ac6a2ad8a132272b61db899fecc8b30df6fb31b08bb5d797aa1d","observation_id":"a1f20d76-310a-4586-a321-85045de90fa4","resolution":{"observed_at":"2026-08-05T05:01:36.599895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18851","snapshot_observed_at":"2026-07-13T12:23:05.876881Z","title":"Phantom-data: Towards a general subject-consistent video generation dataset.arXiv preprint arXiv:2506.18851, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03738","last_updated":"2026-04-04T13:50:38Z","snapshot_observed_at":"2026-08-14T15:31:16.200472Z","submitted_at":"2026-04-04T13:50:38Z","title":"Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T12:23:05.876881Z"},"links":{"cited_paper":"/paper/2506.18851","citing_paper":"/paper/2604.03738"},"observation_digest":"sha256:1523f32c34554b7be65404b845b6965ceff36231d89532c844713db599ca0061","observation_id":"f8a3e20d-7692-4182-9507-4d1993b7f947","resolution":{"observed_at":"2026-07-13T12:23:05.876881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"cited_work":{"arxiv_id":"2506.18851","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18851","snapshot_observed_at":"2026-07-01T22:26:17.493582Z","title":"Phantom-data: Towards a general subject-consistent video generation dataset","venue":null,"work_id":"1cac764a-1a21-4f0f-9064-4bbb73ddb529","year":2025},"citing_paper":{"arxiv_id":"2605.17488","last_updated":"2026-05-17T14:56:52Z","snapshot_observed_at":"2026-08-16T04:42:39.882027Z","submitted_at":"2026-05-17T14:56:52Z","title":"Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T14:08:30.802619Z"},"links":{"cited_paper":"/paper/2506.18851","citing_paper":"/paper/2605.17488"},"observation_digest":"sha256:47dacce72b0ed9cb800e23232f32a7a898787e7efd37b14f5c0913c64edcb8fe","observation_id":"8fe950cd-cffc-4b16-a4ea-2cea998ba90f","resolution":{"observed_at":"2026-05-20T14:13:21.413127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"cited_work":{"arxiv_id":"2506.18851","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18851","snapshot_observed_at":"2026-07-01T22:26:17.493582Z","title":"Phantom-data: Towards a general subject-consistent video generation dataset","venue":null,"work_id":"1cac764a-1a21-4f0f-9064-4bbb73ddb529","year":2025},"citing_paper":{"arxiv_id":"2606.02441","last_updated":"2026-06-01T16:12:18Z","snapshot_observed_at":"2026-08-08T05:56:53.706139Z","submitted_at":"2026-06-01T16:12:18Z","title":"Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T15:25:22.778550Z"},"links":{"cited_paper":"/paper/2506.18851","citing_paper":"/paper/2606.02441"},"observation_digest":"sha256:2b557b8743a01b922a6194ff673067ec0c4e772ced054bf774f69a26fa26d008","observation_id":"6f242034-23f8-49cc-aae1-3121792460bf","resolution":{"observed_at":"2026-07-01T22:26:17.495216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18851","snapshot_observed_at":"2026-08-01T15:42:03.214892Z","title":"Phantom-data: Towards a general subject-consistent video generation dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-16T08:10:38.341390Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:03.214892Z"},"links":{"cited_paper":"/paper/2506.18851","citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:f54c66e7711a8fd58525c0f95a228be9cadb424b4e232813d0a030651debe720","observation_id":"d0b5bbb2-e48a-4852-b2d2-ab7b4d43a9b4","resolution":{"observed_at":"2026-08-01T15:42:03.214892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.18851/citation-record","integrity":"/paper/2506.18851/integrity","json":"/paper/2506.18851/citation-record.json","paper":"/paper/2506.18851"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:14.885049Z","title":"https://app.klingai.com/cn/image-to-video/frame-mode/new","venue":null,"work_id":"bf8f44d8-10d0-4b05-bb1b-a2d498462c8b","year":null},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:07.281280Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:3a9d4637d2533803fb3c62990a50b95629744a04aca48402a5a7d4fc01374a59","observation_id":"e054ca19-271c-42b6-8a20-7e96b239d4f7","resolution":{"observed_at":"2026-08-06T23:20:14.987254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T23:20:07.412919Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:07.412919Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:f49fb50d7ae2326595f00c07e4bb38df890d20d3ab7545e22f39818ea8519562","observation_id":"936aa0b0-b79c-4a16-a8e4-7ed62334a08a","resolution":{"observed_at":"2026-08-06T23:20:07.412919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-06T23:20:07.559950Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:07.559950Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:ccdb5cfd6eb6cc5a7fb4fa95c1528c4c43718c3ec3725168e2eae42e663a36f3","observation_id":"c5d73f85-b81a-4a94-99d3-fcf0bf3a9c45","resolution":{"observed_at":"2026-08-06T23:20:07.559950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:14.758710Z","title":"Video generation models as world simulators, 2024","venue":null,"work_id":"7cbbce8a-5dd6-42ae-b7fd-2f7e8c44b5ad","year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:07.661980Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:a3b14d9f9b0c42c78ab78aeb278fb23bc01640786deae7b3e087020e02036f42","observation_id":"242bf04c-e758-4187-b6d1-cf2130d6b3c4","resolution":{"observed_at":"2026-08-06T23:20:14.818122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-15T10:28:42.385124Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04896","snapshot_observed_at":"2026-08-06T23:20:07.782664Z","title":"Goku: Flow based video generative foundation models.arXiv preprint arXiv:2502.04896, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:07.782664Z"},"links":{"cited_paper":"/paper/2502.04896","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:15b9c93705c14d54eb7397da5f250a5962c91788b4cc06e293c06acfd6480b81","observation_id":"548c22ba-b600-4b5a-bf1d-30c42a03901e","resolution":{"observed_at":"2026-08-06T23:20:07.782664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06187","last_updated":"2025-03-20T17:59:56Z","snapshot_observed_at":"2026-08-16T12:59:16.381164Z","submitted_at":"2025-01-10T18:59:54Z","title":"Multi-subject Open-set Personalization in Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06187","snapshot_observed_at":"2026-08-06T23:20:07.898058Z","title":"Multi-subject open-set personalization in video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:07.898058Z"},"links":{"cited_paper":"/paper/2501.06187","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:d4c6ffea245413a227fcd796ef1a777f65d142a6ce91d9635d69f90c118b6614","observation_id":"ccb1ac78-a014-4123-8381-65deac622c07","resolution":{"observed_at":"2026-08-06T23:20:07.898058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T23:20:08.003946Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:08.003946Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:abdc51aa0a45acec83a2864dd41aac23964fa6fc21a70f1ec421e7229ee25d3e","observation_id":"d8217f7b-09bc-4179-971b-4fc5e54330c7","resolution":{"observed_at":"2026-08-06T23:20:08.003946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:08.123630Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:08.123630Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:579f694649462e9e07b27a0644116196e2c3b099329b86adedef099664f69cd4","observation_id":"971e06cd-2ee5-4ab8-a7fa-a831ca7511a0","resolution":{"observed_at":"2026-08-06T23:20:08.123630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10391","last_updated":"2025-03-13T14:07:58Z","snapshot_observed_at":"2026-08-16T12:50:22.094509Z","submitted_at":"2025-03-13T14:07:58Z","title":"CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10391","snapshot_observed_at":"2026-08-06T23:20:08.256451Z","title":"Cinema: Coherent multi-subject video generation via mllm-based guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:08.256451Z"},"links":{"cited_paper":"/paper/2503.10391","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:cefb818fbfdac994467155840ec0de0c3665d930c7623edd543f0d71a0aa7159","observation_id":"3e6fad62-7218-485c-ae16-187812f6a501","resolution":{"observed_at":"2026-08-06T23:20:08.256451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-16T12:44:19.692222Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-08-06T23:20:08.358935Z","title":"Skyreels-a2: Compose anything in video diffusion transformers.arXiv preprint arXiv:2504.02436, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:08.358935Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:7906203eb59f4d9e9b363bca94f9a1929f7e1d50893a2e58c3a1fc1656eb64df","observation_id":"3578d72a-dae4-4e0f-9541-0faced2c218e","resolution":{"observed_at":"2026-08-06T23:20:08.358935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:14.571258Z","title":"I2vcontrol-camera: Precise video camera control with adjustable motion strength","venue":null,"work_id":"00a7beff-11d2-4272-839a-8b1d484724c9","year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:08.485574Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:fb50d08448119ef2e6477e770e8bbbf92266ee06e4490ce63b22065130367796","observation_id":"57719d53-065c-4e7b-b3a9-0bc249ad4b04","resolution":{"observed_at":"2026-08-06T23:20:14.649542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:14.411041Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":"458cf6ba-111d-4eb3-8641-928065a3d051","year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:08.625636Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:856289866b654ded7c088a3308fab8503410e1eb2eee09e2e8b9d2661691f5df","observation_id":"227326dc-bb45-4984-981c-ad6bb01eef67","resolution":{"observed_at":"2026-08-06T23:20:14.474650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16022","last_updated":"2024-10-31T12:17:39Z","snapshot_observed_at":"2026-08-16T13:58:08.710994Z","submitted_at":"2024-04-24T17:55:33Z","title":"PuLID: Pure and Lightning ID Customization via Contrastive Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16022","snapshot_observed_at":"2026-08-06T23:20:08.734489Z","title":"Pulid: Pure and lightning id customization via contrastive alignment.arXiv preprint arXiv:2404.16022, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:08.734489Z"},"links":{"cited_paper":"/paper/2404.16022","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:28919bde544de1ecebd24223046d54198600af04c49863834666a4fbcbe93655","observation_id":"ade09c8e-7940-458e-a4f2-31fbdbd37459","resolution":{"observed_at":"2026-08-06T23:20:08.734489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-06T23:20:08.795807Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:08.795807Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:39a2342a61cdd969b821c3ef2176ed0d7f9ba111813ca211395fffb6bafa14ca","observation_id":"11c68245-bd68-4e00-8edf-4e413d3f47ed","resolution":{"observed_at":"2026-08-06T23:20:08.795807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:08.907570Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:08.907570Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:dd677b94672966240402252ed49251e09f1a4f98754baf73bc7c5451e21dc1b0","observation_id":"e5b62196-1ce5-4a5b-a4a0-0392792676e0","resolution":{"observed_at":"2026-08-06T23:20:08.907570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:08.983118Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:08.983118Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:9627473e5b2e52be92c14b78984addc5b5733a29d90c9b3e7044352568b98613","observation_id":"58f7b177-7e25-4ffd-9e74-4d96c07dd3e0","resolution":{"observed_at":"2026-08-06T23:20:08.983118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-18T10:31:16.201312Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-06T23:20:09.055319Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation.arXiv preprint arXiv:2505.04512, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.055319Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:c3ed379c89f39f9f54e21f5f21a83f946ccbdc7661e52891b63dd8982972e3e0","observation_id":"4fe3aad9-1022-4d98-a760-24ab29b51e31","resolution":{"observed_at":"2026-08-06T23:20:09.055319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04698","last_updated":"2025-05-13T06:42:52Z","snapshot_observed_at":"2026-08-10T21:24:08.597398Z","submitted_at":"2025-01-08T18:59:01Z","title":"ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04698","snapshot_observed_at":"2026-08-06T23:20:09.114978Z","title":"Conceptmaster: Multi-concept video customization on diffusion transformer models without test-time tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.114978Z"},"links":{"cited_paper":"/paper/2501.04698","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:1eb1ada28d0d441146abff385c6716442516f5788d66a46617361e27765dd77c","observation_id":"2f7e3dc0-1256-49f6-a739-3e6d4563e608","resolution":{"observed_at":"2026-08-06T23:20:09.114978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:14.232792Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"306e835f-1510-4afa-811e-43f5f46edca7","year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.162659Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:3c8e3b013e411dc623f6d45ca16e11beb672833a34d70db54426d346cab117b5","observation_id":"769b552b-9c95-4183-b04a-ada93d330dec","resolution":{"observed_at":"2026-08-06T23:20:14.336502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-08-06T23:20:09.206886Z","title":"Vace: All-in-one video creation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.206886Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:16ec9d32325afa970cf7df79c3dd68361a18b21d4798808c9cb4e4524fc2fffe","observation_id":"5f8fba00-c4c0-4fd9-98ff-0d666e4b8f59","resolution":{"observed_at":"2026-08-06T23:20:09.206886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19907","last_updated":"2025-03-25T17:59:06Z","snapshot_observed_at":"2026-08-17T07:40:15.098041Z","submitted_at":"2025-03-25T17:59:06Z","title":"FullDiT: Multi-Task Video Generative Foundation Model with Full Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19907","snapshot_observed_at":"2026-08-06T23:20:09.305048Z","title":"Fulldit: Multi-task video generative foundation model with full attention.arXiv preprint arXiv:2503.19907, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.305048Z"},"links":{"cited_paper":"/paper/2503.19907","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:a6c3c31aa4fb58e4edd29529ee81bfc1f7c9d0b06d39fe1de6c1db3de3d4c560","observation_id":"6d30fc64-2077-4d5d-b3d9-fb1fae6e4570","resolution":{"observed_at":"2026-08-06T23:20:09.305048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:14.091805Z","title":"Videopoet: a large language model for zero-shot video generation","venue":null,"work_id":"8cca6fd8-97a1-4aa1-9c64-572aafd8ba4d","year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.407365Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:6cb94f46d206fea541115c3fb21023d71e95a7af911d6c926955d8184917959a","observation_id":"ec7b89bf-d2d0-48a1-a74b-f7d73eb4e67c","resolution":{"observed_at":"2026-08-06T23:20:14.163161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-06T23:20:09.515493Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.515493Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:ec111edbdbedf49b73c3c6f69b01ee97f553e9583499714b59b4f71ae795de07","observation_id":"c129c7a5-e80e-46b0-b21e-6dd4e20cd887","resolution":{"observed_at":"2026-08-06T23:20:09.515493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07802","last_updated":"2025-02-04T22:03:26Z","snapshot_observed_at":"2026-08-17T12:05:01.038643Z","submitted_at":"2025-02-04T22:03:26Z","title":"Movie Weaver: Tuning-Free Multi-Concept Video Personalization with Anchored Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07802","snapshot_observed_at":"2026-08-06T23:20:09.663233Z","title":"Movie weaver: Tuning-free multi-concept video personalization with anchored prompts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.663233Z"},"links":{"cited_paper":"/paper/2502.07802","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:7ce3ad20b93138cd8e805bed55db062b3cbb5812b129129e8a599e5f67ee6909","observation_id":"8f8ddeed-db8f-4a40-9ddb-f0c2b1ebc380","resolution":{"observed_at":"2026-08-06T23:20:09.663233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-06T23:20:09.789388Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.789388Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:b5ad1c32571e66b19877faa251572308904d8c3dc4147e86bcb81c41b1a70b4e","observation_id":"87b65c95-68b9-4163-86f1-1f87160406fe","resolution":{"observed_at":"2026-08-06T23:20:09.789388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13918","last_updated":"2025-10-27T08:22:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-23T18:55:41Z","title":"Improving Video Generation with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13918","snapshot_observed_at":"2026-08-06T23:20:09.835019Z","title":"Improving video generation with human feedback.arXiv preprint arXiv:2501.13918, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.835019Z"},"links":{"cited_paper":"/paper/2501.13918","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:446f7031f0cbe9c2fd31f206554c99d7039029f5f10ac91d3b2af9751e484d7f","observation_id":"c8e34aed-e30e-4720-8208-b41d58262609","resolution":{"observed_at":"2026-08-06T23:20:09.835019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-16T12:58:02.352853Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-06T23:20:09.885970Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment.arXiv preprint arXiv:2502.11079, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.885970Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:ddc7bc7abdaa7d06ea9fc893bfad5c55bf6217c9ddf82fa48b8eeda59125d674","observation_id":"cde2f2fb-60aa-483a-8704-ee42bd252af6","resolution":{"observed_at":"2026-08-06T23:20:09.885970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:13.900379Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":"57fc8e31-0dde-4dbf-8a3c-9c9658d1fb45","year":null},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.945008Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:cfb663cca675c50c0d6a0ffa494946dabb1127315c29b62fc0b5a0d042d49ecc","observation_id":"e32443b8-c6cc-45a4-b9b2-e08c609cd345","resolution":{"observed_at":"2026-08-06T23:20:13.994524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:10.014742Z","title":"Dreamo: A unified framework for image customization.arXiv preprint arXiv:2504.16915, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:10.014742Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:64f15808c425aaff23524e072e5f3c87d6251f33de89623ded1b813182238cd1","observation_id":"6fc12ddd-5bd7-47c0-9aa3-6803ee8a27d2","resolution":{"observed_at":"2026-08-06T23:20:10.014742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T23:20:10.131887Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:10.131887Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:1029120e13b90eb297c41b5c79b7b47cba576f944ce01e721978eef9417a1e41","observation_id":"bb18a231-7d10-40bf-9495-4b25aa743b7b","resolution":{"observed_at":"2026-08-06T23:20:10.131887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:13.709603Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":"80878de4-8a7e-4774-9d4d-7a76f34be0e1","year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:10.226623Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:5619b5b8b345fff113d8b9dfe1f66a0c0dd07bb2aa38e4a915c481a6cc302696","observation_id":"4d755b7a-55be-4e1e-b26e-43458ca8b5fa","resolution":{"observed_at":"2026-08-06T23:20:13.800703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16855","last_updated":"2025-03-09T02:57:28Z","snapshot_observed_at":"2026-08-18T10:59:53.317746Z","submitted_at":"2024-06-24T17:58:47Z","title":"DreamBench++: A Human-Aligned Benchmark for Personalized Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16855","snapshot_observed_at":"2026-08-06T23:20:10.324650Z","title":"Dreambench++: A human-aligned benchmark for personalized image generation.arXiv preprint arXiv:2406.16855, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:10.324650Z"},"links":{"cited_paper":"/paper/2406.16855","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:957d353f8a53ec024149fdd8eb1b6c0ccc22f73cc76ff0be1038b43612fceeb1","observation_id":"c8554331-8089-4797-8ee1-b3731b9d9c15","resolution":{"observed_at":"2026-08-06T23:20:10.324650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-17T10:09:03.767186Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T23:20:10.412598Z","title":"Movie gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:10.412598Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:cd908a87dcdb31a3fc2102c6d98983601d555b0c31ae896e968532aa48956e8d","observation_id":"15c9c35d-d7e8-45c9-918e-6c3ee2b72c86","resolution":{"observed_at":"2026-08-06T23:20:10.412598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:10.519908Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:10.519908Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:9fa9c6e9d88f2b3bdef3f4b5bc5b4c69d6ec683242766b526fdd26b73e2089eb","observation_id":"34b8a0e4-285d-4c45-8c7c-6881a8c5a151","resolution":{"observed_at":"2026-08-06T23:20:10.519908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:13.557833Z","title":"Magi-1: Autoregressive video generation at scale, 2025","venue":null,"work_id":"6b59e358-da5d-4f9b-b01a-a395694b6787","year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:10.671514Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:ce1e461562ea5ad677f8257b5834ebcf9622c29e2fe9df6d8bd8bc502247b927","observation_id":"b461a489-b1b1-4cb4-b54f-bd9d57b55bff","resolution":{"observed_at":"2026-08-06T23:20:13.626322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:13.413098Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in neural information processing systems, 35:25278–25294, 2022","venue":null,"work_id":"653b2b48-bb0a-46ec-9d21-e460f881bfcf","year":2022},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:10.817178Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:c78b259852738f6fe8fc64ab514610f000f536d59360634af2842febc229dad9","observation_id":"2acd82f9-768b-417d-9c3a-133d924b6aef","resolution":{"observed_at":"2026-08-06T23:20:13.475758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08685","last_updated":"2025-05-05T03:31:30Z","snapshot_observed_at":"2026-08-16T12:41:57.140222Z","submitted_at":"2025-04-11T16:46:20Z","title":"Seaweed-7B: Cost-Effective Training of Video Generation Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08685","snapshot_observed_at":"2026-08-06T23:20:10.982218Z","title":"Seaweed-7b: Cost-effective training of video generation foundation model.arXiv preprint arXiv:2504.08685, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:10.982218Z"},"links":{"cited_paper":"/paper/2504.08685","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:9c3f1ae1b168750e510ad7832aed4c5fbe25856c03b23035c52857a1893a637a","observation_id":"4ec1201b-19ef-4f14-b7b5-35fd9534eabf","resolution":{"observed_at":"2026-08-06T23:20:10.982218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:13.275649Z","title":"1st solution in google universal image embedding.https://www.kaggle.com/ datasets/louieshao/guieweights0732, april 2023","venue":null,"work_id":"9b6e8329-6dea-43ff-8560-587421edeefd","year":2023},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:11.107832Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:e798c635f057114c3b6577cf770979386d7e531e2c87743631e9546d73eed7cd","observation_id":"27480fe9-8169-42c9-91bd-d49daaab8682","resolution":{"observed_at":"2026-08-06T23:20:13.342298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-06T23:20:11.402590Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:11.402590Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:d7845dd6f10dc16f35e59d7fb5201078839c874ae0e4b9af3947dd3111b6cde3","observation_id":"e02e20b3-e3c6-4622-a35b-ca2169098098","resolution":{"observed_at":"2026-08-06T23:20:11.402590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08260","last_updated":"2025-04-26T17:58:24Z","snapshot_observed_at":"2026-08-16T13:10:35.398679Z","submitted_at":"2024-10-10T17:57:49Z","title":"Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video Content","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08260","snapshot_observed_at":"2026-08-06T23:20:11.524559Z","title":"Koala-36m: A large-scale video dataset improving consistency between fine-grained conditions and video content.arXiv preprint arXiv:2410.08260, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:11.524559Z"},"links":{"cited_paper":"/paper/2410.08260","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:f329a6c687286747c5ab8050ad5f580d1e1c36c8a2bd28a26428f74b86e9b37e","observation_id":"295f7e3f-39f7-4945-aefd-4fdb20e9e6b0","resolution":{"observed_at":"2026-08-06T23:20:11.524559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04468","last_updated":"2024-01-09T10:12:52Z","snapshot_observed_at":"2026-08-16T14:28:51.989546Z","submitted_at":"2024-01-09T10:12:52Z","title":"MagicVideo-V2: Multi-Stage High-Aesthetic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04468","snapshot_observed_at":"2026-08-06T23:20:11.666371Z","title":"Magicvideo-v2: Multi-stage high-aesthetic video generation.arXiv preprint arXiv:2401.04468, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:11.666371Z"},"links":{"cited_paper":"/paper/2401.04468","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:a9bc4833a9815bf6d32dd419e1c0fe5633d1bf7e4f9badc53d70ee612e298098","observation_id":"93a72d36-888b-4810-a952-d98bbb964178","resolution":{"observed_at":"2026-08-06T23:20:11.666371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08645","last_updated":"2024-12-11T18:59:53Z","snapshot_observed_at":"2026-08-16T13:00:15.230317Z","submitted_at":"2024-12-11T18:59:53Z","title":"ObjectMate: A Recurrence Prior for Object Insertion and Subject-Driven Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08645","snapshot_observed_at":"2026-08-06T23:20:11.805625Z","title":"Objectmate: Arecurrencepriorforobjectinsertionandsubject-drivengeneration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:11.805625Z"},"links":{"cited_paper":"/paper/2412.08645","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:74fc59d4b4befcdc6a2687cf94ea51865922ccbe2d18f976acec0a5be282a763","observation_id":"24ed82c9-4a1f-4a8c-8bf0-0df209fdbbdd","resolution":{"observed_at":"2026-08-06T23:20:11.805625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07314","last_updated":"2025-03-10T13:33:27Z","snapshot_observed_at":"2026-08-16T12:51:31.201892Z","submitted_at":"2025-03-10T13:33:27Z","title":"Automated Movie Generation via Multi-Agent CoT Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07314","snapshot_observed_at":"2026-08-06T23:20:11.903050Z","title":"Automated movie generation via multi-agent cot planning.arXiv preprint arXiv:2503.07314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:11.903050Z"},"links":{"cited_paper":"/paper/2503.07314","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:e4695dece906a02b8981cd3541fa370127b573e40dd98202d7bcd772d5617e84","observation_id":"fee5c2ec-4bfc-471b-9a24-5c858f01a338","resolution":{"observed_at":"2026-08-06T23:20:11.903050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:13.145437Z","title":"Demystifying clip data","venue":null,"work_id":"f8950612-1e1a-4e74-80c0-4e2f5c7b76ab","year":null},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:12.011700Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:a07534d1ae0017e8d2754f5a5567c4f1161dbef0b964524b472d5ff31c0fc691","observation_id":"a5f0b523-a422-4d12-956f-003f6cb3b5d5","resolution":{"observed_at":"2026-08-06T23:20:13.201869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:12.136554Z","title":"Magicanimate: Temporally consistent human image animation using diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:12.136554Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:f7012715d48ab78fd1610f54abb1fe75084cbfbe902c6f830b5ced4f2dbc14a9","observation_id":"7a66a847-caf4-4edb-8a1f-4a23c9279113","resolution":{"observed_at":"2026-08-06T23:20:12.136554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T23:20:12.221510Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:12.221510Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:805ac91e3cdd271f688bd6cc85f3d9cfe10362693c4fec8497264be5d4c2a1bf","observation_id":"13d8e36f-b585-41e5-b67b-88d083295212","resolution":{"observed_at":"2026-08-06T23:20:12.221510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T23:20:12.336672Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:12.336672Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:8bc075417206793e4980266f74f845a1a84ec43cbf842b58c89e8dad8f43b560","observation_id":"a0d0ab4a-a491-4c73-8109-3edb5a25304c","resolution":{"observed_at":"2026-08-06T23:20:12.336672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:13.030085Z","title":"Make pixels dance: High-dynamic video generation","venue":null,"work_id":"c99f86dc-8f19-4250-906d-82d565ca8ddb","year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:12.457366Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:cbe9403f96217becb2c9e76b4a6b6a2a5e53c2edfe3e47c6ed8254fdb369bb9f","observation_id":"e8f64890-f3de-4bc5-99b4-93aeaf419afe","resolution":{"observed_at":"2026-08-06T23:20:13.067847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14151","last_updated":"2025-07-02T11:55:35Z","snapshot_observed_at":"2026-08-17T04:58:51.328744Z","submitted_at":"2025-03-18T11:17:32Z","title":"Concat-ID: Towards Universal Identity-Preserving Video Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14151","snapshot_observed_at":"2026-08-06T23:20:12.568377Z","title":"Concat-id: Towards universal identity- preserving video synthesis.arXiv preprint arXiv:2503.14151, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:12.568377Z"},"links":{"cited_paper":"/paper/2503.14151","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:96b707f98c6b86248142bf50937b3f0569099b0e73b8c8c4e9d77ebd48ab5b91","observation_id":"76c4d674-998f-407b-bbb5-a3ba01a77a12","resolution":{"observed_at":"2026-08-06T23:20:12.568377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T19:51:33.671506Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 6 inbound Pith citation observations for arXiv:2506.18851."}