{"as_of":"2026-08-16T21:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:23fdfb1f921936ff6115fd90d0bff307f7fd0464dcd4d267d09e7975fcaf242d","coverage":[{"denominator":130,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:59:35.677086Z","state":"measured"},{"denominator":122,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":122,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:42:42.185508Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T21:10:09.694521Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2504.17816","last_updated":"2026-05-05T15:27:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-23T06:48:31Z","title":"Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-22T17:51:41.947939Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2504.17816"},"observation_digest":"sha256:eb9ea2e9b52b5981ccc11a5386ae050f862f609f663caa11850c443f9a4111d0","observation_id":"3aca3f54-c5c7-42cd-9089-7b36a2819a38","resolution":{"observed_at":"2026-05-22T17:51:54.359831Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-08-12T23:49:38.644434Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T17:34:26.951644Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2506.03147"},"observation_digest":"sha256:63c4b35497defe2aab869027edb4fc8c069545fe61067591b25499ea021f592a","observation_id":"c203b860-2132-44a4-b42f-76f32dfc4acd","resolution":{"observed_at":"2026-05-12T17:34:27.064326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-08-05T12:42:42.185508Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01362","last_updated":"2025-09-01T11:03:13Z","snapshot_observed_at":"2026-08-10T07:44:03.921258Z","submitted_at":"2025-09-01T11:03:13Z","title":"Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T12:42:42.185508Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2509.01362"},"observation_digest":"sha256:ad628c89f4eccf14f1a8e2ff9ca28b2af6b65c7ad4ff286450bde0ebae2b70a8","observation_id":"1f147232-5df2-4fc5-99ef-ccfb5336fef7","resolution":{"observed_at":"2026-08-05T12:42:42.185508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-13T12:23:05.876881Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation.arXiv preprint arXiv:2505.20292, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03738","last_updated":"2026-04-04T13:50:38Z","snapshot_observed_at":"2026-08-14T15:31:16.200472Z","submitted_at":"2026-04-04T13:50:38Z","title":"Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T12:23:05.876881Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2604.03738"},"observation_digest":"sha256:4d435b842fdadc951766b094039fbdc81dd92b485a267cee2f99589aba3c3f78","observation_id":"df606aab-91b1-478b-acf8-815f5d58b22b","resolution":{"observed_at":"2026-07-13T12:23:05.876881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-08-06T16:53:42.723002Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:2dbfeb0130104a171b8c94eb20e6eb03408223074aa23432a3be5e026a6fd825","observation_id":"47eeac02-5dbc-4b30-b9c4-37208fa942b8","resolution":{"observed_at":"2026-05-11T11:11:00.839751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2604.17021","last_updated":"2026-04-18T15:09:01Z","snapshot_observed_at":"2026-08-11T09:37:14.154640Z","submitted_at":"2026-04-18T15:09:01Z","title":"LIVE: Leveraging Image Manipulation Priors for Instruction-based Video Editing","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T07:21:41.483427Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2604.17021"},"observation_digest":"sha256:4201d06f9e0ac769038f33895f59e44df4620cc6d1724a1dc42c184c21dbad7c","observation_id":"ca89bad4-82c4-42aa-8181-608e8e4bff9b","resolution":{"observed_at":"2026-05-10T07:21:55.095118Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2604.23789","last_updated":"2026-08-11T17:07:14Z","snapshot_observed_at":"2026-08-14T23:11:42.139241Z","submitted_at":"2026-04-26T16:28:46Z","title":"MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-08T06:28:42.129881Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2604.23789"},"observation_digest":"sha256:f58c686dbcb735da7d9ea0c7798cf65b0ce6673c3a28a39dbfc505865a0339dc","observation_id":"146ce315-82b4-4402-80e4-5c6faf90d9aa","resolution":{"observed_at":"2026-05-11T21:11:19.210744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2604.23789","last_updated":"2026-08-11T17:07:14Z","snapshot_observed_at":"2026-08-14T23:11:42.139241Z","submitted_at":"2026-04-26T16:28:46Z","title":"MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:10.509727Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2604.23789"},"observation_digest":"sha256:d68d1fb9dc60af7ca49d857efa27c7de5dcec40f2c1e6e7d804ada6adcc62421","observation_id":"3c22f376-4c71-479b-ae69-5a2cacaa96a2","resolution":{"observed_at":"2026-05-12T00:51:15.130701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2605.15199","last_updated":"2026-05-14T17:59:55Z","snapshot_observed_at":"2026-08-15T21:25:03.989029Z","submitted_at":"2026-05-14T17:59:55Z","title":"EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T03:16:03.450742Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2605.15199"},"observation_digest":"sha256:927f230fd8f8c4ec715c01c130b050e6b92571237e0e7460c796afb3aaea14ae","observation_id":"3b2377c7-e313-49fd-a656-7d491fbca3fb","resolution":{"observed_at":"2026-05-15T03:19:44.040337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2605.15824","last_updated":"2026-06-17T15:16:37Z","snapshot_observed_at":"2026-08-16T00:30:22.953814Z","submitted_at":"2026-05-15T10:25:06Z","title":"FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T20:11:33.277349Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2605.15824"},"observation_digest":"sha256:b5235aa1f93633b07a9bfc5087754c402d13b831a0f50f8167a9938bf8f1f35e","observation_id":"6884ece6-c3fc-4215-9ccc-eaebec221846","resolution":{"observed_at":"2026-05-20T20:13:43.506965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2605.15824","last_updated":"2026-06-17T15:16:37Z","snapshot_observed_at":"2026-08-16T00:30:22.953814Z","submitted_at":"2026-05-15T10:25:06Z","title":"FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T19:23:07.044659Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2605.15824"},"observation_digest":"sha256:8bfa87a21149e73d6c521cb9660ed6d47593ae5c33bb6875fd0d6212bc6a7d0c","observation_id":"d0708f02-1251-4c41-98d5-c8e04e91a0cc","resolution":{"observed_at":"2026-06-30T19:25:00.604747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2605.17488","last_updated":"2026-05-17T14:56:52Z","snapshot_observed_at":"2026-08-16T04:42:39.882027Z","submitted_at":"2026-05-17T14:56:52Z","title":"Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-20T14:08:30.802619Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2605.17488"},"observation_digest":"sha256:27073a4e66f533085515c1a12f031a24cd72248426d7731c43c9fcb712cb8bdd","observation_id":"3f51a193-c34a-4d5e-9ebd-0abde07ca1f5","resolution":{"observed_at":"2026-05-20T14:13:21.404522Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-08-14T00:58:52.512972Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-20T05:17:11.690484Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:c28563006d4f3e2357b47534230c636a611434ac6e28d671854521cab4d24bb0","observation_id":"ec6a5880-b1f9-4524-8903-030cab407046","resolution":{"observed_at":"2026-05-20T05:18:03.111547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-08-14T00:58:52.512972Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:76f52ab99ce8390e381802c702a01ecd2409ddb5039045c7d7516ef9944b0a36","observation_id":"5717e354-4435-4328-84c4-ea7fe842b65e","resolution":{"observed_at":"2026-06-30T18:04:58.012646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2605.22344","last_updated":"2026-05-21T11:30:29Z","snapshot_observed_at":"2026-08-16T15:52:17.416464Z","submitted_at":"2026-05-21T11:30:29Z","title":"Bernini: Latent Semantic Planning for Video Diffusion","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-22T06:39:47.124605Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2605.22344"},"observation_digest":"sha256:52423054426fd91544181d3bdbc282a91ec0fd125552547ceeddd2abd5dd5289","observation_id":"cd359f9b-2198-495b-99ac-3411e362971e","resolution":{"observed_at":"2026-05-22T06:41:10.560161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2605.26628","last_updated":"2026-05-26T07:04:22Z","snapshot_observed_at":"2026-08-10T16:16:44.522987Z","submitted_at":"2026-05-26T07:04:22Z","title":"Tail-Aware HiFloat4: W4A4 Post-Training Quantization for Wan2.2","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T18:20:47.823852Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2605.26628"},"observation_digest":"sha256:4e55554a4b3b80864a4035a1c72daedeb5b149c35cc53146886b02fde82d1dfd","observation_id":"4b4fd2de-3168-4ea7-a51a-7561b92f26d8","resolution":{"observed_at":"2026-06-29T18:23:50.628549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2606.00658","last_updated":"2026-05-30T10:15:26Z","snapshot_observed_at":"2026-08-16T03:48:54.402637Z","submitted_at":"2026-05-30T10:15:26Z","title":"Collaborative Few-Step Distillation and Low-Bit Quantization for Wan2.2 Dual-Expert Video Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T18:58:13.799615Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2606.00658"},"observation_digest":"sha256:d23b640f3a85f918d504367aa393b9c5255e26c01500bf0f96c30cb86820fce9","observation_id":"e4cabb42-3932-46e4-9b28-ebaf7eacccd8","resolution":{"observed_at":"2026-06-28T19:02:34.320535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2606.10839","last_updated":"2026-06-22T14:44:53Z","snapshot_observed_at":"2026-08-14T00:06:50.520203Z","submitted_at":"2026-06-09T13:26:39Z","title":"HarmoView: Harmonizing Multi-View Constraints for Identity-Consistent Video Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T13:49:50.272650Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2606.10839"},"observation_digest":"sha256:63fe778357441ef0917f80aa5879f312a2df088807326513e6d55eef7722926a","observation_id":"a615470e-d2b6-4529-8694-59cd4b3071a9","resolution":{"observed_at":"2026-07-03T04:37:36.638712Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2606.26058","last_updated":"2026-06-24T17:33:13Z","snapshot_observed_at":"2026-08-10T18:08:57.833777Z","submitted_at":"2026-06-24T17:33:13Z","title":"DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-25T19:00:23.260939Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2606.26058"},"observation_digest":"sha256:0b2aa7f7408e951ce8d8a509f3d26e419f864ae3fbb3f60d7958fd1dcc2ab4d5","observation_id":"90ac3907-af02-4025-9542-4cd1e31b21b3","resolution":{"observed_at":"2026-07-04T21:10:09.696509Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-11T20:11:31.576642Z","title":"arXiv preprint arXiv:2505.20292 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04311","last_updated":"2026-07-07T14:30:21Z","snapshot_observed_at":"2026-08-12T05:49:11.638121Z","submitted_at":"2026-07-05T13:54:33Z","title":"Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-11T20:11:31.576642Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2607.04311"},"observation_digest":"sha256:71ea1d77660a22134f37e8c243ae8feeace1b3a264dcecd258e5d3a452215317","observation_id":"415ecded-5571-409f-9c9f-beb34b30e50a","resolution":{"observed_at":"2026-07-11T20:11:31.576642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-08-01T10:24:52.920746Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject-to-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:52.920746Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2607.20247"},"observation_digest":"sha256:c55f882105d14adefb5cf1c075332231a89da003743460363ad8f06d49bf0a86","observation_id":"276855ba-c617-4634-a6d8-21ed7da399bb","resolution":{"observed_at":"2026-08-01T10:24:52.920746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-31T05:08:20.144127Z","title":"OpenS2V-Nexus: A detailed benchmark and million-scale dataset for subject- to-video generation.arXiv preprint arXiv:2505.20292, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.144127Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:7622bcf9d15daf3f2db31487e8ae554215569e7b092459443f859f4f60497f01","observation_id":"1fdba910-7052-43bc-a0ce-292612471ffe","resolution":{"observed_at":"2026-07-31T05:08:20.144127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20292/citation-record","integrity":"/paper/2505.20292/integrity","json":"/paper/2505.20292/citation-record.json","paper":"/paper/2505.20292"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-16T19:40:28.523700Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:59:27.582566Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:27.582566Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:9692ccc809adbbee78f1dc9a8703f9745dbc1ae7459ec270221ae92aeaa6466e","observation_id":"f622355a-fc11-46d9-8882-071363473815","resolution":{"observed_at":"2026-08-07T13:59:27.582566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:27.677003Z","title":"Detecting ai-generated images using vision transformers: A robust approach for safeguarding visual media integrity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:27.677003Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:6afa1e3285f3ad2512f56c5d224b32fd849d2ea551fda47e9e7c2fe3b88a6dd8","observation_id":"674e39e3-f51d-4ec1-b250-274525a49cf0","resolution":{"observed_at":"2026-08-07T13:59:27.677003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T13:59:27.789237Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:27.789237Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:39b8b039d7b3abc7d55a2b92f274eb58ae7ac14909c598042c589520fa172ca6","observation_id":"b31a7f79-6b63-43d9-bd3b-b1ec684f5ca5","resolution":{"observed_at":"2026-08-07T13:59:27.789237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:27.939740Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:27.939740Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:a201b987d29a32c5390f18ed86824684a6eab128ae4bd0baf383052dbbf39b41","observation_id":"d4d2a682-d6fc-4019-872e-3d68462c74af","resolution":{"observed_at":"2026-08-07T13:59:27.939740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-16T13:54:44.432320Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-07T13:59:28.048350Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:28.048350Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:20c1364213507a1dc5b7b7295a653f71ed3fb069f844a4f8b36488c29d136b4c","observation_id":"e211f830-c275-4c09-812e-117d517cad8a","resolution":{"observed_at":"2026-08-07T13:59:28.048350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:28.178541Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:28.178541Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:c8b879a65a3eff16c8fae9dcf9fb97d4784a93772b33c1164e3a37e25e373116","observation_id":"c83fa217-46b4-4b85-a1b9-10cffa1791f9","resolution":{"observed_at":"2026-08-07T13:59:28.178541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18597","last_updated":"2025-03-26T09:05:41Z","snapshot_observed_at":"2026-08-16T12:59:57.130892Z","submitted_at":"2024-12-24T18:51:19Z","title":"DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18597","snapshot_observed_at":"2026-08-07T13:59:28.322361Z","title":"Ditctrl: Exploring attention control in multi-modal diffusion trans- former for tuning-free multi-prompt longer video generation.arXiv preprint arXiv:2412.18597, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:28.322361Z"},"links":{"cited_paper":"/paper/2412.18597","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:08ab529f0ce82117bc895ba4b05d8024fc263d7c401c47fd171f94efcb734f0a","observation_id":"eba92d87-f4a5-49c3-8088-45ad15c42153","resolution":{"observed_at":"2026-08-07T13:59:28.322361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12052","last_updated":"2024-05-05T05:07:34Z","snapshot_observed_at":"2026-08-16T14:42:12.868645Z","submitted_at":"2023-11-18T10:22:44Z","title":"MagicPose: Realistic Human Poses and Facial Expressions Retargeting with Identity-aware Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12052","snapshot_observed_at":"2026-08-07T13:59:28.549879Z","title":"Magicpose: Realistic human poses and facial expressions retargeting with identity-aware diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:28.549879Z"},"links":{"cited_paper":"/paper/2311.12052","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:2f9e4eea9831660771b195711fdbe2205af17b4ffe7d79af9b6149a5ca8aff85","observation_id":"2b2e282a-64fc-4df7-8bcc-652b8e8d3538","resolution":{"observed_at":"2026-08-07T13:59:28.549879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05793","last_updated":"2023-09-11T19:59:43Z","snapshot_observed_at":"2026-08-16T15:01:35.965165Z","submitted_at":"2023-09-11T19:59:43Z","title":"PhotoVerse: Tuning-Free Image Customization with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05793","snapshot_observed_at":"2026-08-07T13:59:28.605625Z","title":"Photoverse: Tuning-free image customization with text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:28.605625Z"},"links":{"cited_paper":"/paper/2309.05793","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:4f44b2bfdaad9f068c7a2777b6532c7d3b173bf3ffa96f48202f1fd9d244ead0","observation_id":"5041d6bd-3208-4592-b253-afb119d6efc5","resolution":{"observed_at":"2026-08-07T13:59:28.605625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01199","last_updated":"2024-09-09T13:49:53Z","snapshot_observed_at":"2026-08-16T13:22:05.398625Z","submitted_at":"2024-09-02T12:20:42Z","title":"OD-VAE: An Omni-dimensional Video Compressor for Improving Latent Video Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01199","snapshot_observed_at":"2026-08-07T13:59:28.683440Z","title":"Od-vae: An omni-dimensional video compressor for improving latent video diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:28.683440Z"},"links":{"cited_paper":"/paper/2409.01199","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:d6ba3d4a28374cff0ba2254d06023f3c47d0ac54b90da47914392671ff79794d","observation_id":"a83ac1d4-5098-4588-8898-770acbd2eee6","resolution":{"observed_at":"2026-08-07T13:59:28.683440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19479","last_updated":"2024-02-29T18:59:50Z","snapshot_observed_at":"2026-08-16T14:13:59.779732Z","submitted_at":"2024-02-29T18:59:50Z","title":"Panda-70M: Captioning 70M Videos with Multiple Cross-Modality Teachers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19479","snapshot_observed_at":"2026-08-07T13:59:28.739467Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:28.739467Z"},"links":{"cited_paper":"/paper/2402.19479","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:6ca7c7645183fcd7791f774e8cdf2e7d849ced0c495c7db5cbde2c2ccd006d01","observation_id":"9a4bf5ea-8a1e-4037-9f18-93bd8d8d0591","resolution":{"observed_at":"2026-08-07T13:59:28.739467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06187","last_updated":"2025-03-20T17:59:56Z","snapshot_observed_at":"2026-08-16T12:59:16.381164Z","submitted_at":"2025-01-10T18:59:54Z","title":"Multi-subject Open-set Personalization in Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06187","snapshot_observed_at":"2026-08-07T13:59:28.849584Z","title":"Multi- subject open-set personalization in video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:28.849584Z"},"links":{"cited_paper":"/paper/2501.06187","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:a86a1dd6b4595315e1c614bae324d0d9fbddc962b065308d6b8e354a83ff32c0","observation_id":"08a4a1b2-29ee-4e32-b9c5-a14526531a4f","resolution":{"observed_at":"2026-08-07T13:59:28.849584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07774","last_updated":"2024-12-11T22:51:08Z","snapshot_observed_at":"2026-08-13T17:44:25.192702Z","submitted_at":"2024-12-10T18:59:55Z","title":"UniReal: Universal Image Generation and Editing via Learning Real-world Dynamics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07774","snapshot_observed_at":"2026-08-07T13:59:28.964637Z","title":"Unireal: Universal image generation and editing via learning real-world dynamics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:28.964637Z"},"links":{"cited_paper":"/paper/2412.07774","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:0f74fd71db249cb9e647ccba2ceaca228a5bd3dbefa8a5199a45ab1daca41463","observation_id":"32a1c487-0f0f-45d1-b6cb-035ad5f57224","resolution":{"observed_at":"2026-08-07T13:59:28.964637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:29.040098Z","title":"Yolo- world: Real-time open-vocabulary object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.040098Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:9f3807318180829100d87bddefde4c57ddef383085d872d2fb6811fe996ee6d8","observation_id":"9b8bc10a-163f-4858-ab5a-41425d925ea7","resolution":{"observed_at":"2026-08-07T13:59:29.040098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:29.159161Z","title":"improved-aesthetic-predictor","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.159161Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:c98e09ca7f62a8f055dcaccd9aa585a4b9b03aceb280b72f1ff96ad46fe9f60f","observation_id":"a6948c17-7919-4f42-9b3a-095e838483d6","resolution":{"observed_at":"2026-08-07T13:59:29.159161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:29.222747Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.222747Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:d7c8d074272d2906005bf1b4782e7dc9d6d151accc3f127b1af7a8fdfeb03cad","observation_id":"8ea5b247-88ce-431e-86f4-3e07a6732a56","resolution":{"observed_at":"2026-08-07T13:59:29.222747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10391","last_updated":"2025-03-13T14:07:58Z","snapshot_observed_at":"2026-08-16T12:50:22.094509Z","submitted_at":"2025-03-13T14:07:58Z","title":"CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10391","snapshot_observed_at":"2026-08-07T13:59:29.343261Z","title":"Cinema: Coherent multi-subject video generation via mllm-based guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.343261Z"},"links":{"cited_paper":"/paper/2503.10391","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:acf66465529e0ca9112331bec15593755ba2c64611ab47990f2bfb0d4264ad07","observation_id":"7344fd96-2a37-4a56-9bff-dc864b12df8a","resolution":{"observed_at":"2026-08-07T13:59:29.343261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:29.388166Z","title":"Worldscore: A unified evaluation benchmark for world generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.388166Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:6c9308879b1653563d2518b4d561b17fa7af86eb7072c9582d5693f9cca12b4a","observation_id":"5f763547-6771-4408-af08-5709abd1f81d","resolution":{"observed_at":"2026-08-07T13:59:29.388166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08453","last_updated":"2025-01-14T21:53:11Z","snapshot_observed_at":"2026-08-16T12:58:55.502275Z","submitted_at":"2025-01-14T21:53:11Z","title":"Vchitect-2.0: Parallel Transformer for Scaling Up Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08453","snapshot_observed_at":"2026-08-07T13:59:29.452382Z","title":"Vchitect-2.0: Parallel transformer for scaling up video diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.452382Z"},"links":{"cited_paper":"/paper/2501.08453","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:bbbfd1ab1a52bc0ea27a616bd26d280eee95075b69395d64793eedb877c99985","observation_id":"78244fcb-96a4-4777-9e21-b732843a7d56","resolution":{"observed_at":"2026-08-07T13:59:29.452382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-16T12:44:19.692222Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-08-07T13:59:29.507056Z","title":"Skyreels-a2: Compose anything in video diffusion trans- formers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.507056Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:a8d9c1f714ffc87849fcb0bc0caf05201ac75837588ad3d188ce287328e0472b","observation_id":"87b78b0f-fefc-47bf-a394-e5f5bcd6680b","resolution":{"observed_at":"2026-08-07T13:59:29.507056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01790","last_updated":"2025-03-18T10:47:27Z","snapshot_observed_at":"2026-08-13T05:44:11.203234Z","submitted_at":"2025-01-03T12:45:22Z","title":"Ingredients: Blending Custom Photos with Video Diffusion Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01790","snapshot_observed_at":"2026-08-07T13:59:29.585694Z","title":"Ingredients: Blending custom photos with video diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.585694Z"},"links":{"cited_paper":"/paper/2501.01790","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:7c8a224dd59421907f29ec9ba07d7dbe51bb96180a39f4acc9dcabc63a00eb8a","observation_id":"4038376a-8f8a-411c-83bd-87e66b361c56","resolution":{"observed_at":"2026-08-07T13:59:29.585694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02807","last_updated":"2025-01-07T07:47:22Z","snapshot_observed_at":"2026-08-16T15:39:49.519236Z","submitted_at":"2025-01-06T07:00:22Z","title":"AE-NeRF: Augmenting Event-Based Neural Radiance Fields for Non-ideal Conditions and Larger Scene","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02807","snapshot_observed_at":"2026-08-07T13:59:29.672932Z","title":"Ae-nerf: Augmenting event-based neural radiance fields for non-ideal conditions and larger scene","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.672932Z"},"links":{"cited_paper":"/paper/2501.02807","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:aa618ec436ee59bb57fcc701c4f489b9d66d2f7736fcdb192f32bec97d491315","observation_id":"7e1227c4-7833-4794-8ce6-f823e278d27e","resolution":{"observed_at":"2026-08-07T13:59:29.672932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-07T13:59:29.775085Z","title":"An image is worth one word: Personalizing text-to-image generation using textual inversion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.775085Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:ffeeb72da89263ecfa391b9b135f5574b3367281c632830daeaf1d3394f3c21a","observation_id":"0bcb0d86-c873-465d-9046-9c71c1b4ca33","resolution":{"observed_at":"2026-08-07T13:59:29.775085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-12T14:50:50.360929Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-07T13:59:29.829842Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.829842Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:e321d91ccc7a7283b975ad7d532b3660bb114b7225a4b3e3bd1878acbcc481dd","observation_id":"c460b892-36fd-4c44-9c27-2e96a2b65ab3","resolution":{"observed_at":"2026-08-07T13:59:29.829842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16022","last_updated":"2024-10-31T12:17:39Z","snapshot_observed_at":"2026-08-16T13:58:08.710994Z","submitted_at":"2024-04-24T17:55:33Z","title":"PuLID: Pure and Lightning ID Customization via Contrastive Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16022","snapshot_observed_at":"2026-08-07T13:59:29.869968Z","title":"Pulid: Pure and lightning id customization via contrastive alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.869968Z"},"links":{"cited_paper":"/paper/2404.16022","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:7c515a4c67ceeb24de53d63d703c6e015677791b97419e7cd19ac78ffe3dda1f","observation_id":"cef193aa-9fac-4a73-9318-e231dbffa46f","resolution":{"observed_at":"2026-08-07T13:59:29.869968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05939","last_updated":"2024-09-06T14:44:12Z","snapshot_observed_at":"2026-08-16T13:27:06.540667Z","submitted_at":"2024-08-12T06:27:29Z","title":"UniPortrait: A Unified Framework for Identity-Preserving Single- and Multi-Human Image Personalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05939","snapshot_observed_at":"2026-08-07T13:59:29.959239Z","title":"Uniportrait: A unified framework for identity- preserving single-and multi-human image personalization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.959239Z"},"links":{"cited_paper":"/paper/2408.05939","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:36bc8dbda7a3ede735e6d4fcb5ef6641e759932435887e499286e7f207477be3","observation_id":"b9ca7979-c9c2-4e8a-8da3-5d1cf9e33c7f","resolution":{"observed_at":"2026-08-07T13:59:29.959239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15252","last_updated":"2024-10-14T04:08:53Z","snapshot_observed_at":"2026-08-16T13:40:41.995891Z","submitted_at":"2024-06-21T15:43:46Z","title":"VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15252","snapshot_observed_at":"2026-08-07T13:59:30.049247Z","title":"Videoscore: Building automatic metrics to simulate fine-grained human feedback for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.049247Z"},"links":{"cited_paper":"/paper/2406.15252","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:c0d1cd939e9fbb4982edce167105d60af866e8a73d2d9a7270aeac2d62eb69e5","observation_id":"2a96e897-15fa-4f12-9e15-faf72dbb4d0b","resolution":{"observed_at":"2026-08-07T13:59:30.049247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15275","last_updated":"2024-06-25T16:57:27Z","snapshot_observed_at":"2026-08-16T13:58:25.984156Z","submitted_at":"2024-04-23T17:59:43Z","title":"ID-Animator: Zero-Shot Identity-Preserving Human Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15275","snapshot_observed_at":"2026-08-07T13:59:30.179985Z","title":"Id-animator: Zero-shot identity-preserving human video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.179985Z"},"links":{"cited_paper":"/paper/2404.15275","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:474527dfe1ff715fe486c120546ebc510c680c77157a5a410238617e8ecd2bc7","observation_id":"7b23639f-4312-4f64-a82f-555e6e29f70c","resolution":{"observed_at":"2026-08-07T13:59:30.179985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T13:59:30.262848Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.262848Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:a5b990406876d37b16fe1cea6551b1880d58b01d9d1da8c93a3df6d1c4727e49","observation_id":"79771ac8-067f-45f3-b446-1b6261545c69","resolution":{"observed_at":"2026-08-07T13:59:30.262848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:30.325203Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.325203Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:06b58d8a5f759604d1de64097e2f17e0b656b8e3cb74d11e059076cd1893156b","observation_id":"b14917ee-acdd-488e-a78f-8696687ca2b8","resolution":{"observed_at":"2026-08-07T13:59:30.325203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06145","last_updated":"2025-02-10T04:20:11Z","snapshot_observed_at":"2026-08-14T23:19:43.982858Z","submitted_at":"2025-02-10T04:20:11Z","title":"Animate Anyone 2: High-Fidelity Character Image Animation with Environment Affordance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06145","snapshot_observed_at":"2026-08-07T13:59:30.416393Z","title":"Animate anyone 2: High-fidelity character image animation with environment affordance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.416393Z"},"links":{"cited_paper":"/paper/2502.06145","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:307b18ddbaf95c9db86db75c559666b64bb575b002f7b92329be62b07634865c","observation_id":"3f861033-8931-486c-b7df-ae3fe9cb8860","resolution":{"observed_at":"2026-08-07T13:59:30.416393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-15T23:24:13.384254Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-07T13:59:30.485928Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.485928Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:939685681ec80b13e5982582ad1d270e867e40b72546ea9ada9e32c19d5d512c","observation_id":"63e9d5a2-120e-4bf2-8687-2cb8e04ecf70","resolution":{"observed_at":"2026-08-07T13:59:30.485928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:30.553705Z","title":"Curricularface: adaptive curriculum learning loss for deep face recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.553705Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:519c0f145af9e7e33a8dfed3684cf73bde609272943243a9ec0aeebbe0b1ced5","observation_id":"d2626035-6181-445e-b482-e4885d7f8b11","resolution":{"observed_at":"2026-08-07T13:59:30.553705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04698","last_updated":"2025-05-13T06:42:52Z","snapshot_observed_at":"2026-08-10T21:24:08.597398Z","submitted_at":"2025-01-08T18:59:01Z","title":"ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04698","snapshot_observed_at":"2026-08-07T13:59:30.608834Z","title":"Conceptmaster: Multi-concept video customization on diffusion transformer models without test-time tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.608834Z"},"links":{"cited_paper":"/paper/2501.04698","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:fae78a96ad1a8d47634f454571e3f0e889d58fe7c68791951b45922361033b4f","observation_id":"ed245bbb-b229-4733-8b8c-c399a21ac318","resolution":{"observed_at":"2026-08-07T13:59:30.608834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17982","last_updated":"2023-11-29T18:39:01Z","snapshot_observed_at":"2026-08-16T14:39:07.992859Z","submitted_at":"2023-11-29T18:39:01Z","title":"VBench: Comprehensive Benchmark Suite for Video Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17982","snapshot_observed_at":"2026-08-07T13:59:30.690138Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.690138Z"},"links":{"cited_paper":"/paper/2311.17982","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:df4b811cc7df4f62a2b1410d127543c4ec14db1b90bb0eacf8dc8ad4aae0e281","observation_id":"65e3c255-602b-4982-bb4b-57471c45dd2c","resolution":{"observed_at":"2026-08-07T13:59:30.690138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13503","last_updated":"2024-11-20T17:54:41Z","snapshot_observed_at":"2026-08-12T19:44:40.357419Z","submitted_at":"2024-11-20T17:54:41Z","title":"VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13503","snapshot_observed_at":"2026-08-07T13:59:30.771224Z","title":"Vbench++: Comprehensive and versatile benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.771224Z"},"links":{"cited_paper":"/paper/2411.13503","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:3e721f421bd66650bbd4948079cd455cd777bbf6ede1ad2764904338580ae6f9","observation_id":"288b44fb-26ab-4086-8dd5-595bdb0df7fe","resolution":{"observed_at":"2026-08-07T13:59:30.771224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16418","last_updated":"2025-07-29T01:42:34Z","snapshot_observed_at":"2026-08-16T12:48:10.512851Z","submitted_at":"2025-03-20T17:59:34Z","title":"InfiniteYou: Flexible Photo Recrafting While Preserving Your Identity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16418","snapshot_observed_at":"2026-08-07T13:59:30.860050Z","title":"Infiniteyou: Flexible photo recrafting while preserving your identity","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.860050Z"},"links":{"cited_paper":"/paper/2503.16418","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:ec8ada9c8886ec819358f63cce14532159f0ac39c5d199104f403ceb0c9c4c48","observation_id":"0baf8290-2faa-4be9-bc22-e5438a041216","resolution":{"observed_at":"2026-08-07T13:59:30.860050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:30.937726Z","title":"Videobooth: Diffusion-based video generation with image prompts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.937726Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:635a2e5bde5a1c3643962162e25e4aba06fdd13a96ff2023a4d7ee46d782788b","observation_id":"7d0df9c7-c0c8-473b-a301-0bf36b3a1813","resolution":{"observed_at":"2026-08-07T13:59:30.937726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-08-07T13:59:30.975711Z","title":"Vace: All-in-one video creation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.975711Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:01d7e6e6714af2fb8093fd4917de80be8a49b5bfe23ef8d9600b13bb019d6d1b","observation_id":"94ca3e3a-605d-4741-ace1-aa094a4bcc71","resolution":{"observed_at":"2026-08-07T13:59:30.975711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T13:59:31.009125Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.009125Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:30da09e1a3e37cf7fcaf050b580e18260ea1c59996a0a026915fd4361d54bccd","observation_id":"d40dcba6-b12e-407f-8fee-4f445c5d4eda","resolution":{"observed_at":"2026-08-07T13:59:31.009125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11956","last_updated":"2024-08-07T17:02:00Z","snapshot_observed_at":"2026-08-16T14:08:43.418280Z","submitted_at":"2024-03-18T16:52:49Z","title":"Subjective-Aligned Dataset and Metric for Text-to-Video Quality Assessment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11956","snapshot_observed_at":"2026-08-07T13:59:31.052527Z","title":"Subjective-aligned dateset and metric for text-to-video quality assessment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.052527Z"},"links":{"cited_paper":"/paper/2403.11956","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:1efbe36b752b779cc874a39a96331df8f5105abea3d3f5976cb724abef53ebec","observation_id":"a9f50fd2-8410-4887-94a1-fddec84a7c47","resolution":{"observed_at":"2026-08-07T13:59:31.052527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:31.099118Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.099118Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:fc9c6eb7e91f30dd7c2e361cd592abc07fd07bb06ff0a986739facb35dd1e09f","observation_id":"32bfaf9c-8b5c-4e53-b2cc-80377defbc32","resolution":{"observed_at":"2026-08-07T13:59:31.099118Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:31.162597Z","title":"Pika-2.0 lab discord server","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.162597Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:657ece2f6451ccbc0d6ca798540fbe2576119d7d2c752ddae80752ed6883abd5","observation_id":"75367925-d66c-4aca-915c-9a298cb79360","resolution":{"observed_at":"2026-08-07T13:59:31.162597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00115","last_updated":"2025-01-04T06:16:56Z","snapshot_observed_at":"2026-08-16T12:12:11.313948Z","submitted_at":"2024-11-28T07:01:06Z","title":"OpenHumanVid: A Large-Scale High-Quality Dataset for Enhancing Human-Centric Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00115","snapshot_observed_at":"2026-08-07T13:59:31.215680Z","title":"Openhumanvid: A large-scale high-quality dataset for enhancing human-centric video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.215680Z"},"links":{"cited_paper":"/paper/2412.00115","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:933487eda0a14b4a78c4aecfda8abdcd8226b34e91a1908e355af8f8a68ce5bb","observation_id":"6233e01f-9820-43fc-bfbf-9768baece134","resolution":{"observed_at":"2026-08-07T13:59:31.215680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06741","last_updated":"2025-01-04T06:17:20Z","snapshot_observed_at":"2026-08-16T13:26:47.785696Z","submitted_at":"2024-08-13T09:01:12Z","title":"Improving Synthetic Image Detection Towards Generalization: An Image Transformation Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06741","snapshot_observed_at":"2026-08-07T13:59:31.251492Z","title":"Improving synthetic image detection towards generalization: An image transformation perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.251492Z"},"links":{"cited_paper":"/paper/2408.06741","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:1cbd5dcd709f2e26181d370ea03ee2c5ffcd33d4781b8231edf5b49ba093a9cc","observation_id":"c8fa7d41-df9b-48aa-b5ff-6f05e963ecee","resolution":{"observed_at":"2026-08-07T13:59:31.251492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:31.325770Z","title":"Photomaker: Customizing realistic human photos via stacked id embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.325770Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:e301376c45cff8c1c0248e174cee49fb349630e809a2c4ff5bd52f94142a4249","observation_id":"a965af12-e251-4d03-a94f-103a3ec054b3","resolution":{"observed_at":"2026-08-07T13:59:31.325770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17459","last_updated":"2025-04-11T12:31:07Z","snapshot_observed_at":"2026-08-14T09:18:04.526275Z","submitted_at":"2024-11-26T14:23:53Z","title":"WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17459","snapshot_observed_at":"2026-08-07T13:59:31.446588Z","title":"Wf-vae: Enhancing video vae by wavelet-driven energy flow for latent video diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.446588Z"},"links":{"cited_paper":"/paper/2411.17459","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:27c8365846f74d7162eb6ff36200d077d853691ffa9e9c1a5cebee9edcb6cf28","observation_id":"f70ac60e-5534-4725-a8dd-f8827e1945cd","resolution":{"observed_at":"2026-08-07T13:59:31.446588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07802","last_updated":"2025-02-04T22:03:26Z","snapshot_observed_at":"2026-08-09T14:38:43.851921Z","submitted_at":"2025-02-04T22:03:26Z","title":"Movie Weaver: Tuning-Free Multi-Concept Video Personalization with Anchored Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07802","snapshot_observed_at":"2026-08-07T13:59:31.555321Z","title":"Movie weaver: Tuning-free multi-concept video personalization with anchored prompts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.555321Z"},"links":{"cited_paper":"/paper/2502.07802","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:dbcff679deb1309a632be39cd93665073b868dfa8a5174906328da6129f0163c","observation_id":"cd2fdf07-8d2a-4136-9e97-f530416fa399","resolution":{"observed_at":"2026-08-07T13:59:31.555321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-08-13T21:19:07.777045Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-07T13:59:31.643439Z","title":"Open-sora plan: Open-source large video generation model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.643439Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:c708903c0be88f0c073f29415ef6e348bd7d9541a55fd9e1b0caff5d071e3b90","observation_id":"afbf14cf-615b-453b-a715-eba9e447d2ff","resolution":{"observed_at":"2026-08-07T13:59:31.643439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:31.756572Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.756572Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:1eb895cc4369d21779f8f132786a753e1a1c56ed2e86d89789c4e12a55469e8f","observation_id":"646f6a09-7bce-4ea8-92fc-7faecb7daab8","resolution":{"observed_at":"2026-08-07T13:59:31.756572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:31.827870Z","title":"Stiv: Scalable text and image condi- tioned video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.827870Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:de57b2bb1f329778bd7cfe6021e33a3f957ff6e1e543116c49e646186f8afe38","observation_id":"35763072-1ad3-4e7f-b05d-d4b2202915bb","resolution":{"observed_at":"2026-08-07T13:59:31.827870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T13:59:31.890570Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.890570Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:c764bbb17475ee7c0c7e2c98f218dc511e658ed463499b0dafecd2d408b68e0e","observation_id":"af6623f3-3f69-48f3-a4b0-9ef802ea327f","resolution":{"observed_at":"2026-08-07T13:59:31.890570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06782","last_updated":"2025-02-12T10:07:07Z","snapshot_observed_at":"2026-08-14T20:48:09.219568Z","submitted_at":"2025-02-10T18:58:11Z","title":"Lumina-Video: Efficient and Flexible Video Generation with Multi-scale Next-DiT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06782","snapshot_observed_at":"2026-08-07T13:59:31.958999Z","title":"Lumina-video: Efficient and flexible video generation with multi-scale next-dit","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.958999Z"},"links":{"cited_paper":"/paper/2502.06782","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:89f9a74fc2a32985d158e3f99c917fc5371c66e1a63a080d6ec908976031c05d","observation_id":"0f02fd0d-b56c-4bce-8c2d-c8eaff2fd744","resolution":{"observed_at":"2026-08-07T13:59:31.958999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-16T12:58:02.352853Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-07T13:59:32.071589Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.071589Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:c581dc67848ac90defe7d821b338c0b79d4952079dde4d3468c7239418384297","observation_id":"8b4584ab-6c87-4bf6-a062-9600001f2d39","resolution":{"observed_at":"2026-08-07T13:59:32.071589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-07T13:59:32.143783Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.143783Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:5faf14768a6b62a47696380612485c1d2b5e270bc79ce81a5117e922e6d222f8","observation_id":"22e8865e-7ae2-4d68-8efe-989ccfa59e3b","resolution":{"observed_at":"2026-08-07T13:59:32.143783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:32.195883Z","title":"Evalcrafter: Benchmarking and evaluating large video generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.195883Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:edd82482cb52055bb91377904760db0322783d14c0742283c219ce39b6f375b9","observation_id":"13596194-ebe1-4953-8804-bda4c428597d","resolution":{"observed_at":"2026-08-07T13:59:32.195883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:32.278537Z","title":"Fetv: A benchmark for fine-grained evaluation of open-domain text-to-video genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.278537Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:603ed6187750021c30dcbb42a71261aadc64026069ec4af8edc53c23f69c2148","observation_id":"f69d7047-7c83-44c7-b1eb-3f415ea0b1a7","resolution":{"observed_at":"2026-08-07T13:59:32.278537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-07T13:59:32.327532Z","title":"Step-video-t2v technical report: The practice, challenges, and future of video foundation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.327532Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:04214063032782be3e2e40d5a23c2d8e24a626dfdc7a1cb73bb869eeeb65aa02","observation_id":"e992ba3e-adde-423e-a52a-b972d2a2508f","resolution":{"observed_at":"2026-08-07T13:59:32.327532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-13T10:28:06.516901Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-07T13:59:32.388980Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.388980Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:7706a8b5e5efa4be4188b8c2150b3aa1c2a4d6bbaf625bc70d865007d2dc093f","observation_id":"985742aa-2d65-40e4-9bbc-f7c3a5bba31b","resolution":{"observed_at":"2026-08-07T13:59:32.388980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03140","last_updated":"2025-07-26T15:25:22Z","snapshot_observed_at":"2026-08-16T12:44:04.893095Z","submitted_at":"2025-04-04T03:30:15Z","title":"Model Reveals What to Cache: Profiling-Based Feature Reuse for Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03140","snapshot_observed_at":"2026-08-07T13:59:32.433119Z","title":"Model reveals what to cache: Profiling-based feature reuse for video diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.433119Z"},"links":{"cited_paper":"/paper/2504.03140","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:736cba213a10b5cb81e70e964c3ff3db03e94744372213ec449363523b293bce","observation_id":"79dc3038-4365-4037-a938-17f2ca0da233","resolution":{"observed_at":"2026-08-07T13:59:32.433119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:32.518451Z","title":"Follow your pose: Pose-guided text-to-video generation using pose-free videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.518451Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:16f5860e2a883e98b457281dac76659cac934a94c6f0b4ab6d13a491fcb5919b","observation_id":"ddf5a28d-2ff5-4c6f-b57f-cd36ecb9604c","resolution":{"observed_at":"2026-08-07T13:59:32.518451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08268","last_updated":"2024-03-13T05:44:37Z","snapshot_observed_at":"2026-08-16T14:10:19.583849Z","submitted_at":"2024-03-13T05:44:37Z","title":"Follow-Your-Click: Open-domain Regional Image Animation via Short Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08268","snapshot_observed_at":"2026-08-07T13:59:32.625729Z","title":"Follow-your-click: Open-domain regional image animation via short prompts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.625729Z"},"links":{"cited_paper":"/paper/2403.08268","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:ccd37b562f0d72d7f4fd2eaddce3e0dc34f0d7b6e158e7d6f236eac94171c6e3","observation_id":"59b261e3-a9e1-42ac-98d1-9da35f05c4fe","resolution":{"observed_at":"2026-08-07T13:59:32.625729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01900","last_updated":"2024-06-07T02:57:36Z","snapshot_observed_at":"2026-08-16T13:46:29.556980Z","submitted_at":"2024-06-04T02:05:57Z","title":"Follow-Your-Emoji: Fine-Controllable and Expressive Freestyle Portrait Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01900","snapshot_observed_at":"2026-08-07T13:59:32.721019Z","title":"Follow-your-emoji: Fine-controllable and expressive freestyle portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.721019Z"},"links":{"cited_paper":"/paper/2406.01900","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:4401b35ff71f8279adc8565d21ebfc972f386761de1eacf58fe1a7853aca3d8e","observation_id":"085f1cfa-a5dc-4b84-9ce5-37a9cab5b220","resolution":{"observed_at":"2026-08-07T13:59:32.721019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09368","last_updated":"2024-03-20T17:36:35Z","snapshot_observed_at":"2026-08-16T14:18:33.619756Z","submitted_at":"2024-02-14T18:13:51Z","title":"Magic-Me: Identity-Specific Video Customized Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09368","snapshot_observed_at":"2026-08-07T13:59:32.790081Z","title":"Magic-me: Identity-specific video customized diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.790081Z"},"links":{"cited_paper":"/paper/2402.09368","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:40d9f8a5383a0998bf0f91d83f180eccc0094b61ca33088599b5da774bf1acab","observation_id":"c40ac82b-7a53-4239-94a5-0a2437246661","resolution":{"observed_at":"2026-08-07T13:59:32.790081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:32.885473Z","title":"Multi-task image classifier","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.885473Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:fd341615bf5b2bd51ada95b4df3074c6389708bbad9af084e8e4f9c6bbece8d3","observation_id":"ac1eba25-0a75-4758-af1e-bdaaab115766","resolution":{"observed_at":"2026-08-07T13:59:32.885473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-07T13:59:32.952192Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.952192Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:074986802716abe704a40f85d2ca32c832c2b468e881a048d9f540e01248bb86","observation_id":"37a1e504-5fc6-457a-8d8c-cc8d9be935db","resolution":{"observed_at":"2026-08-07T13:59:32.952192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:33.006913Z","title":"Nyuad ai generated images detector","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.006913Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:35689268841ead256c712a0e82ff80434bf8892b567c8ba010633091a78df4e0","observation_id":"0cedfbba-bee5-45cd-9865-a6bc31c75e8a","resolution":{"observed_at":"2026-08-07T13:59:33.006913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00397","last_updated":"2024-11-30T08:42:13Z","snapshot_observed_at":"2026-08-15T17:37:22.100750Z","submitted_at":"2024-11-30T08:42:13Z","title":"DreamDance: Animating Human Images by Enriching 3D Geometry Cues from 2D Poses","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00397","snapshot_observed_at":"2026-08-07T13:59:33.042872Z","title":"Dreamdance: Animating human images by enriching 3d geometry cues from 2d poses","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.042872Z"},"links":{"cited_paper":"/paper/2412.00397","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:20a016aeb4f3c5109dad4032240d3f40fab52017553d93b9d37a8585df23d1d5","observation_id":"1ff826d8-9563-40d7-af7f-753049c77cbf","resolution":{"observed_at":"2026-08-07T13:59:33.042872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09642","last_updated":"2026-03-02T11:31:23Z","snapshot_observed_at":"2026-08-14T22:40:32.716624Z","submitted_at":"2025-03-12T05:00:07Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09642","snapshot_observed_at":"2026-08-07T13:59:33.158196Z","title":"Open-sora 2.0: Training a commercial-level video generation model in 200 k","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.158196Z"},"links":{"cited_paper":"/paper/2503.09642","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:8316a9cf00e1d233af8574383065dec77f5c62d52c7be4562d7dcf4d6e4ed42f","observation_id":"9f51e9bb-64fb-4fe8-bbe2-17849e2b1c54","resolution":{"observed_at":"2026-08-07T13:59:33.158196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16855","last_updated":"2025-03-09T02:57:28Z","snapshot_observed_at":"2026-08-16T13:40:01.892679Z","submitted_at":"2024-06-24T17:58:47Z","title":"DreamBench++: A Human-Aligned Benchmark for Personalized Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16855","snapshot_observed_at":"2026-08-07T13:59:33.247451Z","title":"Dreambench++: A human-aligned benchmark for personalized image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.247451Z"},"links":{"cited_paper":"/paper/2406.16855","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:dcd3c158f9de1be084aacc33d73034e9b2959ab8bc579c85738e6f804d87dea4","observation_id":"629342a2-e5a4-4261-bff7-42711df93a9c","resolution":{"observed_at":"2026-08-07T13:59:33.247451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T13:59:33.328258Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.328258Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:54681c21182c08b070550f218b3fc73da3172870bf03fb77773b93f3762bb6a8","observation_id":"4ed2f581-5ca5-4541-af1a-e79b4c95c62f","resolution":{"observed_at":"2026-08-07T13:59:33.328258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:33.385897Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.385897Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:7407e8e95cf3c49251fcffac2e65e766e7c52aa990fecec3406a5ef017546b2f","observation_id":"39695eb0-95dd-43df-a774-b98b2a9a1723","resolution":{"observed_at":"2026-08-07T13:59:33.385897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T13:59:33.449820Z","title":"Hierarchical text-conditional image generation with clip latents, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.449820Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:e8e471c0acbf5ff5e89770f40fabfffbd498dedaef875dfc2fd44e9ccd21cfce","observation_id":"80e7fd13-6dc1-40d0-8d2f-1a716c9df315","resolution":{"observed_at":"2026-08-07T13:59:33.449820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:33.541902Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.541902Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:2eaf30dbfd1c9958b5cc3995079ce93ccf4c272dd368aa0bac5c65493a016d53","observation_id":"33f3b505-4ad7-4a06-b3fd-bcf031b21a24","resolution":{"observed_at":"2026-08-07T13:59:33.541902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T13:59:33.625427Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.625427Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:500c8ee832b49d0add5fb763edd47d243d8be1c2344570441e7eef9b4308aca9","observation_id":"1281ad9c-c073-4665-95da-e2ca2f3f52e2","resolution":{"observed_at":"2026-08-07T13:59:33.625427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:33.744844Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.744844Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:d60765742efb22e4d099e7c45bf022d70b3e98973b6e89da29c777ae10394324","observation_id":"fc7c93b7-3ee7-48ad-8d46-69a0dcb28789","resolution":{"observed_at":"2026-08-07T13:59:33.744844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:33.801156Z","title":"Magi-1: Autoregressive video generation at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.801156Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:18e014e40b7454fb7a8100a4dc1f2b12c35c6ef0362f067f01494fb997499636","observation_id":"a2501434-08d2-465e-b527-0a1c29caccfe","resolution":{"observed_at":"2026-08-07T13:59:33.801156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08685","last_updated":"2025-05-05T03:31:30Z","snapshot_observed_at":"2026-08-16T12:41:57.140222Z","submitted_at":"2025-04-11T16:46:20Z","title":"Seaweed-7B: Cost-Effective Training of Video Generation Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08685","snapshot_observed_at":"2026-08-07T13:59:33.869824Z","title":"Seaweed-7b: Cost-effective training of video generation foundation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.869824Z"},"links":{"cited_paper":"/paper/2504.08685","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:d774a16c6103a83f6f9cb6a70e9d9da71c76205c085a875bedeff1f9c8fb41dc","observation_id":"88a9b364-495f-4981-a93e-fb0067626203","resolution":{"observed_at":"2026-08-07T13:59:33.869824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:33.939322Z","title":"Dragdiffusion: Harnessing diffusion models for interactive point-based image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.939322Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:bc66e313f9243271a8141a4d4acbd8b8eba7b1ff537186072deb0d7ef2363766","observation_id":"a22d91a2-71e3-43d3-a74f-9fde8ace6b8c","resolution":{"observed_at":"2026-08-07T13:59:33.939322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-07T13:59:34.017512Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:34.017512Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:49e245781f2b4f3ce0d509d6450c0106e0f65d3b39ce6e90196ba5a2c2b5ac2e","observation_id":"c6fdb347-8410-49d7-a3f4-87eebfbe09c0","resolution":{"observed_at":"2026-08-07T13:59:34.017512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-16T21:21:44.768787Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-07T13:59:34.089977Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:34.089977Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:9743baf99c0ffb7f2f97179ec3e874a9732493dfd949c9cd758169651a1e5b43","observation_id":"d490f859-6ccc-4e52-afd1-bf1382323b92","resolution":{"observed_at":"2026-08-07T13:59:34.089977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10306","last_updated":"2024-12-11T02:55:31Z","snapshot_observed_at":"2026-08-16T13:50:49.325319Z","submitted_at":"2024-10-14T09:06:55Z","title":"Animate-X: Universal Character Image Animation with Enhanced Motion Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10306","snapshot_observed_at":"2026-08-07T13:59:34.211475Z","title":"Animate-x: Universal character image animation with enhanced motion representation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:34.211475Z"},"links":{"cited_paper":"/paper/2410.10306","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:ce2187a8b8dfaa840d61e36325a9532f0561e01b9e12e9a356804f7d539d7b3f","observation_id":"b35739bc-9d62-4f04-bc2a-0f1c5a8ea958","resolution":{"observed_at":"2026-08-07T13:59:34.211475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19548","last_updated":"2024-07-28T17:58:35Z","snapshot_observed_at":"2026-08-16T13:30:26.246825Z","submitted_at":"2024-07-28T17:58:35Z","title":"Cycle3D: High-quality and Consistent Image-to-3D Generation via Generation-Reconstruction Cycle","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19548","snapshot_observed_at":"2026-08-07T13:59:34.324476Z","title":"Cycle3d: High-quality and consistent image-to-3d generation via generation- reconstruction cycle","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:34.324476Z"},"links":{"cited_paper":"/paper/2407.19548","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:f05151c59a7c1ef704cd1ef4ed277c4f14186b3d3500488e6a232dee461ae866","observation_id":"cc4fa633-46fd-49cd-8158-098ff232e83d","resolution":{"observed_at":"2026-08-07T13:59:34.324476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T13:59:34.446500Z","title":"Gemma 3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:34.446500Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:71c0d90180221cff2d2c145eb251344b0e1c76ba69dce312b1bf2d6584ba7629","observation_id":"71052253-bbdd-4a14-ae89-66771b695258","resolution":{"observed_at":"2026-08-07T13:59:34.446500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:34.550294Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:34.550294Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:b3daafeaeefd6a7c4d8754484c975a14f8197f94daf13feb6f6eef50a3f06680","observation_id":"c79d273d-30ad-4186-bafe-ebb6ac539c9f","resolution":{"observed_at":"2026-08-07T13:59:34.550294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:34.646831Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:34.646831Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:1cea73fe2f9c431b2bc939ba01903b71bea56d4af824e315219ec4e67c3910c8","observation_id":"3e55a3bf-075d-4375-a7ec-717765318ab1","resolution":{"observed_at":"2026-08-07T13:59:34.646831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:34.766190Z","title":"Paddleocr","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:34.766190Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:5c5ddae55b4c8537b38862cea481b4426e14cfa64d67bc43cf571742f6da9402","observation_id":"6f59a7a3-5f8d-48b7-b9e1-e0984804100c","resolution":{"observed_at":"2026-08-07T13:59:34.766190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T13:59:34.883459Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:34.883459Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:8be7ab0e131034d8ff347ac8136764fe0b7f0c220981982527400eb6a987e1f4","observation_id":"fa802251-b8ba-4cdf-a54d-ce8af139e7e7","resolution":{"observed_at":"2026-08-07T13:59:34.883459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T13:59:34.953854Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:34.953854Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:13fd956f206922752a5d588a999a3d773836eceb84ace665c37d0fb2faa38e55","observation_id":"6e3c765a-189b-4dfd-b82d-eaca53f409bd","resolution":{"observed_at":"2026-08-07T13:59:34.953854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08260","last_updated":"2025-04-26T17:58:24Z","snapshot_observed_at":"2026-08-16T13:10:35.398679Z","submitted_at":"2024-10-10T17:57:49Z","title":"Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video Content","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08260","snapshot_observed_at":"2026-08-07T13:59:35.043662Z","title":"Koala-36m: A large-scale video dataset improving consistency between fine-grained conditions and video content","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.043662Z"},"links":{"cited_paper":"/paper/2410.08260","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:12e1ba5b4af55f9615a3f8b6a36af17d24ab7a51be5e88bcae63915713eae8d7","observation_id":"42a426d6-43e7-472f-a8c0-8647655e4834","resolution":{"observed_at":"2026-08-07T13:59:35.043662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07519","last_updated":"2024-02-02T16:15:22Z","snapshot_observed_at":"2026-08-16T06:18:35.139211Z","submitted_at":"2024-01-15T07:50:18Z","title":"InstantID: Zero-shot Identity-Preserving Generation in Seconds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07519","snapshot_observed_at":"2026-08-07T13:59:35.115504Z","title":"Instantid: Zero-shot identity-preserving generation in seconds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.115504Z"},"links":{"cited_paper":"/paper/2401.07519","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:9cc341ce2b2c627cbd204d47fa2d02a442e1554d52f5f8744d970d980edc533f","observation_id":"956c6d0d-814c-4d06-b946-94e4a5fb6d59","resolution":{"observed_at":"2026-08-07T13:59:35.115504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06098","last_updated":"2024-09-30T06:51:55Z","snapshot_observed_at":"2026-08-16T14:11:17.222966Z","submitted_at":"2024-03-10T05:40:12Z","title":"VidProM: A Million-scale Real Prompt-Gallery Dataset for Text-to-Video Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06098","snapshot_observed_at":"2026-08-07T13:59:35.179016Z","title":"Vidprom: A million-scale real prompt-gallery dataset for text-to- video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.179016Z"},"links":{"cited_paper":"/paper/2403.06098","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:71152ffee3260074794f9f539bd1b041b4c89bd03c96cf9da00d7a5ab0dd1c29","observation_id":"4fd5de33-cbb1-4744-9e07-f6a94bc67674","resolution":{"observed_at":"2026-08-07T13:59:35.179016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10874","last_updated":"2024-04-24T11:22:00Z","snapshot_observed_at":"2026-08-16T15:32:03.628880Z","submitted_at":"2023-05-18T11:06:15Z","title":"Swap Attention in Spatiotemporal Diffusions for Text-to-Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10874","snapshot_observed_at":"2026-08-07T13:59:35.266101Z","title":"Videofactory: Swap attention in spatiotemporal diffusions for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.266101Z"},"links":{"cited_paper":"/paper/2305.10874","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:587434bb517c283302b44fbb3e464ea9ef3fab79dafd19c6451adfe4c3d93d24","observation_id":"c5788791-343a-4a42-b610-91b72e515481","resolution":{"observed_at":"2026-08-07T13:59:35.266101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-07T13:59:35.298215Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.298215Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:59e8c3e520e2787a58270457f50530f84a2dbcdc22ff7b039968f102b7355107","observation_id":"8daffc84-86b1-4a83-8ec4-10a2186913ec","resolution":{"observed_at":"2026-08-07T13:59:35.298215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16211","last_updated":"2024-12-17T23:00:42Z","snapshot_observed_at":"2026-08-15T19:50:50.194585Z","submitted_at":"2024-12-17T23:00:42Z","title":"Is Your World Simulator a Good Story Presenter? A Consecutive Events-Based Benchmark for Future Long Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16211","snapshot_observed_at":"2026-08-07T13:59:35.359517Z","title":"Is your world simulator a good story presenter? a consecutive events-based benchmark for future long video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.359517Z"},"links":{"cited_paper":"/paper/2412.16211","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:375d8647d86e7dbbc381c222e3db636dc6c0ad7f18eb01e259a5bdadefeaed99","observation_id":"27bd54d9-7a9b-4961-a550-0366d6b1b154","resolution":{"observed_at":"2026-08-07T13:59:35.359517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13452","last_updated":"2025-02-27T06:55:41Z","snapshot_observed_at":"2026-08-15T20:10:32.692478Z","submitted_at":"2025-01-23T08:06:11Z","title":"EchoVideo: Identity-Preserving Human Video Generation by Multimodal Feature Fusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13452","snapshot_observed_at":"2026-08-07T13:59:35.395109Z","title":"Echovideo: Identity-preserving human video generation by multimodal feature fusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.395109Z"},"links":{"cited_paper":"/paper/2501.13452","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:5abd3fedb9a0271cc5753cc05064e547e4c85f25e42a6fb8c7867b8bf6cffa5d","observation_id":"2e7d5a2d-e248-40f9-abe4-65937c05c91b","resolution":{"observed_at":"2026-08-07T13:59:35.395109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:35.430457Z","title":"Dreamvideo: Composing your dream videos with customized subject and motion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.430457Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:a01b87fc5d46bcd1d8ca972f77f525793a4bb668cff1fe4c14bdcd9ac89cc50f","observation_id":"7119b8e0-fdfa-4aae-aab3-d8766f96a204","resolution":{"observed_at":"2026-08-07T13:59:35.430457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:35.489028Z","title":"Exploring video quality assessment on user generated contents from aesthetic and technical perspectives","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.489028Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:a13ce6ec1f43de1a40e7c50bda22014667c70a157d8a30836bd0a90b0d51c507","observation_id":"e1b967fb-9f0c-44cd-b544-e8908a293dc7","resolution":{"observed_at":"2026-08-07T13:59:35.489028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07781","last_updated":"2024-01-15T15:42:39Z","snapshot_observed_at":"2026-08-16T14:27:25.161652Z","submitted_at":"2024-01-15T15:42:39Z","title":"Towards A Better Metric for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07781","snapshot_observed_at":"2026-08-07T13:59:35.615058Z","title":"Towards a better metric for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.615058Z"},"links":{"cited_paper":"/paper/2401.07781","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:eb73b190263a5e9b1b8ca6ee8550838147441e756029563233947cc95ec9cd6c","observation_id":"c48c9115-7c42-4700-92cb-3b8a15840695","resolution":{"observed_at":"2026-08-07T13:59:35.615058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17758","last_updated":"2024-10-29T11:56:27Z","snapshot_observed_at":"2026-08-16T13:50:54.724883Z","submitted_at":"2024-06-25T17:42:25Z","title":"MotionBooth: Motion-Aware Customized Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17758","snapshot_observed_at":"2026-08-07T13:59:35.677086Z","title":"Motionbooth: Motion-aware customized text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.677086Z"},"links":{"cited_paper":"/paper/2406.17758","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:0bd144f956f70a39a9a59047fc2d34498f43ad65125a01466adb600abe4e70a2","observation_id":"0b5ae721-ba87-40ff-bab8-71e9c71c1738","resolution":{"observed_at":"2026-08-07T13:59:35.677086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T22:17:57.799591Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":99,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":130},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 100 of 130 outbound references and 22 inbound Pith citation observations for arXiv:2505.20292."}