{"as_of":"2026-08-10T01:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:30dc1957d9dadf0d7056eaa2411bb8f2034e059f738721e832d37dfe3c6ab440","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:09:02.074963Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:45:17.010883Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:53:15.680626Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19901","snapshot_observed_at":"2026-08-05T17:45:17.010883Z","title":"Dynamic-i2v: Exploring image-to-video generaion models via multimodal llm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:17.010883Z"},"links":{"cited_paper":"/paper/2505.19901","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:28ee34e88aac4b1cb5d29cc327e0ea87836e0b6e84bf40ca6d0e9233fdf0a83a","observation_id":"e30efa21-81b8-40a6-877a-7caca3d92cd3","resolution":{"observed_at":"2026-08-05T17:45:17.010883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2505.19901","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19901","snapshot_observed_at":"2026-06-29T08:53:15.680626Z","title":"Dynamic-i2v: Exploring image-to-video generation models via multimodal llm","venue":null,"work_id":"9266cd54-9756-4fb8-b591-0f27847b0656","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2505.19901","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:7782335e0e368d341c376d7772ad7f4add7973b89a46423d2b3921215cd20519","observation_id":"e67b3fd2-7807-4c03-8bda-11054505215b","resolution":{"observed_at":"2026-05-20T15:08:25.017943Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2505.19901","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19901","snapshot_observed_at":"2026-06-29T08:53:15.680626Z","title":"Dynamic-i2v: Exploring image-to-video generation models via multimodal llm","venue":null,"work_id":"9266cd54-9756-4fb8-b591-0f27847b0656","year":2025},"citing_paper":{"arxiv_id":"2605.29655","last_updated":"2026-07-07T02:54:21Z","snapshot_observed_at":"2026-07-12T15:43:46.526865Z","submitted_at":"2026-05-28T09:17:11Z","title":"SuperVoxelGPT: Adaptive and Ordered 3D Tokenization for Autoregressive Shape Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T08:52:09.461853Z"},"links":{"cited_paper":"/paper/2505.19901","citing_paper":"/paper/2605.29655"},"observation_digest":"sha256:9f1094e6065969a183c7eb0c474aa6698dc61b96d124e1351b5e03803d6beeb6","observation_id":"080444ab-0976-4f05-9c09-eaea31c4d8c4","resolution":{"observed_at":"2026-06-29T08:53:15.681935Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19901","snapshot_observed_at":"2026-08-02T09:52:01.777787Z","title":"Dynamic-i2v: Exploring image- to-video generation models via multimodal llm,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22655","last_updated":"2026-06-26T17:29:32Z","snapshot_observed_at":"2026-08-07T03:00:52.298676Z","submitted_at":"2026-06-26T17:29:32Z","title":"EventOD: Event-Aware OD Flow Generation via LLM-Guided Semantic Modulation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T09:52:01.777787Z"},"links":{"cited_paper":"/paper/2505.19901","citing_paper":"/paper/2607.22655"},"observation_digest":"sha256:97ca5fd9030d0a8436822ef1315b37f196bbb03de8322be5fd726d9ddecf9488","observation_id":"e4f19425-5f3b-4bda-94f3-5cf54547d0c4","resolution":{"observed_at":"2026-08-02T09:52:01.777787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19901/citation-record","integrity":"/paper/2505.19901/integrity","json":"/paper/2505.19901/citation-record.json","paper":"/paper/2505.19901"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T14:08:21.686085Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:21.686085Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:6771b27a75d8bb84bd77926f0c15ba5b664c6aee59ae6d76ede24693c98d8370","observation_id":"72aa2235-ed7d-4a1e-b956-d344de8f3c81","resolution":{"observed_at":"2026-08-07T14:08:21.686085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:12.477003Z","title":"Frozen in time: A joint video and image encoder for end-to- end retrieval","venue":null,"work_id":"ec75d08f-1fae-4433-9211-ed5b7e9685eb","year":2021},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:21.760629Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:4ad8366c037d24caae6690d335a14f53379bff66e700af38b02009c04f26b4a4","observation_id":"8ad673e4-4a94-4317-9f21-cd09aa1de307","resolution":{"observed_at":"2026-08-07T14:09:12.544623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:21.883855Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:21.883855Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:5e5727d9899cb5c81ad7ab750062b9ce17dc2647acaf30472b546d33b4ec2feb","observation_id":"5625801f-3387-4d65-abba-e3727c721a87","resolution":{"observed_at":"2026-08-07T14:08:21.883855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:12.117868Z","title":null,"venue":null,"work_id":"8d5518cd-6eaa-4aaa-b56d-06e3f1e9132b","year":2020},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:21.967524Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:fb5b4cd497a685060a1f4e0d8d041fd34da3df4136eda77c0141afd86840dfc2","observation_id":"83c440f4-422f-42d8-8c32-4838e8fda54f","resolution":{"observed_at":"2026-08-07T14:09:12.320714Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:11.877614Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":"e0b9af52-5dd8-45a2-9955-30afa216ea10","year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:22.067285Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:556bf49bc07be8ac4a0daad944ee340b5a83fc607ce403e64e0d9cba3e749b37","observation_id":"dcc775db-a1f0-4b45-ac3d-874a0371499f","resolution":{"observed_at":"2026-08-07T14:09:11.983452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:11.636380Z","title":"Seine: Short-to-long video diffusion model for generative transition and prediction, 2023","venue":null,"work_id":"c2743059-0a31-401d-ba8a-ae07736c8f0f","year":2023},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:22.145040Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:5dc4475f57f4ba126984e25ef9488ddc7fb65cb7f9f3deea3bafd989ab385338","observation_id":"1d864c9a-0500-4747-9984-74679bbc0d47","resolution":{"observed_at":"2026-08-07T14:09:11.686020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:22.230147Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:22.230147Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:4e272e416165558fd9987a1ca9d6f8c1b43bf4255e4898464f3d5dd4d14d0b5d","observation_id":"4e6ab43e-a61d-4b1b-9c5e-3edd53e09905","resolution":{"observed_at":"2026-08-07T14:08:22.230147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:11.354137Z","title":"Glm: General language model pretraining with autoregressive blank infilling, 2022","venue":null,"work_id":"0ed9f7f0-3ef8-4ed1-a93f-6870d3da9e5c","year":2022},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:22.332373Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:ac0c9774974028b461f72329986a4b31580bbd200426d44249a6d9bf30ddb5a7","observation_id":"0576af17-93b7-454c-953d-79fa927e7b7a","resolution":{"observed_at":"2026-08-07T14:09:11.482059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:11.182381Z","title":"Guiding instruction-based image editing via multimodal large language models, 2024","venue":null,"work_id":"d0a176e9-a878-495c-979b-74fac65588e7","year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:22.450490Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:dd95e094d8e6dd9c6cb7d2c2786178d43782d6ffd299367bb1992e9e0ed5fa3e","observation_id":"f74e934f-cd88-4374-9ec0-3a4106fdb662","resolution":{"observed_at":"2026-08-07T14:09:11.246322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:10.997916Z","title":"Seed-x: Multi- modal models with unified multi-granularity comprehension and generation, 2025","venue":null,"work_id":"26da4c9e-e0e9-4a7f-b053-5dfc6b294c14","year":2025},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:22.553800Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:bf8419c57af1bd6e93f5d6b1047a1a4b8825a780abaf559993359918101ee50a","observation_id":"ec9e167b-c6ef-45e7-8b56-bd58cd3585f3","resolution":{"observed_at":"2026-08-07T14:09:11.085598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:22.632062Z","title":"Denoising diffu- sion probabilistic models, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:22.632062Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:2910bd315090fbf19d6debd58308b6000448451a1ed3e064a190c6c5f3acd34e","observation_id":"cfa1c5df-408b-4b15-a2ef-dff08987f7bd","resolution":{"observed_at":"2026-08-07T14:08:22.632062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:10.731879Z","title":"Smartedit: Exploring complex instruction-based image editing with multimodal large language models, 2023","venue":null,"work_id":"418f3ab2-1fae-4bdb-9819-1a0a120c7dbd","year":2023},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:22.749027Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:aac2f4870dba4f44370d64fabbdcfa3ad769161e934ef1d66e1ee4562d45ef10","observation_id":"0e3d4581-83d7-41de-835c-79bcdd1d5839","resolution":{"observed_at":"2026-08-07T14:09:10.804747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:10.486233Z","title":"Smartedit: Exploring complex instruction-based image editing with multimodal large lan- guage models","venue":null,"work_id":"72afb058-1550-4693-9015-6b9c5bc302ca","year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:22.809997Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:7bdb852e0e929616a3a13a4973bf3373ca426a2ae0f1ef531150f6f15d8bdd11","observation_id":"d4496099-00c6-4eea-bced-54d3b2ae21e0","resolution":{"observed_at":"2026-08-07T14:09:10.604479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:10.263479Z","title":"VBench: Com- prehensive benchmark suite for video generative models","venue":null,"work_id":"32d539d8-89fc-46ef-9c25-dc5a845e2a07","year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:22.880124Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:68b177fb6f9d5b299b75c63888817fa3db328deb44f2703cb22ee44e477dad7c","observation_id":"fc616fa2-5fd4-437c-a51d-1e71083f5844","resolution":{"observed_at":"2026-08-07T14:09:10.369470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:10.017924Z","title":"Vbench++: Comprehensive and versatile benchmark suite for video generative models, 2024","venue":null,"work_id":"d7158dec-07ac-4b54-8664-b295fab8f5b2","year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:22.987071Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:4526568f1379e39d375b413b421f4828e0847e82759bd465b04abf48db1463f1","observation_id":"3cf50900-c011-46d9-99cb-c6d648a3569a","resolution":{"observed_at":"2026-08-07T14:09:10.148639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:09.763576Z","title":"T2vbench: Benchmarking temporal dynamics for text-to- video generation","venue":null,"work_id":"71518448-7ece-4f18-82bc-907cef1b6d10","year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:23.122120Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:432678ada9df410fd78c96decc7a36df049d12851aebf461824ec27543b9836e","observation_id":"b6cd7b14-1bcf-45bd-b352-c42ba2864528","resolution":{"observed_at":"2026-08-07T14:09:09.840250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:09.618225Z","title":"Miradata: A large-scale video dataset with long durations and structured captions, 2024","venue":null,"work_id":"781314bd-8aac-41ef-867c-43d52d00e01b","year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:23.220189Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:dacbeee21e2eaa8c86c7f2366d2262ff5294e5fad4af912ad1995bd9e1875f96","observation_id":"1ed9d684-8fa4-4a97-ade1-cc1f88d81b87","resolution":{"observed_at":"2026-08-07T14:09:09.663855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:09.472552Z","title":"Co- tracker: It is better to track together, 2024","venue":null,"work_id":"42a8be62-20d9-4670-998b-1e8dde6784c8","year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:23.310192Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:b175f5f61dfe0cd8768a61aae6da23a2070c83bd731661c8f8a6b54a18f439a7","observation_id":"aa339d00-f0ab-4f39-a214-1bc1aa13278b","resolution":{"observed_at":"2026-08-07T14:09:09.528308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:09.302007Z","title":"Hunyuanvideo: A systematic framework for large video generative models, 2025","venue":null,"work_id":"51c783c2-8a80-47ec-bd06-efe313204dfd","year":2025},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:59.387247Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:33afc891f8e16fd26600dcb37c4af9bd2f6f719d98cfc2abdb1c4ab25a62e759","observation_id":"6492a1b0-062b-4f98-bf61-4d9ca71a7a3a","resolution":{"observed_at":"2026-08-07T14:09:09.378606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:09.005352Z","title":"Animateanything: Consistent and control- lable animation for video generation, 2024","venue":null,"work_id":"c8eddd01-5ecc-442d-94e5-8faee27a58ab","year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:59.484759Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:e446c98b457406f2ceadf44b3af51b4243d72d9d9ddeb9f388ef0bb80aae32ac","observation_id":"f02c080d-1631-4442-978d-a4ceffc245af","resolution":{"observed_at":"2026-08-07T14:09:09.146564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01094","last_updated":"2024-07-01T08:51:22Z","snapshot_observed_at":"2026-07-06T18:39:24.513351Z","submitted_at":"2024-07-01T08:51:22Z","title":"Evaluation of Text-to-Video Generation Models: A Dynamics Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01094","snapshot_observed_at":"2026-08-07T14:08:59.645506Z","title":"Evaluation of text-to-video generation models: A dynamics perspective.arXiv preprint arXiv:2407.01094,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:59.645506Z"},"links":{"cited_paper":"/paper/2407.01094","citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:bdb3d59b03a7d158a96128a28bd518da56aba3507bf41320787336793fdd45ab","observation_id":"9894e930-f8e9-4f01-a7a3-45612583e2a6","resolution":{"observed_at":"2026-08-07T14:08:59.645506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:08.594884Z","title":"Video-llava: Learning united visual representa- tion by alignment before projection, 2024","venue":null,"work_id":"21f06302-5d60-4546-9d65-828b8b0e3d5f","year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:59.767550Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:d5adeaafbb8fd332157a307e9ae6786b1f192c2da9f11a4bcbd216ee478b0459","observation_id":"118e7302-b84f-4d47-a6c4-71f943984499","resolution":{"observed_at":"2026-08-07T14:09:08.794907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:08.147655Z","title":"Stiv: Scalable text and image conditioned video generation, 2024","venue":null,"work_id":"1f94b447-a8ce-4ec3-9ce7-1e83a84ac061","year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:59.834819Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:567033d3ede9ab913de90ce630ecbf61d4c64ea07cf2b7a3e2d7efcb06bbef43","observation_id":"68ec7cf1-dcec-4e83-89dd-d13b1165fbdd","resolution":{"observed_at":"2026-08-07T14:09:08.292123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:07.933861Z","title":"Evalcrafter: Benchmarking and evalu- ating large video generation models","venue":null,"work_id":"06442943-0365-4cd1-a5da-5d52248a70b8","year":2023},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:08:59.955072Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:5384c273679d26661083532c8df36e749d63361f721ee34316ca1c423a539bae","observation_id":"7c4adeb1-41e7-413a-92d7-7852e8ce260b","resolution":{"observed_at":"2026-08-07T14:09:08.006335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:07.610863Z","title":"Qwen2vl-flux: Unifying image and text guidance for controllable image generation, 2024","venue":null,"work_id":"945994da-0304-4fd3-a7c0-49c10e2f41b7","year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:00.095203Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:63b04e29953830e3203dbb451e869167dccb26c8742cb91ccdc0c2d9929c35c3","observation_id":"7bbe86ff-38a8-40e1-b972-e31d7e7a6155","resolution":{"observed_at":"2026-08-07T14:09:07.764847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:07.321412Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to- video generation, 2024","venue":null,"work_id":"73f82e31-b1d2-42fc-9a35-9a6bfa2af5fe","year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:00.210997Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:8a8b8a90376d7735f16d4d7aae37f6a195b973c4205159610ccc2c7f08df9848","observation_id":"1806a057-43f3-4377-9110-5ac706fe34dd","resolution":{"observed_at":"2026-08-07T14:09:07.464961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-08-07T14:09:00.316876Z","title":"Kosmos-G: Generating images in context with multimodal large language models.ArXiv, abs/2310.02992, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:00.316876Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:d930fdb8eeef200cd0fb5ad26c1aa3837b772367000fb9fd9a66604335e251f8","observation_id":"996c4bfb-196b-4917-96b6-78e9ee86cc08","resolution":{"observed_at":"2026-08-07T14:09:00.316876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:00.442187Z","title":"Kosmos-g: Generating images in context with multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:00.442187Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:c6ba33508adbad5d9f740b69d51fdb9275a5273b5b4fdcbbd51fb2ec0310f662","observation_id":"39c33e2c-7768-43f3-9af6-eb5146e9763d","resolution":{"observed_at":"2026-08-07T14:09:00.442187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:06.887756Z","title":"Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Askell Amanda, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever","venue":null,"work_id":"304d89c0-203b-431d-800f-4b7fc8a85f2a","year":2021},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:00.714761Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:22b1c839bbbbfae926fbad3dd35af1ec0438c8fac4d3edce6374cb083019b5c2","observation_id":"d56617e2-834d-40d7-a800-f12d40feb9f5","resolution":{"observed_at":"2026-08-07T14:09:07.004397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:06.640569Z","title":null,"venue":null,"work_id":"17b2d752-0cdc-41d4-a5d7-3ef1d0c37a54","year":2019},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:00.874887Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:459fd658e750f66f4f245ef653b4947df6ddef417e2bfe299837105bddb4fffa","observation_id":"00f5ed96-84e4-4fe4-b58a-e6aff330096b","resolution":{"observed_at":"2026-08-07T14:09:06.740500Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10867","last_updated":"2025-03-19T18:53:09Z","snapshot_observed_at":"2026-08-02T22:09:23.477801Z","submitted_at":"2024-11-16T19:23:12Z","title":"ViBe: A Text-to-Video Benchmark for Evaluating Hallucination in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10867","snapshot_observed_at":"2026-08-07T14:09:00.950330Z","title":"Vibe: A text-to-video benchmark for evaluat- ing hallucination in large multimodal models.arXiv preprint arXiv:2411.10867, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:00.950330Z"},"links":{"cited_paper":"/paper/2411.10867","citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:d662291a6774ad23f37e8ebf2adf165c7c1381b92e99af9196d421ed362192aa","observation_id":"bfe830b5-088e-4fdb-91af-422c53f1b5e6","resolution":{"observed_at":"2026-08-07T14:09:00.950330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:06.347077Z","title":"Consisti2v: Enhancing visual consistency for image-to-video generation, 2024","venue":null,"work_id":"ddcd263a-46a4-40af-a3d9-4abe8956bc88","year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:01.030751Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:5f1dd382deea61f2b6fd5029387c577302141855ce140a0aec4c130f2ff75c1d","observation_id":"1f3e9a63-1144-4afd-9dd2-759a833fec09","resolution":{"observed_at":"2026-08-07T14:09:06.454768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:06.083045Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation,","venue":null,"work_id":"928b57ee-8bfc-4409-aa3f-ed049e340917","year":null},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:01.084975Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:e190fd38fc827cdef6219f5bf09115ede0b82d2aec0add865e4b7b0c328c1562","observation_id":"1a46b82e-7a5d-458e-a224-fada33098c07","resolution":{"observed_at":"2026-08-07T14:09:06.184742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:05.835876Z","title":"Generative multi- modal models are in-context learners, 2024","venue":null,"work_id":"7a15da92-7471-4a8f-8cf9-0928c1b1a7f3","year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:01.215729Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:0c6a4c19725565eb78bdd2c134c92c1ea9db0648c2b3e6776474e8aba41e93bf","observation_id":"de6b89a0-6ec9-46a8-9d6e-1f89c5f7747a","resolution":{"observed_at":"2026-08-07T14:09:05.961472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:05.586069Z","title":"Mimir: Improving video diffusion models for precise text understanding, 2024","venue":null,"work_id":"ce87378b-bd78-4d92-aba7-10a2129e8237","year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:01.319520Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:f6fcb842f8d496e7e43f9df56610d4848192185416450c819e33bef5c9ead838","observation_id":"6ea87874-43f1-4d34-a47b-ecc0262efe57","resolution":{"observed_at":"2026-08-07T14:09:05.690139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:05.035653Z","title":"Mige: A unified framework for multimodal instruction-based image generation and editing,","venue":null,"work_id":"5b8a3ab5-aa3d-406e-9d62-92fc88dee12d","year":null},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:01.393704Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:0d0db2690b1f3f8e7de540d09c864aae7cc0b9ac0d6837cf016178057f4c8e43","observation_id":"45f36936-4ee2-4d7f-8ce8-6f79c40c8365","resolution":{"observed_at":"2026-08-07T14:09:05.199254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:04.724822Z","title":"Llama: Open and efficient foundation language mod- els, 2023","venue":null,"work_id":"e43b6721-57df-4ed9-8be2-acab4457e9a8","year":2023},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:01.489642Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:abcbbabaea781ed5b6db334cc4bcf71fae2c2f0108c6126d7cf6ef6fc5299a76","observation_id":"730d09a2-221d-4bc3-8125-82d5864d176a","resolution":{"observed_at":"2026-08-07T14:09:04.835253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:01.600084Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:01.600084Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:92d3799b136fbebc4bfc352af74084cea1d86584dd13b786dc74ba4f835d4402","observation_id":"a6edc8cb-6c1f-44b8-8a93-bc17d5bf146f","resolution":{"observed_at":"2026-08-07T14:09:01.600084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:04.294754Z","title":"Koala-36m: A large-scale video dataset improving consistency between fine-grained conditions and video content, 2024","venue":null,"work_id":"3fc70257-3b95-4953-b843-83b713001a04","year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:01.702109Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:5c45ee437289b49c7c7e85cd3831a9fb1eac4e181194a0cb2a8038ce4a05f440","observation_id":"a0b20784-0f36-48a6-addc-bdc49c96f5f1","resolution":{"observed_at":"2026-08-07T14:09:04.464912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:01.795413Z","title":"Cogvlm: Visual expert for pretrained language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:01.795413Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:44fce8e6798b527ff23a11561a9ddcff1e54df4b5a352f12568d49db5ad90713","observation_id":"64ec8ce9-8681-4706-b58a-95507a8155e6","resolution":{"observed_at":"2026-08-07T14:09:01.795413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:03.854763Z","title":"Dynamicrafter: Animating open-domain im- ages with video diffusion priors, 2023","venue":null,"work_id":"affa4c92-b72a-432d-aae0-900b01d4d561","year":2023},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:01.859480Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:fc7ebc5d5ca160225208e42cf1a4a880e4ff89efd95b50abc4762fd56d15f399","observation_id":"eaa55a40-d8c5-4b28-8f62-263b46c10119","resolution":{"observed_at":"2026-08-07T14:09:04.015122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:03.445458Z","title":"Easyanimate: A high-performance long video generation method based on transformer architecture, 2024","venue":null,"work_id":"124ef884-d111-4511-ad53-2003dc25e57f","year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:01.928371Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:f968a6068163c078e0c60692fdd5c9602e9865b55d65881b2fd178b8d547e156","observation_id":"c963fe9e-be22-4ef9-84d6-98c511a2faff","resolution":{"observed_at":"2026-08-07T14:09:03.655071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T14:09:01.994943Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:01.994943Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:909c5afc7aea7d6256962f8f36bb1f881a8cba1b1dc67849db4c04c7964a4a42","observation_id":"21470ee1-bf72-496c-b900-b03e1445f430","resolution":{"observed_at":"2026-08-07T14:09:01.994943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:03.244866Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models, 2023","venue":null,"work_id":"94561cf7-7df6-4388-9f15-35e559c328bb","year":2023},"citing_paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:02.074963Z"},"links":{"citing_paper":"/paper/2505.19901"},"observation_digest":"sha256:181e527802e6c15ed1eb664e508360c4e99412dfa3c69bfcfdafdd7ef4d2eba1","observation_id":"0ee7e785-f87e-4cd5-b017-4364e2d1485d","resolution":{"observed_at":"2026-08-07T14:09:03.305165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19901","last_updated":"2025-06-03T07:32:50Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:01:44.324106Z","submitted_at":"2025-05-26T12:29:34Z","title":"Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 4 inbound Pith citation observations for arXiv:2505.19901."}