{"as_of":"2026-08-09T15:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:69a2e253813d068faa5f365fa1781a5711ccc2638d60b565d45fd890ed112fd1","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:01:02.423170Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.22980/citation-record","integrity":"/paper/2505.22980/integrity","json":"/paper/2505.22980/citation-record.json","paper":"/paper/2505.22980"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:00:56.424420Z","title":"GPT-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:56.424420Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:7b3b197a3dc12c03d911fefe34699ece6288c52280ecbe5bb2881382fc1b4ed2","observation_id":"6c51cfaf-ecdf-40d7-ad8c-681e9defe6fb","resolution":{"observed_at":"2026-08-07T13:00:56.424420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:11.006844Z","title":"Frozen in time: A joint video and im- age encoder for end-to-end retrieval","venue":null,"work_id":"b8d5b3f0-ed30-4e57-8098-b27ec4fca872","year":2021},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:56.521401Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:c4027d4ff0e477a2168a60555cc1048d45d076e53f25505a514c847a09fffd76","observation_id":"1d82a762-a827-434e-bece-cc68cfb7d6f8","resolution":{"observed_at":"2026-08-07T13:01:11.203309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12945","last_updated":"2024-02-05T16:36:30Z","snapshot_observed_at":"2026-08-08T15:14:24.281572Z","submitted_at":"2024-01-23T18:05:25Z","title":"Lumiere: A Space-Time Diffusion Model for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12945","snapshot_observed_at":"2026-08-07T13:00:56.611108Z","title":"Lumiere: A space-time diffusion model for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:56.611108Z"},"links":{"cited_paper":"/paper/2401.12945","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:1848c0a403875f83746d682926b2fb9b7fbbbd346e325750e16dae0ff5048885","observation_id":"be240a50-c82f-4585-9e23-60e5a9698fa5","resolution":{"observed_at":"2026-08-07T13:00:56.611108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:10.676342Z","title":"Multidiffusion: Fusing diffusion paths for con- trolled image generation","venue":null,"work_id":"51d495b1-7ac8-46bd-90a8-b464f6587aeb","year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:56.724522Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:26d2d79bec8bd0ccd9a73fb9d86aba49fdb65c880cd3ca0aabea7785d5990771","observation_id":"43d0e7af-36c5-4746-99e5-dd6195be5d4a","resolution":{"observed_at":"2026-08-07T13:01:10.845129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T13:00:56.872776Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:56.872776Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:646db918c99d54897443e6fb15225b80234f254745a380ae080aa87aa9b3da5a","observation_id":"842663ce-81b1-4b8c-8aa1-fa07edf8a6ab","resolution":{"observed_at":"2026-08-07T13:00:56.872776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:10.340079Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":"ba066d9d-813b-438a-a702-32019bcad08d","year":null},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:56.970597Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:587b989242c714b71142ea91157289349222815fb6633a1a93cec8c710e41a86","observation_id":"36d37ad9-256f-4803-b3a0-9f2618fed3e0","resolution":{"observed_at":"2026-08-07T13:01:10.495466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00990","last_updated":"2025-04-14T02:18:19Z","snapshot_observed_at":"2026-07-06T16:42:00.138744Z","submitted_at":"2023-11-02T04:38:50Z","title":"VideoDreamer: Customized Multi-Subject Text-to-Video Generation with Disen-Mix Finetuning on Language-Video Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00990","snapshot_observed_at":"2026-08-07T13:00:57.039138Z","title":"Videodreamer: Customized multi-subject text-to- video generation with disen-mix finetuning.arXiv preprint arXiv:2311.00990, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.039138Z"},"links":{"cited_paper":"/paper/2311.00990","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:1316934025d78959de8d85ababb08220bf9b3f9df0c8f9534a6a68627d85088a","observation_id":"a7ccfdea-b328-485b-9aa7-2f6d59470f66","resolution":{"observed_at":"2026-08-07T13:00:57.039138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:09.973629Z","title":"Videocrafter2: Overcoming data limitations for high- quality video diffusion models","venue":null,"work_id":"b86c1ecb-7015-4303-b4e1-88212dbc4be5","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.143508Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:49b770b8ca7b77e36e411ebf44677f8a14ca8cfb37f76d406128e63169fe30a1","observation_id":"9b6071c2-fd71-4667-990e-1f617c379fd0","resolution":{"observed_at":"2026-08-07T13:01:10.125256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:09.687403Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":"36fedcc1-d19a-4e01-a74b-133900ac1a20","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.188341Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:a79f4d910a14b3ec466701baf47c3437f7daef6d9a042fcef6a2cbeb714b90b9","observation_id":"b335be6a-f2fe-4445-abf3-c8838c6ffc80","resolution":{"observed_at":"2026-08-07T13:01:09.819009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:57.269517Z","title":"Sora as an agi world model? a complete survey on text-to-video generation.arXiv preprint arXiv:2403.05131, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.269517Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:d04fc37231809ba2c37783e1f3b13e671b195cdfa8d6ad722915b1c690490fc6","observation_id":"86692de2-767f-4608-8f4a-42cd3c20b68f","resolution":{"observed_at":"2026-08-07T13:00:57.269517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:09.380686Z","title":"Data-Juicer Sandbox: A Comprehensive Suite for Multimodal Data-Model Co-development","venue":null,"work_id":"eb3031fc-95b9-492b-b0db-ea5f426b26ef","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.433196Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:7a4d7d3da3454ecc2e6c2edf6297781a9cbb8d166fbe2533beaa10d5fd85e9bb","observation_id":"9ccaa405-75ef-4749-abaa-783b7ae51a71","resolution":{"observed_at":"2026-08-07T13:01:09.551068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:08.982181Z","title":"DiffSynth-Studio: Enjoy the magic of Diffusion models!https://github.com/ modelscope/DiffSynth-Studio, 2024","venue":null,"work_id":"4cc0c532-c129-419b-8b52-599d1c9f684a","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.582602Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:33955ac7dbf91f5c97ab5fefffce962977d1c7b6d6766e13f407d4e72f8b3949","observation_id":"9b25e274-37d8-4f14-9df1-b3ea4c4abc93","resolution":{"observed_at":"2026-08-07T13:01:09.166354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:08.709492Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning.International Conference on Learn- ing Representations, 2024","venue":null,"work_id":"8ce1a6e9-b814-48fa-8f93-78cdea3e4bfd","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.717505Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:ce53a4e8d8256ad9ea833c07fec15c6b51ea294c03c2d3940e69a3b7a23fd721","observation_id":"3935d16d-c838-4c6e-a3c0-37efa2f38078","resolution":{"observed_at":"2026-08-07T13:01:08.832656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-07T13:00:57.842598Z","title":"Latent video diffusion models for high-fidelity video generation with arbitrary lengths","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.842598Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:ab9b42a62f26f105b3efeeaa0a9c72c10ce37cdca8de34cdf81f9f07a0a7468d","observation_id":"37fc4c8d-8a6f-458c-a9a0-ec81da22db58","resolution":{"observed_at":"2026-08-07T13:00:57.842598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:08.341019Z","title":"CLIPScore: a reference- free evaluation metric for image captioning","venue":null,"work_id":"41f64cd4-e485-4dc9-93ac-7e6bb0509588","year":2021},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.985309Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:4823bd62942a243fa9c67dd5d06ae4718ede129c76be3c8916b6d6d384e1aeee","observation_id":"6f32561d-1157-4416-8631-f864ad6099ec","resolution":{"observed_at":"2026-08-07T13:01:08.484965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-07T13:00:58.093105Z","title":"Examples of failure cases are shown: (a) Overlapping bounding boxes may lead to anomalies","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.093105Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:54a33597cede4c572407896065bdbbcf62b68e0a5354728a6c7a1d4962425d5b","observation_id":"d1933484-4e79-4734-841f-0027a4878843","resolution":{"observed_at":"2026-08-07T13:00:58.093105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:58.197779Z","title":"Denois- ing diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.197779Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:d1955f35cde3134781e77b3735e8615b8c9d9884e860d12c4f4fed9029ab4570","observation_id":"33db6231-caa2-4980-810c-6cb240c89537","resolution":{"observed_at":"2026-08-07T13:00:58.197779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03458","last_updated":"2022-06-22T20:22:29Z","snapshot_observed_at":"2026-07-06T12:57:51.108636Z","submitted_at":"2022-04-07T14:08:02Z","title":"Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03458","snapshot_observed_at":"2026-08-07T13:00:58.322441Z","title":"Video diffusion models.arXiv:2204.03458,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.322441Z"},"links":{"cited_paper":"/paper/2204.03458","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:b884243f608c0136631acaa63085c40163fe7822fc880ee0394f775a08e74fdb","observation_id":"9a3b2a17-96da-4b8b-b8e0-5a45bb38fc4c","resolution":{"observed_at":"2026-08-07T13:00:58.322441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-07T13:00:58.427430Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers.arXiv preprint arXiv:2205.15868, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.427430Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:5d7a10d07460509521e37aed23090cd577cba2a9c91bfe047bb106d8c0a33a3f","observation_id":"caa1bd13-a401-4165-ba1b-c5537d101575","resolution":{"observed_at":"2026-08-07T13:00:58.427430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:08.311930Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"a3968884-fb3a-4f63-ac1c-ab9fdc4b023a","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.539695Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:af176fd70a0f84e12bd77739279b7024f84cfa0be403579995d47c38ebd3d9a6","observation_id":"50e588c3-2169-4d3c-acd8-eae01d532af9","resolution":{"observed_at":"2026-08-07T13:01:08.315535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:08.304758Z","title":"High-quality Text-to-video Models","venue":null,"work_id":"b1a58f95-3ec0-4af2-ba35-3cef1e5778c0","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.658289Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:d347851116044e4fae1af4da342edf8c8765d5fa8671e3aa266c85295cc185e1","observation_id":"6015e7c6-9ffa-4ff7-b1aa-9ed77f66ca46","resolution":{"observed_at":"2026-08-07T13:01:08.307585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:08.045352Z","title":"KLING AI: Next-Generation AI Creative Studio.https://www.klingai.com/, 2024","venue":null,"work_id":"be19bdb8-d713-4359-8d12-c234b09d1245","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.748386Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:b1cd7f08c1ab84128a674a4a6aed35be62a336327c6594fff29df91a8b9493d4","observation_id":"b974e219-4fb0-4c1e-ae84-95e7459971bd","resolution":{"observed_at":"2026-08-07T13:01:08.180073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:07.716840Z","title":"Multi-concept cus- tomization of text-to-image diffusion","venue":null,"work_id":"3d2924c7-4bae-4886-a85b-8817b749a023","year":1931},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.858770Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:a1fab797f4a9a3acb0e98c2546eecc1552c6b9a74c59568aadbaaac5fedb07d7","observation_id":"272c985e-138a-496a-b615-57a1b4732816","resolution":{"observed_at":"2026-08-07T13:01:07.862669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00651","last_updated":"2024-03-20T17:28:02Z","snapshot_observed_at":"2026-07-06T16:55:41.420301Z","submitted_at":"2023-12-01T15:24:38Z","title":"TrackDiffusion: Tracklet-Conditioned Video Generation via Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00651","snapshot_observed_at":"2026-08-07T13:00:58.952626Z","title":"Trackdiffusion: Tracklet- conditioned video generation via diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.952626Z"},"links":{"cited_paper":"/paper/2312.00651","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:d2edafa22b913da7845a6fbd1ee33745149a86e71416792d01da1ab8dcb8d3e5","observation_id":"2233dae1-8b17-4b73-b21d-c9aca587af4f","resolution":{"observed_at":"2026-08-07T13:00:58.952626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:07.580167Z","title":"Gligen: Open-set grounded text-to- image generation","venue":null,"work_id":"250a5700-7f3f-4cbe-b5bc-154f94d418f8","year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.025274Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:b95560990eba1b0b88dc971c1bcd1bd5f5b9beb26a8566d4bbc826511b4dcf99","observation_id":"be3c788d-8ee8-4078-a85b-caa23787f32f","resolution":{"observed_at":"2026-08-07T13:01:07.638758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:07.426335Z","title":"Movideo: Motion-aware video generation with diffusion model","venue":null,"work_id":"65f63c7c-1927-4bc4-9e1c-48226b7f5093","year":2025},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.091672Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:4d2258e62da44a8f5db6117c22442942ddc58ff87e3a760bffa09fcb32e7249a","observation_id":"80044332-1829-4001-9a49-611707efe2e6","resolution":{"observed_at":"2026-08-07T13:01:07.496035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:07.284039Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":"149a068d-485f-4f98-8ec6-16d77640ce0c","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.172626Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:fdd020ba1b0b5c12d07691a95f8ccafb7e4568b93570396405ebc9e0a5ce46c1","observation_id":"ff403e82-cb7a-4ac2-a7ee-489674d20e87","resolution":{"observed_at":"2026-08-07T13:01:07.343576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02236","last_updated":"2023-06-04T02:33:12Z","snapshot_observed_at":"2026-08-06T15:51:21.815246Z","submitted_at":"2023-06-04T02:33:12Z","title":"Detector Guidance for Multi-Object Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2306.02236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02236","snapshot_observed_at":"2026-08-07T13:01:02.885255Z","title":"Detector Guidance for Multi-Object Text-to-Image Generation","venue":"cs.CV","work_id":"58d238a7-ba8b-43bb-a8dc-9c0c5d6e66e2","year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.268187Z"},"links":{"cited_paper":"/paper/2306.02236","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:741e4d7c897ee4b43f307aef5927ddef73c1cd4701e9848f22d31f1f61c9c8d0","observation_id":"a634ebcf-1c1d-4882-9502-b3558c670a96","resolution":{"observed_at":"2026-08-07T13:01:03.014410Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-07T13:00:59.360313Z","title":"Sora: A re- view on background, technology, limitations, and op- portunities of large vision models.arXiv preprint arXiv:2402.17177, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.360313Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:5449bf76b753ab752f976085faef9cba395ecc989a690177a3cb4b193482c218","observation_id":"be93cda6-eecb-4039-958a-99d6463f79db","resolution":{"observed_at":"2026-08-07T13:00:59.360313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:07.080737Z","title":"Lumaai.https://lumalabs.ai/,","venue":null,"work_id":"9e2a00e9-2d64-4cbf-99d7-e1858d378842","year":null},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.480131Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:4fe93284199a1d5bb68512fcecf026c27799137941b5245befa14e000287a747","observation_id":"4ab781fb-589e-4f9b-93fb-8ee640cf5507","resolution":{"observed_at":"2026-08-07T13:01:07.181827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:06.608871Z","title":"Vidm: Video implicit diffusion models","venue":null,"work_id":"8b6b1e17-43a6-4dd4-90aa-74acfea123ae","year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.677588Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:fbf82742711066aac9b12d5a6728d5ead18d7f90ffd7e14b9c6244d93b741161","observation_id":"32ae22fd-4d49-4c6d-ad5c-14872d010344","resolution":{"observed_at":"2026-08-07T13:01:06.675171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:06.440100Z","title":"Hailuo AI: Captivating AI Videos Gen- erated with Hailuo AI .https://hailuoai","venue":null,"work_id":"578856fa-5309-4b9b-afda-10fb37bd6f79","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.744083Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:698c7659ca98b942e6f4cee8b83befb14cfa686584caaff9821366db3fdef331","observation_id":"37de2084-99d7-4691-bb74-cfadb942a24d","resolution":{"observed_at":"2026-08-07T13:01:06.512260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01329","last_updated":"2023-02-02T18:58:58Z","snapshot_observed_at":"2026-07-06T14:47:48.494911Z","submitted_at":"2023-02-02T18:58:58Z","title":"Dreamix: Video Diffusion Models are General Video Editors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01329","snapshot_observed_at":"2026-08-07T13:00:59.801514Z","title":"Dreamix: Video diffusion models are general video editors.arXiv preprint arXiv:2302.01329, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.801514Z"},"links":{"cited_paper":"/paper/2302.01329","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:fd2d4443043b305750cb6ea814a44a829daea5f5f6c032781aee1e414fb8b051","observation_id":"00d20cf3-5a94-4aab-a214-7fbe8a35b8a0","resolution":{"observed_at":"2026-08-07T13:00:59.801514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18072","last_updated":"2024-10-23T17:56:11Z","snapshot_observed_at":"2026-08-07T10:24:39.020859Z","submitted_at":"2024-10-23T17:56:11Z","title":"WorldSimBench: Towards Video Generation Models as World Simulators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18072","snapshot_observed_at":"2026-08-07T13:00:59.855458Z","title":"Worldsimbench: Towards video gen- eration models as world simulators.arXiv preprint arXiv:2410.18072, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.855458Z"},"links":{"cited_paper":"/paper/2410.18072","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:7e57410b705b5bdfdfbec9fc5947841fc8169b35f39dd482c6e0de921637db8b","observation_id":"ed0700fb-40f1-46c2-b9df-8dc13412dc53","resolution":{"observed_at":"2026-08-07T13:00:59.855458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16863","last_updated":"2024-06-24T17:59:56Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:59:56Z","title":"FreeTraj: Tuning-Free Trajectory Control in Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16863","snapshot_observed_at":"2026-08-07T13:00:59.932469Z","title":"Freetraj: Tuning- free trajectory control in video diffusion models.arXiv preprint arXiv:2406.16863, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.932469Z"},"links":{"cited_paper":"/paper/2406.16863","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:7af648d9e5eabf306cb0525a7e0421595839fbae34d5dc55cc605e8ce389a3ca","observation_id":"ccd886c3-2fdb-4825-9188-ee47f941fb16","resolution":{"observed_at":"2026-08-07T13:00:59.932469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:59.991815Z","title":"High- resolution image synthesis with latent diffusion mod- els","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.991815Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:88c3aba80fae4e04e60a1415fc8f44a4008c320188a6576438ed98372648e2ce","observation_id":"b61f693c-65c2-4189-8e45-07b895997203","resolution":{"observed_at":"2026-08-07T13:00:59.991815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:06.231011Z","title":"Gen-2: Generate novel videos with text, im- ages or video clips, 2024","venue":null,"work_id":"ef30f10e-af11-4e5b-aa73-2ea860b95c45","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.054526Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:ae64916be64b6f1910700c48033fa58747b9060881b523f4ee20e5408782734d","observation_id":"077b15c3-383c-4714-9e5e-ec3e29d03024","resolution":{"observed_at":"2026-08-07T13:01:06.325296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:06.092316Z","title":"Introducing Gen-3 Alpha: A New Frontier for Video Generation, 2024","venue":null,"work_id":"ff691e39-07de-4bc6-a23f-8d83787ca4fb","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.104985Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:39addcce0d6ddad2beb34edc60eb38472dc7383c7a5dae962553443c8ae5f7d1","observation_id":"0d5210f5-31b9-4dd7-9af0-34f0764c78a1","resolution":{"observed_at":"2026-08-07T13:01:06.166910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-07T13:01:00.153544Z","title":"Make-a-video: Text- to-video generation without text-video data.arXiv preprint arXiv:2209.14792, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.153544Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:c67c07c14d6f9a66c40b097a3176688c41059b55dee0f4bd37560c0f1eef180b","observation_id":"55510d57-fa72-422a-81f8-f760346fd4d4","resolution":{"observed_at":"2026-08-07T13:01:00.153544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T13:01:00.214571Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.214571Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:b091c7571921b81f368bd3ce4209599bb99bc4d949642d754d2c172838feca55","observation_id":"d567d424-2a2d-472e-ab42-d20348480375","resolution":{"observed_at":"2026-08-07T13:01:00.214571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-07T13:01:00.283843Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild.arXiv preprint arXiv:1212.0402, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.283843Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:05cc75236f75baffaaf2c8b6eec1c0a7db55d1837c395a15039496bd157a0798","observation_id":"b94524fd-15c5-4b14-a04b-404da42a760b","resolution":{"observed_at":"2026-08-07T13:01:00.283843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:05.937487Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":"390a5240-9f05-437b-ac9e-4f85d43fe532","year":2020},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.331605Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:e837d96b4810dd235698eab829f4927b1c05b9666d178c11adb214e26256391f","observation_id":"cf967497-233e-4b07-818c-d3b7f7e4bfe7","resolution":{"observed_at":"2026-08-07T13:01:06.011982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T13:01:00.389339Z","title":"Llama: Open and effi- cient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.389339Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:9f223a1e3b6c991a4c83af1b688307e8d4431680f2bbb6985a47c5e9601f09e2","observation_id":"d42c452d-9d30-4735-b207-c73d02727e5c","resolution":{"observed_at":"2026-08-07T13:01:00.389339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:05.749874Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":"68d1be36-eb58-4d4e-93fa-b5e020e57fe3","year":null},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.436115Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:199f5061c90ef51490198179b9c1af1f5600a634a6aee7efe14c9793ed3857e9","observation_id":"9c91d916-d50f-466b-ae54-23f87b483035","resolution":{"observed_at":"2026-08-07T13:01:05.828168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:05.611056Z","title":"Vchitect 2.0: Embark on a Visual Fan- tasy Journey.https://vchitect.intern- ai.org.cn/, 2024","venue":null,"work_id":"844eb00b-3815-44a3-bec1-d73ad023b73f","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.504131Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:b298f4e89dc5d3cbef0bf3ac7ef48e62ddfd4b6cec4d2c31000fd9e9cf664891","observation_id":"c9b98d0c-7c9f-4cf4-8689-727ac648b204","resolution":{"observed_at":"2026-08-07T13:01:05.693951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02399","last_updated":"2022-10-05T17:18:28Z","snapshot_observed_at":"2026-08-04T09:09:48.463217Z","submitted_at":"2022-10-05T17:18:28Z","title":"Phenaki: Variable Length Video Generation From Open Domain Textual Description","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02399","snapshot_observed_at":"2026-08-07T13:01:00.551776Z","title":"Phenaki: Variable length video gen- eration from open domain textual description.arXiv preprint arXiv:2210.02399, 2022","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.551776Z"},"links":{"cited_paper":"/paper/2210.02399","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:30fccd32d104c3523dd625c1582867b9173da90c3a8409e4979e9820403691fa","observation_id":"7728518b-2d64-4a24-aa08-5fe07fb488c1","resolution":{"observed_at":"2026-08-07T13:01:00.551776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-07T17:54:54.749604Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-07T13:01:00.629908Z","title":"Mod- elscope text-to-video technical report.arXiv preprint arXiv:2308.06571, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.629908Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:be5bc2f93af93fa591def63d9880b9b9ca24477589d7f545565b025787cb525d","observation_id":"b92d328c-fdd7-4fc2-8881-e6dc1d5cc576","resolution":{"observed_at":"2026-08-07T13:01:00.629908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01566","last_updated":"2024-02-02T16:59:48Z","snapshot_observed_at":"2026-08-05T10:16:25.180895Z","submitted_at":"2024-02-02T16:59:48Z","title":"Boximator: Generating Rich and Controllable Motions for Video Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01566","snapshot_observed_at":"2026-08-07T13:01:00.698486Z","title":"Boximator: Generating rich and controllable motions for video synthesis.arXiv preprint arXiv:2402.01566, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.698486Z"},"links":{"cited_paper":"/paper/2402.01566","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:e691f2e334c9d69e05d20417161f7568046ebeb3e7bdfea082682954f9305722","observation_id":"76bd7851-616f-47fe-a686-038e71947e91","resolution":{"observed_at":"2026-08-07T13:01:00.698486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-07T13:01:00.755454Z","title":"CogVLM: Visual ex- pert for pretrained language models.arXiv preprint arXiv:2311.03079, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.755454Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:67f77fc7f77c1f5ad563faebd6bfcae57956a53df051e2787533f22277b274b1","observation_id":"0bd7da98-74db-4435-9e17-d1bf73de581c","resolution":{"observed_at":"2026-08-07T13:01:00.755454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T13:01:00.803646Z","title":"Emu3: 15 Next-token prediction is all you need.arXiv preprint arXiv:2409.18869, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.803646Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:a6138dc571f3dc1f0529512454cbf4ffd72b2368547e16c4172b2d7ea2b91114","observation_id":"77514227-2a4a-46c9-a9b4-dbef5600b2ae","resolution":{"observed_at":"2026-08-07T13:01:00.803646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-07T13:01:00.850247Z","title":"Worlddreamer: Towards general world models for video genera- tion via predicting masked tokens.arXiv preprint arXiv:2401.09985, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.850247Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:f33103ea27c9a12320af1d1e5739e8df5ad1a9de62c15d75ea243abfa69fa6a6","observation_id":"5527bad4-bd6c-4d2a-a004-2ab86e607bdb","resolution":{"observed_at":"2026-08-07T13:01:00.850247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:05.374459Z","title":"LaVie: High-quality video generation with cascaded latent diffusion mod- els.IJCV, 2024","venue":null,"work_id":"b16bb3c8-6fa2-45ba-a89d-2fd38613ba3d","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.900024Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:b1ba3367b8169458e0d5abd49e2e0ae2544c8245c1f62014ebd52286d8c4f1b3","observation_id":"5b73f522-f386-48ad-8fa6-f7b34042c99f","resolution":{"observed_at":"2026-08-07T13:01:05.494450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:00.965204Z","title":"Customvideo: Cus- tomizing text-to-video generation with multiple sub- jects.arXiv preprint arXiv:2401.09962, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.965204Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:64b8809ea18a5b3e947773a3d7ea7bf6c0a36863892ac6580ce5392d03ba1b2a","observation_id":"0969d8ed-1fb6-4f3b-99cf-9b277420cd86","resolution":{"observed_at":"2026-08-07T13:01:00.965204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:05.120432Z","title":"Grit: A generative region-to-text transformer for ob- ject understanding","venue":null,"work_id":"9e48767f-05e1-40a5-bab6-a9b22b1b93e8","year":2025},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:01.016503Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:90b91f85b56aa6a49711dcb35ec54345f330f68d278cf1f358afe37095ea6df1","observation_id":"25ef5394-9984-4e2d-ba69-6861e8466566","resolution":{"observed_at":"2026-08-07T13:01:05.242780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07537","last_updated":"2024-07-25T09:10:52Z","snapshot_observed_at":"2026-08-09T00:18:44.871745Z","submitted_at":"2023-12-12T18:59:16Z","title":"FreeInit: Bridging Initialization Gap in Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07537","snapshot_observed_at":"2026-08-07T13:01:01.085135Z","title":"Freeinit: Bridging initializa- tion gap in video diffusion models.arXiv preprint arXiv:2312.07537, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:01.085135Z"},"links":{"cited_paper":"/paper/2312.07537","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:6d0a8da19ec55048efe4e9c767e4b4d07486ae9f1a737228de172fd8791e9a7a","observation_id":"a5b9fce2-6191-40d8-9afd-ef79d6c2815a","resolution":{"observed_at":"2026-08-07T13:01:01.085135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:04.862010Z","title":"Dynamicrafter: An- imating open-domain images with video diffusion pri- ors","venue":null,"work_id":"0d43f170-10c8-419e-9704-c216da75f781","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:01.159014Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:ae85f1fbb576b6d97944ef3618ecc8093f7a8cc129fdfb7d5504dc95b58da169","observation_id":"81dc84f9-3b18-4b54-ba9f-d8405d3a5837","resolution":{"observed_at":"2026-08-07T13:01:04.971631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:04.592944Z","title":"MSR- VTT: A large video description dataset for bridging video and language","venue":null,"work_id":"04b2dfa6-4b88-4b1e-8330-2a57ee1e4c86","year":2016},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:01.271572Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:880193bb88cddd8fe0ca2838779de5c2bd3b96c57b6efc2e84b62aa2d1397b8e","observation_id":"591e9272-6616-4805-bcaa-020b06632107","resolution":{"observed_at":"2026-08-07T13:01:04.732407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:04.319436Z","title":"Advancing high-resolution video- language representation with large-scale video tran- scriptions","venue":null,"work_id":"586645b9-e410-4d8d-86ea-390491da107a","year":2022},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:01.363298Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:204750857155b1b799ce6a8306888b2557a0fd989f8f6f70055ee8362b559950","observation_id":"5dd678f3-210e-4785-8b6f-57f08c563b28","resolution":{"observed_at":"2026-08-07T13:01:04.458872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:04.027941Z","title":"Video in- stance segmentation","venue":null,"work_id":"e7513e25-632a-4f09-b610-0ac4897939c7","year":2019},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:01.481638Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:3217ae13f7df2b4e9ec884380235bff1b4a1284f06da8fd9a9d9a089ec5431bc","observation_id":"bdfe9b52-8ebb-4196-94bb-615dfa0b7647","resolution":{"observed_at":"2026-08-07T13:01:04.185001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16111","last_updated":"2024-03-24T12:04:06Z","snapshot_observed_at":"2026-08-04T02:42:31.266467Z","submitted_at":"2024-03-24T12:04:06Z","title":"EVA: Zero-shot Accurate Attributes and Multi-Object Video Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16111","snapshot_observed_at":"2026-08-07T13:01:01.607138Z","title":"Eva: Zero-shot accurate attributes and multi-object video editing.arXiv preprint arXiv:2403.16111, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:01.607138Z"},"links":{"cited_paper":"/paper/2403.16111","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:77285dd3c503d8cd29fa0913036bf4d33847c70043a484de32495f791373570d","observation_id":"dc07aed5-accc-4f00-9c2c-b2af7ecc7e2a","resolution":{"observed_at":"2026-08-07T13:01:01.607138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T13:01:01.724034Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:01.724034Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:784cd1566a3f556c9d63f96d0c71af6e05142e08af232b19cac8d33aea4820cd","observation_id":"b7e031dc-3a43-4f2c-95a1-ce678daf7a23","resolution":{"observed_at":"2026-08-07T13:01:01.724034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:03.747003Z","title":"Show-1: Marrying pixel and latent diffusion models for text-to-video generation.Interna- tional Journal of Computer Vision, pages 1–15, 2024","venue":null,"work_id":"58af8666-e628-4ebf-b8c3-315aafc09ee1","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:01.876054Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:6dc96b9eec0c676f725d67354454d916e231aaa71bbdca1f1e0648ff399986b4","observation_id":"1095eefb-eac3-49e4-a793-9812637b7ad5","resolution":{"observed_at":"2026-08-07T13:01:03.849630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-07T13:01:02.040690Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion mod- els.arXiv preprint arXiv:2311.04145, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:02.040690Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:4bc60106667cdba3fed70a887073a60f4caed9be8b82fe89aa7ed56d20bc1fe5","observation_id":"274b38f8-d867-4814-bdab-22d674d6b567","resolution":{"observed_at":"2026-08-07T13:01:02.040690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:03.509689Z","title":"Real-time vehicle detection based on improved yolo v5.Sustainability, 14(19):12274, 2022","venue":null,"work_id":"959036db-9c66-4a77-a234-a714c8103e29","year":2022},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:02.166347Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:072f6582c33dc31e462d6b9cacc5949588acae96c6b9baa5a808ff05cf08fcf0","observation_id":"4a86a191-9976-4ebc-9f37-0abae1793df8","resolution":{"observed_at":"2026-08-07T13:01:03.624415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:03.263249Z","title":"Open-sora: Democratizing efficient video production for all, March 2024","venue":null,"work_id":"9c021196-aaad-433a-b974-c11816f5c60b","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:02.307369Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:b1d9b6d9a14158150a545b43730c34f34343c20af9a192827a44cb9d9a76d8a9","observation_id":"2111eff1-6b07-4239-8e8b-1b32f1cb52c7","resolution":{"observed_at":"2026-08-07T13:01:03.398534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-07T13:01:02.423170Z","title":"Magicvideo: Efficient video generation with latent diffusion models.arXiv preprint arXiv:2211.11018, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:02.423170Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:a6675383771b3be69a483394a80846951652678e9387474e5767155cfc2babdc","observation_id":"808ab046-08ce-426e-8557-ccebdeab53d0","resolution":{"observed_at":"2026-08-07T13:01:02.423170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:06.825059Z","title":"2, 5, 7, 8","venue":null,"work_id":"5e1f3ef7-4b17-4ae3-aaa2-f6df394b333f","year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.590268Z"},"links":{"citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:a5c658ee29e354c648f428565dad9648f7e7c4e100f2627101cdb7333d8e55cb","observation_id":"53331444-f74f-4ea2-b685-554cd1e63306","resolution":{"observed_at":"2026-08-07T13:01:06.966840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":1,"verified_fuzzy":34},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2505.22980."}