{"as_of":"2026-08-10T13:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:733e4fde6aa4f5fa7be175ccbc84ea1ad8a53ed944c1322e104197401f4250b8","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:02:56.890698Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:51:43.018033Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T12:20:00.524134Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08639","snapshot_observed_at":"2026-08-07T10:51:43.018033Z","title":"Cinemaster: A 3d-aware and controllable framework for cinematic text-to-video generation.arXiv preprint arXiv:2502.08639, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04216","last_updated":"2025-06-04T17:57:43Z","snapshot_observed_at":"2026-08-08T15:17:23.629862Z","submitted_at":"2025-06-04T17:57:43Z","title":"UNIC: Unified In-Context Video Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:51:43.018033Z"},"links":{"cited_paper":"/paper/2502.08639","citing_paper":"/paper/2506.04216"},"observation_digest":"sha256:b26dc7412727f55969e0841d23071458706f071a727de3b6c71c13e60a649bbe","observation_id":"dd2f96f5-700b-4d64-8bd3-9637ec7baba7","resolution":{"observed_at":"2026-08-07T10:51:43.018033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08639","snapshot_observed_at":"2026-08-06T19:55:03.552423Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04451","last_updated":"2025-07-06T16:17:32Z","snapshot_observed_at":"2026-08-09T23:14:43.081218Z","submitted_at":"2025-07-06T16:17:32Z","title":"CoT-lized Diffusion: Let's Reinforce T2I Generation Step-by-step","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.552423Z"},"links":{"cited_paper":"/paper/2502.08639","citing_paper":"/paper/2507.04451"},"observation_digest":"sha256:36deeda067712ecfe2d0a05fd7379d7d4635a6304ee2b0bd89cdce142bc71c7d","observation_id":"a6a5c587-8e23-4c81-b068-a1ab62738937","resolution":{"observed_at":"2026-08-06T19:55:03.552423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08639","snapshot_observed_at":"2026-08-06T14:43:28.546293Z","title":"Cinemaster: A 3d-aware and controllable framework for cinematic text-to-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-08T23:17:58.783602Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:28.546293Z"},"links":{"cited_paper":"/paper/2502.08639","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:408337f6b0abc672b08eca12275452fce117d19c15e87fb5476a8328609282d5","observation_id":"cb7e9486-d713-4478-a10c-2d229f39f468","resolution":{"observed_at":"2026-08-06T14:43:28.546293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08639","snapshot_observed_at":"2026-08-05T20:17:30.370400Z","title":"Cinemaster: A 3d-aware and controllable frame- work for cinematic text-to-video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10881","last_updated":"2025-08-14T17:50:11Z","snapshot_observed_at":"2026-08-09T17:52:02.451515Z","submitted_at":"2025-08-14T17:50:11Z","title":"ToonComposer: Streamlining Cartoon Production with Generative Post-Keyframing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T20:17:30.370400Z"},"links":{"cited_paper":"/paper/2502.08639","citing_paper":"/paper/2508.10881"},"observation_digest":"sha256:9663d23d2819a70d055b23460f6521ad50addd46741fdafd2b097d62f8b9b223","observation_id":"72f60e5b-bac9-44d6-ad60-ac90ac3e9e29","resolution":{"observed_at":"2026-08-05T20:17:30.370400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08639","snapshot_observed_at":"2026-08-05T20:15:52.917682Z","title":"Cinemaster: A 3d-aware and controllable frame- work for cinematic text-to-video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10891","last_updated":"2025-08-14T17:57:51Z","snapshot_observed_at":"2026-08-09T17:52:01.735964Z","submitted_at":"2025-08-14T17:57:51Z","title":"Fuel Consumption in Platoons: A Literature Review","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T20:15:52.917682Z"},"links":{"cited_paper":"/paper/2502.08639","citing_paper":"/paper/2508.10891"},"observation_digest":"sha256:574d382613eca4d58813c188c1d7ee472aabe5ce6ff16118bf877738a66bc249","observation_id":"6f1e3eeb-821f-4326-bd67-eb2f638c27d3","resolution":{"observed_at":"2026-08-05T20:15:52.917682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2502.08639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08639","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2502.08639 (2025) 4 24 Zhang et al","venue":null,"work_id":"e9860fd4-8d69-4b4e-b2a3-3cd49db00353","year":2025},"citing_paper":{"arxiv_id":"2603.11755","last_updated":"2026-06-29T14:21:14Z","snapshot_observed_at":"2026-07-14T22:39:44.966501Z","submitted_at":"2026-03-12T10:02:23Z","title":"Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T12:18:45.538658Z"},"links":{"cited_paper":"/paper/2502.08639","citing_paper":"/paper/2603.11755"},"observation_digest":"sha256:47fdf31f2d23a7c219e245f826a578b809567ac1f0ad3a1600318b2b2817bbda","observation_id":"7888dd77-faf9-4890-909a-f228a66bd3cf","resolution":{"observed_at":"2026-05-15T12:20:00.527788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2502.08639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08639","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2502.08639 (2025) 4 24 Zhang et al","venue":null,"work_id":"e9860fd4-8d69-4b4e-b2a3-3cd49db00353","year":2025},"citing_paper":{"arxiv_id":"2604.02467","last_updated":"2026-04-27T18:17:15Z","snapshot_observed_at":"2026-08-02T13:43:39.563153Z","submitted_at":"2026-04-02T18:58:56Z","title":"VERTIGO: Visual Preference Optimization for Cinematic Camera Trajectory Generation","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T21:14:42.021240Z"},"links":{"cited_paper":"/paper/2502.08639","citing_paper":"/paper/2604.02467"},"observation_digest":"sha256:61e2cba25afa497064b7a2d9a0e435aaf19219ca54ab47a2dbb797e28e4182b4","observation_id":"65d6a91f-024b-4cf5-9837-058df07a7e76","resolution":{"observed_at":"2026-05-13T21:18:17.245847Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2502.08639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08639","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2502.08639 (2025) 4 24 Zhang et al","venue":null,"work_id":"e9860fd4-8d69-4b4e-b2a3-3cd49db00353","year":2025},"citing_paper":{"arxiv_id":"2604.06339","last_updated":"2026-04-07T18:17:05Z","snapshot_observed_at":"2026-07-06T22:54:53.308309Z","submitted_at":"2026-04-07T18:17:05Z","title":"Evolution of Video Generative Foundations","version":1},"reference_index":225,"source":"pdf_text","source_observed_at":"2026-05-10T18:41:38.616611Z"},"links":{"cited_paper":"/paper/2502.08639","citing_paper":"/paper/2604.06339"},"observation_digest":"sha256:d4432c81d2d64f3f92bf7fee6d93acbad8825f92e820cdcb958cdc60676d053f","observation_id":"71fec4b0-8aba-4668-8d75-7adc083cd330","resolution":{"observed_at":"2026-05-11T00:05:51.747555Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.08639/citation-record","integrity":"/paper/2502.08639/integrity","json":"/paper/2502.08639/citation-record.json","paper":"/paper/2502.08639"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:57.411790Z","title":"Loosecontrol: Lifting controlnet for generalized depth conditioning","venue":null,"work_id":"4c9bb154-9bf3-4f29-95fb-7b4f521a276c","year":2024},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.729320Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:5bd41d39a35ea52562b8d678b508c087dbe191a7d95f7775b5801fb2693dc961","observation_id":"3d7055a8-32bc-4e2b-97e1-e79d484629d5","resolution":{"observed_at":"2026-08-08T00:02:57.415015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-06T14:33:47.079999Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02690","snapshot_observed_at":"2026-08-08T00:02:56.732859Z","title":"Gs-dit: Ad- vancing video generation with pseudo 4d gaussian fields through efficient dense 3d point tracking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.732859Z"},"links":{"cited_paper":"/paper/2501.02690","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:0686cf4fa77b435d0ad73436e83d81b1e53efd2f91d4dc53423b1f01da3fe1c1","observation_id":"34234d4e-dc0f-4f30-8bb2-6e4825a8fa9a","resolution":{"observed_at":"2026-08-08T00:02:56.732859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-08T00:02:56.736420Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.736420Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:31b1b033c231590de8aee5d920f12b8be732ab726797bbba2277918c23e5c030","observation_id":"3e1da12f-295f-4186-8634-1b0d399dfa8e","resolution":{"observed_at":"2026-08-08T00:02:56.736420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-07T10:15:15.859263Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-08T00:02:56.739564Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.739564Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:dda1867724ed6eaf64ee2f99bc450082f042ff9c48988f69ee505eac4b341bc7","observation_id":"2161f796-4dea-4823-92ef-0c07279a7564","resolution":{"observed_at":"2026-08-08T00:02:56.739564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-08T00:02:56.742731Z","title":"Pixart- alpha: Fast training of diffusion transformer for pho- torealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.742731Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:769ab40b2c6c345a3fd99d8b95ba1ce8b8153242fe73cd4f28fe85079bd2bb5c","observation_id":"91ce4814-df97-4855-aec5-2a96e9f17145","resolution":{"observed_at":"2026-08-08T00:02:56.742731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13840","last_updated":"2024-08-12T08:30:05Z","snapshot_observed_at":"2026-07-06T15:31:13.189124Z","submitted_at":"2023-05-23T09:03:19Z","title":"Control-A-Video: Controllable Text-to-Video Diffusion Models with Motion Prior and Reward Feedback Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13840","snapshot_observed_at":"2026-08-08T00:02:56.746313Z","title":"Control-a-video: Controllable text-to-video generation with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.746313Z"},"links":{"cited_paper":"/paper/2305.13840","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:0d5daeedeb50b5e4b8626cf7b5f0bc219b497e7f652516d72b245a32d591d2a1","observation_id":"866547a4-cdd9-4e22-a574-04109815eb0b","resolution":{"observed_at":"2026-08-08T00:02:56.746313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05020","last_updated":"2025-03-10T10:46:31Z","snapshot_observed_at":"2026-08-04T15:09:32.260471Z","submitted_at":"2025-01-09T07:23:48Z","title":"Perception-as-Control: Fine-grained Controllable Image Animation with 3D-aware Motion Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05020","snapshot_observed_at":"2026-08-08T00:02:56.750090Z","title":"Perception-as-control: Fine-grained controllable image animation with 3d-aware motion representation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.750090Z"},"links":{"cited_paper":"/paper/2501.05020","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:e0fe24b3decf860b93dfa9ac4f4955d4d3b803e095b66b808ea2894a79fd2280","observation_id":"7a9b1d57-9407-4db1-a43a-1816bb7e8a48","resolution":{"observed_at":"2026-08-08T00:02:56.750090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:57.402609Z","title":"Patch n’pack: Navit, a vision transformer for any aspect ratio and resolu- tion","venue":null,"work_id":"3f361e90-3bce-400b-8630-330a795b6569","year":2024},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.753614Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:820a9b4b0a9869509845245ab53b5692ec9ac507961f6b48765a997db1cca99e","observation_id":"077f6917-1086-4fdd-8eca-db4e36324122","resolution":{"observed_at":"2026-08-08T00:02:57.405949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:57.394684Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"8d40bb8c-8c12-4700-9fa3-f2ab9858afdf","year":2024},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.756898Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:2002a4d24e189d8342bf5ddadb4095a4b6d7594c717ffdb606c3f7322029f485","observation_id":"19660e4c-a8c5-4a24-9f3c-c301d28c31ed","resolution":{"observed_at":"2026-08-08T00:02:57.397458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07759","last_updated":"2025-07-04T03:57:48Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:55:13Z","title":"3DTrajMaster: Mastering 3D Trajectory for Multi-Entity Motion in Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07759","snapshot_observed_at":"2026-08-08T00:02:56.760277Z","title":"3dtrajmaster: Mastering 3d trajectory for multi-entity motion in video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.760277Z"},"links":{"cited_paper":"/paper/2412.07759","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:189413b16826a2b5cd87270c61074580701e30c30b222577afbcaa61f96e246c","observation_id":"1fa4bd7f-8e40-4784-a71e-cb116ca056e7","resolution":{"observed_at":"2026-08-08T00:02:56.760277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02700","last_updated":"2025-03-27T21:38:09Z","snapshot_observed_at":"2026-08-08T23:53:57.839217Z","submitted_at":"2024-12-03T18:59:56Z","title":"Motion Prompting: Controlling Video Generation with Motion Trajectories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02700","snapshot_observed_at":"2026-08-08T00:02:56.763785Z","title":"Motion prompting: Controlling video generation with motion trajectories","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.763785Z"},"links":{"cited_paper":"/paper/2412.02700","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:6e77e6e69f491578f69c1a4d55fd5ed01be1c9e8531c2cfec14588c43d4beff4","observation_id":"2fe49bbb-275f-40b7-ba3d-82fb1a129cdb","resolution":{"observed_at":"2026-08-08T00:02:56.763785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03847","last_updated":"2025-01-09T04:25:42Z","snapshot_observed_at":"2026-08-09T14:01:02.518090Z","submitted_at":"2025-01-07T15:01:58Z","title":"Diffusion as Shader: 3D-aware Video Diffusion for Versatile Video Generation Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03847","snapshot_observed_at":"2026-08-08T00:02:56.767177Z","title":"Diffusion as shader: 3d-aware video diffusion for versatile video generation control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.767177Z"},"links":{"cited_paper":"/paper/2501.03847","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:a592eabfd6001d4012fa28dd16f5b488bdea120f29c35a458790089dc2bf5f29","observation_id":"66444dcb-3d0e-4aa9-b310-cae0a9e0fe6c","resolution":{"observed_at":"2026-08-08T00:02:56.767177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:57.386579Z","title":"Sparsectrl: Adding sparse controls to text-to-video diffusion mod- els, 2023","venue":null,"work_id":"ee023eec-0643-4402-a204-0c9f6de0cac0","year":2023},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.770594Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:6380a9003801d89992704cde9ad1f7b5ef7b71936a94cb186671c478d9d6fb0f","observation_id":"73e66d04-f15f-4942-a413-ecec944bb694","resolution":{"observed_at":"2026-08-08T00:02:57.389476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-08T00:02:56.773765Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.773765Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:e82bacb4dcabe6ca517f887306b238a9ff9c4d2b1b58c1c51e3da9620eeb40ba","observation_id":"883d6db8-5aa2-4f10-930d-442a70661dc1","resolution":{"observed_at":"2026-08-08T00:02:56.773765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:57.378368Z","title":"Cameractrl: Enabling camera control for text-to-video generation,","venue":null,"work_id":"c2122eb0-082e-4ece-a696-b8e3b9b8dabd","year":null},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.777309Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:486e436d872b53d28e87135a3b0aad7156b88bf03c5c1d6be3e573bbd15537b2","observation_id":"5bcde63a-fca3-448f-a866-ba5cb2699e87","resolution":{"observed_at":"2026-08-08T00:02:57.381179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-08T00:02:56.780647Z","title":"Classifier-free dif- fusion guidance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.780647Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:2157a192112c51586d1743779b0269484ef7ca2a3594d8736a9343e26679c351","observation_id":"ee1a13c5-2739-4bf5-95d8-22c4c6bb4a1b","resolution":{"observed_at":"2026-08-08T00:02:56.780647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:56.784510Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.784510Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:8004cae840faa52b2224f558d6513813247312bb53d5a66bdfd5b6d60af0760e","observation_id":"4f8aba04-1035-46bf-ab98-61c1ec602ea0","resolution":{"observed_at":"2026-08-08T00:02:56.784510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:57.364507Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":"6a8ec366-ce03-4a1e-969e-92816ce5e141","year":2024},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.787678Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:100f4dce1777ffd7fd29a8bc5df990740d5ed27a604ece16569b4eabb890237b","observation_id":"dde0967a-ce82-4fed-8da0-ae40f691a31e","resolution":{"observed_at":"2026-08-08T00:02:57.367946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-08T00:02:56.790984Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.790984Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:5dde6dc6bc006971aa48041486ddc0a2705db471fac9b8518e11a27864f51717","observation_id":"1b6582cf-f5a1-4d2b-8d8d-130447fbddf2","resolution":{"observed_at":"2026-08-08T00:02:56.790984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-08T00:02:56.794985Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.794985Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:c011271a486efb808c290f5f249dd54a545d01cc5e9598a88a9f807d308f3cb2","observation_id":"546c9a69-90eb-430d-befb-d727c70ffdf8","resolution":{"observed_at":"2026-08-08T00:02:56.794985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:56.798165Z","title":"Onlyflow: Optical flow based motion condition- ing for video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.798165Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:fdf6b71738134156fadfc0dc87a9ff8299462fbde359d80f34b00c30fcbe3caa","observation_id":"8c1910f7-b06e-408e-9fdf-e35a5de8835d","resolution":{"observed_at":"2026-08-08T00:02:56.798165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:57.355220Z","title":"Microsoft coco: Com- mon objects in context","venue":null,"work_id":"d9c154c2-f579-4f80-b991-d3e3b356258e","year":2014},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.801473Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:3de9cb6b1eb2c3eb01060cd53d1b74475c8613274e3c052900d0a65e6abe5534","observation_id":"de8b809f-963a-4304-8a84-6a47247d9194","resolution":{"observed_at":"2026-08-08T00:02:57.358490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-08T00:02:56.804612Z","title":"Flow match- ing for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.804612Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:565a5059d8e13cf676a901eb28cfed8cbf0487588447a9d33cb4e077e73fc6b0","observation_id":"0f6cdc96-a0fd-4c86-a8ce-7a1dece3959d","resolution":{"observed_at":"2026-08-08T00:02:56.804612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-08T00:02:56.807850Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.807850Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:4ced448082ba7604bf6d4b47ddc267cf2853906f4aa29a9347938ed95a118ccc","observation_id":"217560b7-e689-4c43-b3e9-b6483542b5d3","resolution":{"observed_at":"2026-08-08T00:02:56.807850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.10337","last_updated":"2018-10-29T15:34:15Z","snapshot_observed_at":"2026-08-10T08:18:54.350267Z","submitted_at":"2017-11-28T15:19:53Z","title":"Are GANs Created Equal? A Large-Scale Study","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.10337","snapshot_observed_at":"2026-08-08T00:02:56.811116Z","title":"Are gans cre- ated equal? a large-scale study","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.811116Z"},"links":{"cited_paper":"/paper/1711.10337","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:82e5ed3257b9bfa356beb0ec6ebe9da31bb18fada26ad3c0e330dde5c223eb1e","observation_id":"06f3bfe0-1217-4eed-a73f-36241564ad16","resolution":{"observed_at":"2026-08-08T00:02:56.811116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:57.346056Z","title":"T2i- adapter: Learning adapters to dig out more control- lable ability for text-to-image diffusion models","venue":null,"work_id":"3467828f-3e98-4ac0-a91a-20242c6221be","year":2024},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.814377Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:f9db6836054adb2c53355a811c973db3e97b33cd5ff8a0296642574106768727","observation_id":"ae8b787e-d25b-470e-9254-acc6f0aa3025","resolution":{"observed_at":"2026-08-08T00:02:57.349395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:57.336717Z","title":"Scalable diffu- sion models with transformers","venue":null,"work_id":"b1153beb-f7bb-47d2-a7cc-c3870fb654f0","year":2023},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.817478Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:abba9d2fd0d23ede28ddbc20f7a7ec185e27f1c24dfef18aaad2ef1ad41642fc","observation_id":"173cba0a-faa2-4d25-8311-b572145c1921","resolution":{"observed_at":"2026-08-08T00:02:57.340055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:57.327717Z","title":"Exploring the limits of trans- fer learning with a unified text-to-text transformer","venue":null,"work_id":"54be144a-e41a-4be1-aeda-751f65b37bbf","year":null},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.820105Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:099a35de120faebf2a13caf4266558be1d857fac8cebcf32949b71475456e725","observation_id":"2cd34242-d751-4332-898a-2c98233d2a8f","resolution":{"observed_at":"2026-08-08T00:02:57.331015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:57.318812Z","title":"Sam 2: Segment anything in images and videos, 2024","venue":null,"work_id":"6528a948-c9ef-49a6-a3b3-3deea29efde5","year":2024},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.822756Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:835918162fd3edcfa76a46cc7ee65cbd0dd9ba8078e228e76a2ccfaca1a7d138","observation_id":"08b0fba2-6043-4402-a039-9f68a2db9b56","resolution":{"observed_at":"2026-08-08T00:02:57.322060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:56.825250Z","title":"High- resolution image synthesis with latent diffusion mod- els","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.825250Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:e1cab6f9a31b209c12552490d73363fde42e7a0cd56599f3e1f8237f1c8fc4c8","observation_id":"596111a1-b820-458a-b9db-c050d5ebb640","resolution":{"observed_at":"2026-08-08T00:02:56.825250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:57.304925Z","title":"Ob- jects365: A large-scale, high-quality dataset for ob- ject detection","venue":null,"work_id":"b9b08296-34e7-4906-b192-8232ce9e9750","year":2019},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.827792Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:5cb85fb22a13898f28b3ad574c2c0feddb36519cddbabfa49bd3a9549896bc15","observation_id":"47fb0fe8-d5bc-4b9a-82d1-a59451c815b3","resolution":{"observed_at":"2026-08-08T00:02:57.308114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:57.295516Z","title":"Motion-i2v: Consistent and controllable image-to- video generation with explicit motion modeling","venue":null,"work_id":"70e71976-c5bc-482f-bae3-3fe2808e8ded","year":2024},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.830386Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:4807b9fe4ac39d687b20d5b0bc63c037a1e766a86a12617553a451d7e4f1f245","observation_id":"c7a5896a-e3f6-48bd-b63d-c88b73172609","resolution":{"observed_at":"2026-08-08T00:02:57.299396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01425","last_updated":"2025-07-20T08:17:15Z","snapshot_observed_at":"2026-08-10T10:54:31.595427Z","submitted_at":"2025-01-02T18:59:45Z","title":"Free-Form Motion Control: Controlling the 6D Poses of Camera and Objects in Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01425","snapshot_observed_at":"2026-08-08T00:02:56.833092Z","title":"Free-form mo- tion control: A synthetic video generation dataset with controllable camera and object motions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.833092Z"},"links":{"cited_paper":"/paper/2501.01425","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:1d7e2815796943a062f30db9380e209b9e7b7bd3fef31b2cc9688559d93429e9","observation_id":"629b0e59-32bc-438f-b424-cab34ff2d2b4","resolution":{"observed_at":"2026-08-08T00:02:56.833092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-08T00:02:56.838753Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.838753Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:20e632e14a75ff2fc80790949f8832d9887e51aae61240292a2b521cc31f8029","observation_id":"be80ea5b-41b7-4381-b6e5-066d0c5671bf","resolution":{"observed_at":"2026-08-08T00:02:56.838753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-08T00:02:56.841183Z","title":"Towards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.841183Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:422c52d506357d0e8cbc625c234d5abcd785a1025f89e39ae123a39bf80c9ca7","observation_id":"3c7d1b30-4766-4a8f-af2f-2e1475961f0c","resolution":{"observed_at":"2026-08-08T00:02:56.841183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13005","last_updated":"2024-09-16T15:56:34Z","snapshot_observed_at":"2026-07-06T19:05:05.530925Z","submitted_at":"2024-08-23T11:48:29Z","title":"EasyControl: Transfer ControlNet to Video Diffusion for Controllable Generation and Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13005","snapshot_observed_at":"2026-08-08T00:02:56.844613Z","title":"Easycontrol: Transfer controlnet to video dif- fusion for controllable generation and interpolation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.844613Z"},"links":{"cited_paper":"/paper/2408.13005","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:567b9267dd9d5a9b77590e75e94cb8dfa055e81bebb67e7529df14b8ccb0bab8","observation_id":"27f2f074-a029-4933-b0bd-77f99351cbcd","resolution":{"observed_at":"2026-08-08T00:02:56.844613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:57.286497Z","title":"Boxi- mator: Generating rich and controllable motions for video synthesis, 2024","venue":null,"work_id":"076cad6f-87dd-4334-993a-e18bd53a7db9","year":2024},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.848055Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:27e677eb14add9a00f60a3d145099c470212cd60e344cc6e178f0674acec7522","observation_id":"56794fc1-ecbc-48cd-8ef2-f0693a1f0e71","resolution":{"observed_at":"2026-08-08T00:02:57.289950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:57.277616Z","title":"VideoComposer: Compo- sitional Video Synthesis with Motion Controllability,","venue":null,"work_id":"b1c8259d-2052-4547-b860-5661393e0876","year":null},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.851016Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:542d8b4d3b1a197b5bd56b528b2ec2554dfcb1d2c2c6021f9197ac06db1f2410","observation_id":"caaf6c67-f80b-4cf3-adf8-7447a10f3076","resolution":{"observed_at":"2026-08-08T00:02:57.280861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03641","last_updated":"2024-07-16T17:27:10Z","snapshot_observed_at":"2026-07-06T16:57:51.263433Z","submitted_at":"2023-12-06T17:49:57Z","title":"MotionCtrl: A Unified and Flexible Motion Controller for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03641","snapshot_observed_at":"2026-08-08T00:02:56.858520Z","title":"Mo- tionCtrl: A Unified and Flexible Motion Controller for Video Generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.858520Z"},"links":{"cited_paper":"/paper/2312.03641","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:d5fcde6d0467f944f38a43584594082e327a14e4aaf483c434aad3148cfe4564","observation_id":"f987ab68-b443-46a8-98ff-ec08f495293c","resolution":{"observed_at":"2026-08-08T00:02:56.858520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:57.268292Z","title":"Spa- tialtracker: Tracking any 2d pixels in 3d space","venue":null,"work_id":"3edb3f02-d2c8-434e-bcb8-c0c25862780e","year":2024},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.861788Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:aac9eaa532c5396417f7f6cb9415f589fc1d1c8e625832fe226d62b42704c43e","observation_id":"5990c761-e728-4072-988f-be861396dd37","resolution":{"observed_at":"2026-08-08T00:02:57.271568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:57.258850Z","title":"Motioncanvas: Cinematic shot design with controllable image-to-video generation,","venue":null,"work_id":"4ad287b5-a8ef-43a2-b586-3292e34f9b15","year":null},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.865009Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:1102a1422958c3d83865920c2a59cde3ce50713f886a0f3ff7688fb34e212103","observation_id":"e495d943-efd2-4664-b720-b7d83fc5e850","resolution":{"observed_at":"2026-08-08T00:02:57.262175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-08T00:02:56.868225Z","title":"Qwen2 technical re- port","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.868225Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:c9d0ea413b59a785181e6dd47af4c366e10317aee0036af4c839c9cda4daefb7","observation_id":"10ff7950-a9b6-44ad-b0bf-a3520130ebe3","resolution":{"observed_at":"2026-08-08T00:02:56.868225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-08T00:02:56.871655Z","title":"Depth anything v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.871655Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:d3f45660e2aa8fb3c2247cb49990fdb0408d3fa3ecf8e365bad6192b57a0f59c","observation_id":"2099e773-d86d-4d89-81ed-33d389445988","resolution":{"observed_at":"2026-08-08T00:02:56.871655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:57.250422Z","title":"Direct-a-video: Customized video generation with user-directed camera movement and object mo- tion","venue":null,"work_id":"64e04ec5-9165-4e6e-a783-0b593ed1a938","year":2024},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.874885Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:3a4050930fe2c3426988ccc986c797dd451439f7bc052f1e047d908e48b21294","observation_id":"dd9de1db-cd0b-40d9-83e3-618da0ac978f","resolution":{"observed_at":"2026-08-08T00:02:57.253247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:57.242214Z","title":"Dragnuwa: Fine-grained control in video generation by integrat- ing text, image, and trajectory, 2023","venue":null,"work_id":"c4cf05b8-e4ff-4671-bc5c-5429cf664a28","year":2023},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.877873Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:b8508bbc9e459630c09914b9cbfe059f2e0cd47c8c0ce2ab1a4a96eb431ea579","observation_id":"21de9dea-0a20-4a62-bd2e-0f733902e218","resolution":{"observed_at":"2026-08-08T00:02:57.245032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03825","last_updated":"2025-05-08T08:32:16Z","snapshot_observed_at":"2026-07-06T19:28:08.374354Z","submitted_at":"2024-10-04T18:00:07Z","title":"MonST3R: A Simple Approach for Estimating Geometry in the Presence of Motion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03825","snapshot_observed_at":"2026-08-08T00:02:56.880918Z","title":"Monst3r: A simple approach for estimating geometry in the presence of motion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.880918Z"},"links":{"cited_paper":"/paper/2410.03825","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:0e986907116db4af075a40b2a9783f85a1f7e20d3e2e8ca5a0073497c64da019","observation_id":"2cf0157e-579d-4b68-ad26-7ff3b2aa69e0","resolution":{"observed_at":"2026-08-08T00:02:56.880918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:57.234009Z","title":"Adding conditional control to text-to-image diffusion models, 2023","venue":null,"work_id":"4b1ce655-83c8-4770-80d5-bc368de8e522","year":2023},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.884172Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:f8dc9a589973d39661cad1be8917508ea81cdc9fdac370f348d34c626903b13d","observation_id":"d22034f3-50dc-4118-8204-d60ebeb7d1b6","resolution":{"observed_at":"2026-08-08T00:02:57.236915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21705","last_updated":"2025-03-14T03:03:31Z","snapshot_observed_at":"2026-08-09T21:44:46.398850Z","submitted_at":"2024-07-31T15:53:20Z","title":"Tora: Trajectory-oriented Diffusion Transformer for Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21705","snapshot_observed_at":"2026-08-08T00:02:56.887287Z","title":"Tora: Trajectory-oriented Diffusion Transformer for Video Generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.887287Z"},"links":{"cited_paper":"/paper/2407.21705","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:b40ad2e47b3b2eb5be2cc0896940a9c846753312d79781ea68eff9ad6fd57b5d","observation_id":"53a765ae-f14a-434c-9360-07a55f6f0aad","resolution":{"observed_at":"2026-08-08T00:02:56.887287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:02:57.222485Z","title":"Stereo magnifica- tion: Learning view synthesis using multiplane im- ages, 2018","venue":null,"work_id":"54f61170-5c9f-4511-8d45-9d7dfa560816","year":2018},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.890698Z"},"links":{"citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:7f1d495b1b7077811709f52f28b4b5f29ff37a0aa3e9e83b6b1f77f44c978819","observation_id":"dece0ae7-5638-4861-a651-c91dc6052124","resolution":{"observed_at":"2026-08-08T00:02:57.227739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02018","last_updated":"2023-06-06T03:54:10Z","snapshot_observed_at":"2026-08-05T12:13:59.998888Z","submitted_at":"2023-06-03T06:29:02Z","title":"VideoComposer: Compositional Video Synthesis with Motion Controllability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02018","snapshot_observed_at":"2026-08-08T00:02:56.854273Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.854273Z"},"links":{"cited_paper":"/paper/2306.02018","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:6d868d4d7a820d30be474602fc37fca14ad96fdd1a1014cadb4455fc9b90f3c9","observation_id":"96e55f9f-acd4-42f0-ae51-d28808703bc4","resolution":{"observed_at":"2026-08-08T00:02:56.854273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 8 inbound Pith citation observations for arXiv:2502.08639."}