{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:JMEMFZED6ESXJBS263ODE7LMCI","short_pith_number":"pith:JMEMFZED","schema_version":"1.0","canonical_sha256":"4b08c2e483f12574865af6dc327d6c122dfb80b9cdaf65cb1001aaba729213c4","source":{"kind":"arxiv","id":"2407.12781","version":3},"attestation_state":"computed","paper":{"title":"VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Aliaksandr Siarohin, Andrea Tagliasacchi, Chaoyang Wang, David B. Lindell, Guocheng Qian, Hsin-Ying Lee, Ivan Skorokhodov, Jiaxu Zou, Michael Vasilkovsky, Sergey Tulyakov, Sherwin Bahmani, Willi Menapace","submitted_at":"2024-07-17T17:59:05Z","abstract_excerpt":"Modern text-to-video synthesis models demonstrate coherent, photorealistic generation of complex videos from a text description. However, most existing models lack fine-grained control over camera movement, which is critical for downstream applications related to content creation, visual effects, and 3D vision. Recently, new methods demonstrate the ability to generate videos with controllable camera poses these techniques leverage pre-trained U-Net-based diffusion models that explicitly disentangle spatial and temporal generation. Still, no existing approach enables camera control for new, tra"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2407.12781","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2024-07-17T17:59:05Z","cross_cats_sorted":[],"title_canon_sha256":"18a08df71b10ab92b34975ec553d5addbc1e27697907ae9768c9a2f886706ad8","abstract_canon_sha256":"bd335dcb18c57697013b5137c6c064704f9692770a36f4119544ec64424dd147"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:37:31.123671Z","signature_b64":"VSyRY3G+3cz2aFrXvh/I2mhNxhgfBzrQHspJuJ933LAUMLh208pn/zkwPiI00DFdKLuETFhXk1T1mBzof4XVAA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"4b08c2e483f12574865af6dc327d6c122dfb80b9cdaf65cb1001aaba729213c4","last_reissued_at":"2026-07-05T10:37:31.122736Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:37:31.122736Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Aliaksandr Siarohin, Andrea Tagliasacchi, Chaoyang Wang, David B. Lindell, Guocheng Qian, Hsin-Ying Lee, Ivan Skorokhodov, Jiaxu Zou, Michael Vasilkovsky, Sergey Tulyakov, Sherwin Bahmani, Willi Menapace","submitted_at":"2024-07-17T17:59:05Z","abstract_excerpt":"Modern text-to-video synthesis models demonstrate coherent, photorealistic generation of complex videos from a text description. However, most existing models lack fine-grained control over camera movement, which is critical for downstream applications related to content creation, visual effects, and 3D vision. Recently, new methods demonstrate the ability to generate videos with controllable camera poses these techniques leverage pre-trained U-Net-based diffusion models that explicitly disentangle spatial and temporal generation. Still, no existing approach enables camera control for new, tra"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.12781","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2407.12781/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2407.12781","created_at":"2026-07-05T10:37:31.122854+00:00"},{"alias_kind":"arxiv_version","alias_value":"2407.12781v3","created_at":"2026-07-05T10:37:31.122854+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.12781","created_at":"2026-07-05T10:37:31.122854+00:00"},{"alias_kind":"pith_short_12","alias_value":"JMEMFZED6ESX","created_at":"2026-07-05T10:37:31.122854+00:00"},{"alias_kind":"pith_short_16","alias_value":"JMEMFZED6ESXJBS2","created_at":"2026-07-05T10:37:31.122854+00:00"},{"alias_kind":"pith_short_8","alias_value":"JMEMFZED","created_at":"2026-07-05T10:37:31.122854+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":21,"internal_anchor_count":2,"sample":[{"citing_arxiv_id":"2607.06216","citing_title":"MoWorld: A Flash World Model","ref_index":51,"is_internal_anchor":true},{"citing_arxiv_id":"2604.17565","citing_title":"UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models","ref_index":5,"is_internal_anchor":true},{"citing_arxiv_id":"2606.26964","citing_title":"Look-Before-Move: Narrative-Grounded World Visual Attention in Dynamic 3D Story Worlds","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2606.20774","citing_title":"TriMotion: Modality-Agnostic Camera Control for Video Generation","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07508","citing_title":"Streaming Video Generation with Streaming Force Control","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14815","citing_title":"Probing into Camera Control of Video Models","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2606.29020","citing_title":"Semantic-Aware, Physics-Informed, Geometry-Grounded Weather Video Synthesis","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2606.26964","citing_title":"Look-Before-Move: Narrative-Grounded World Visual Attention in Dynamic 3D Story Worlds","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2606.22481","citing_title":"Lighting-Consistent Object Transfer Across Radiance Fields","ref_index":225,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11871","citing_title":"$h$-control: Training-Free Camera Control via Block-Conditional Gibbs Refinement","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18365","citing_title":"GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13838","citing_title":"R-DMesh: Video-Guided 3D Animation via Rectified Dynamic Mesh Flow","ref_index":122,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12119","citing_title":"MoCam: Unified Novel View Synthesis via Structured Denoising Dynamics","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13838","citing_title":"R-DMesh: Video-Guided 3D Animation via Rectified Dynamic Mesh Flow","ref_index":122,"is_internal_anchor":false},{"citing_arxiv_id":"2409.02048","citing_title":"ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis","ref_index":80,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11871","citing_title":"$h$-control: Training-Free Camera Control via Block-Conditional Gibbs Refinement","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12119","citing_title":"MoCam: Unified Novel View Synthesis via Structured Denoising Dynamics","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2404.02101","citing_title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","ref_index":96,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17565","citing_title":"UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07209","citing_title":"INSPATIO-WORLD: A Real-Time 4D World Simulator via Spatiotemporal Autoregressive Modeling","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17565","citing_title":"UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models","ref_index":5,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/JMEMFZED6ESXJBS263ODE7LMCI","json":"https://pith.science/pith/JMEMFZED6ESXJBS263ODE7LMCI.json","graph_json":"https://pith.science/api/pith-number/JMEMFZED6ESXJBS263ODE7LMCI/graph.json","events_json":"https://pith.science/api/pith-number/JMEMFZED6ESXJBS263ODE7LMCI/events.json","paper":"https://pith.science/paper/JMEMFZED"},"agent_actions":{"view_html":"https://pith.science/pith/JMEMFZED6ESXJBS263ODE7LMCI","download_json":"https://pith.science/pith/JMEMFZED6ESXJBS263ODE7LMCI.json","view_paper":"https://pith.science/paper/JMEMFZED","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2407.12781&json=true","fetch_graph":"https://pith.science/api/pith-number/JMEMFZED6ESXJBS263ODE7LMCI/graph.json","fetch_events":"https://pith.science/api/pith-number/JMEMFZED6ESXJBS263ODE7LMCI/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/JMEMFZED6ESXJBS263ODE7LMCI/action/timestamp_anchor","attest_storage":"https://pith.science/pith/JMEMFZED6ESXJBS263ODE7LMCI/action/storage_attestation","attest_author":"https://pith.science/pith/JMEMFZED6ESXJBS263ODE7LMCI/action/author_attestation","sign_citation":"https://pith.science/pith/JMEMFZED6ESXJBS263ODE7LMCI/action/citation_signature","submit_replication":"https://pith.science/pith/JMEMFZED6ESXJBS263ODE7LMCI/action/replication_record"}},"created_at":"2026-07-05T10:37:31.122854+00:00","updated_at":"2026-07-05T10:37:31.122854+00:00"}