{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:3YEA3LU7Z7YH5NB52MDTCTME42","short_pith_number":"pith:3YEA3LU7","schema_version":"1.0","canonical_sha256":"de080dae9fcff07eb43dd307314d84e69785c32fe2b7854009d29e5a2b430fd8","source":{"kind":"arxiv","id":"2408.06070","version":3},"attestation_state":"computed","paper":{"title":"ControlNeXt: Powerful and Efficient Control for Image and Video Generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Bohao Peng, Jian Wang, Jiaya Jia, Ming-Chang Yang, Wenbo Li, Yuechen Zhang","submitted_at":"2024-08-12T11:41:18Z","abstract_excerpt":"Diffusion models have demonstrated remarkable and robust abilities in both image and video generation. To achieve greater control over generated results, researchers introduce additional architectures, such as ControlNet, Adapters and ReferenceNet, to integrate conditioning controls. However, current controllable generation methods often require substantial additional computational resources, especially for video generation, and face challenges in training or exhibit weak control. In this paper, we propose ControlNeXt: a powerful and efficient method for controllable image and video generation"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2408.06070","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-08-12T11:41:18Z","cross_cats_sorted":[],"title_canon_sha256":"dd38a79e5f9971cbb17a24cfbac076ef2be9cc2930139fa7e27de9e59bbd1b20","abstract_canon_sha256":"fe99c6f5a9aaddbb3145b5d2cf6f429c771d9f699482d5250498a50466ddb723"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:26:39.099690Z","signature_b64":"kZBlTWa3FcLeG1KFBLbjtm5OyusD3eXBfKr0dSGrPKnMNWgLGGzbLIdgZ0e7QHNIEROWgIXhZfbkhNgLwpyBBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"de080dae9fcff07eb43dd307314d84e69785c32fe2b7854009d29e5a2b430fd8","last_reissued_at":"2026-07-05T10:26:39.099159Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:26:39.099159Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"ControlNeXt: Powerful and Efficient Control for Image and Video Generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Bohao Peng, Jian Wang, Jiaya Jia, Ming-Chang Yang, Wenbo Li, Yuechen Zhang","submitted_at":"2024-08-12T11:41:18Z","abstract_excerpt":"Diffusion models have demonstrated remarkable and robust abilities in both image and video generation. To achieve greater control over generated results, researchers introduce additional architectures, such as ControlNet, Adapters and ReferenceNet, to integrate conditioning controls. However, current controllable generation methods often require substantial additional computational resources, especially for video generation, and face challenges in training or exhibit weak control. In this paper, we propose ControlNeXt: a powerful and efficient method for controllable image and video generation"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2408.06070","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2408.06070/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2408.06070","created_at":"2026-07-05T10:26:39.099228+00:00"},{"alias_kind":"arxiv_version","alias_value":"2408.06070v3","created_at":"2026-07-05T10:26:39.099228+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2408.06070","created_at":"2026-07-05T10:26:39.099228+00:00"},{"alias_kind":"pith_short_12","alias_value":"3YEA3LU7Z7YH","created_at":"2026-07-05T10:26:39.099228+00:00"},{"alias_kind":"pith_short_16","alias_value":"3YEA3LU7Z7YH5NB5","created_at":"2026-07-05T10:26:39.099228+00:00"},{"alias_kind":"pith_short_8","alias_value":"3YEA3LU7","created_at":"2026-07-05T10:26:39.099228+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":19,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.27192","citing_title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2606.09681","citing_title":"GenEyePose: Patient-Free, Knowledge-Based Saccadic Eye Movement Modeling for Digital Neurophysiologic Biomarker Development","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30514","citing_title":"3D Scene-Adaptive Trajectory-Controllable Human Image Animation with Camera Movement","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02000","citing_title":"Towards 3D-Aware Video Diffusion Models: Render-Free Human Motion Control with Mesh Tokenization","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2606.31924","citing_title":"InstanceControl: Controllable Complex Image Generation without Instance Labeling","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30514","citing_title":"3D Scene-Adaptive Trajectory-Controllable Human Image Animation with Camera Movement","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2602.05202","citing_title":"GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modeling","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2412.00131","citing_title":"Open-Sora Plan: Open-Source Large Video Generation Model","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22051","citing_title":"EasyVFX: Frequency-Driven Decoupling for Resource-Efficient VFX Generation","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2511.22940","citing_title":"One-to-All Animation: Alignment-Free Character Animation and Image Pose Transfer","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2505.22394","citing_title":"PacTure: Efficient PBR Texture Generation on Packed Views with Visual Autoregressive Models","ref_index":58,"is_internal_anchor":false},{"citing_arxiv_id":"2509.19454","citing_title":"ROPA: Synthetic Robot Pose Generation for RGB-D Bimanual Data Augmentation","ref_index":68,"is_internal_anchor":false},{"citing_arxiv_id":"2509.23279","citing_title":"Vid-Freeze: Protecting Images from Malicious Image-to-Video Generation via Temporal Freezing","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2512.09646","citing_title":"VHOI: Controllable Video Generation of Human-Object Interactions from Sparse Trajectories via Motion Densification","ref_index":58,"is_internal_anchor":false},{"citing_arxiv_id":"2604.03305","citing_title":"HVG-3D: Bridging Real and Simulation Domains for 3D-Conditional Hand-Object Interaction Video Synthesis","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2604.26232","citing_title":"DepthPilot: From Controllability to Interpretability in Colonoscopy Video Generation","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10837","citing_title":"Immune2V: Image Immunization Against Dual-Stream Image-to-Video Generation","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01720","citing_title":"SignVerse-2M: A Two-Million-Clip Pose-Native Universe of 55+ Sign Languages","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2604.13994","citing_title":"Remote Sensing Image Super-Resolution for Imbalanced Textures: A Texture-Aware Diffusion Framework","ref_index":20,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/3YEA3LU7Z7YH5NB52MDTCTME42","json":"https://pith.science/pith/3YEA3LU7Z7YH5NB52MDTCTME42.json","graph_json":"https://pith.science/api/pith-number/3YEA3LU7Z7YH5NB52MDTCTME42/graph.json","events_json":"https://pith.science/api/pith-number/3YEA3LU7Z7YH5NB52MDTCTME42/events.json","paper":"https://pith.science/paper/3YEA3LU7"},"agent_actions":{"view_html":"https://pith.science/pith/3YEA3LU7Z7YH5NB52MDTCTME42","download_json":"https://pith.science/pith/3YEA3LU7Z7YH5NB52MDTCTME42.json","view_paper":"https://pith.science/paper/3YEA3LU7","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2408.06070&json=true","fetch_graph":"https://pith.science/api/pith-number/3YEA3LU7Z7YH5NB52MDTCTME42/graph.json","fetch_events":"https://pith.science/api/pith-number/3YEA3LU7Z7YH5NB52MDTCTME42/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/3YEA3LU7Z7YH5NB52MDTCTME42/action/timestamp_anchor","attest_storage":"https://pith.science/pith/3YEA3LU7Z7YH5NB52MDTCTME42/action/storage_attestation","attest_author":"https://pith.science/pith/3YEA3LU7Z7YH5NB52MDTCTME42/action/author_attestation","sign_citation":"https://pith.science/pith/3YEA3LU7Z7YH5NB52MDTCTME42/action/citation_signature","submit_replication":"https://pith.science/pith/3YEA3LU7Z7YH5NB52MDTCTME42/action/replication_record"}},"created_at":"2026-07-05T10:26:39.099228+00:00","updated_at":"2026-07-05T10:26:39.099228+00:00"}