← Open Source
mayuelala

Awesome-Controllable-Video-Generation

[ArXiv 2025] A survey about controllable video generation: This repo is the official awesome of "Controllable video generation: A survey"

ListsPaper collectionsDomain-specific
Open on GitHub
Momentum
+0stars in 24 hours0.0%
775
Stars
44
Forks
+1
This week
24
Contributors
Created 2025-03-10 · Updated 2026-10-02 · #13690 today
Top developers
README

visitors GitHub Awesome

🤗 Introduction

🚀🚀🚀A curated list of papers on controllable video generation. Please join us for more comprehensive summary. If you have any additions to the list, please raise them in the issue section. 欢迎补充👏

💖 Citation

If you find this repo is useful for your research, welcome to 🌟 this repo and cite our work using the following BibTeX:

@article{ma2025controllable,
  title={Controllable video generation: A survey},
  author={Ma, Yue and Feng, Kunyu and Hu, Zhongyuan and Wang, Xinyu and Wang, Yucheng and Zheng, Mingzhe and He, Xuanhua and Zhu, Chenyang and Liu, Hongyu and He, Yingqing and others},
  journal={arXiv preprint arXiv:2507.16869},
  year={2025}
}

📋 Contents

💘 Tips

  • ✅ Paper searching via catalog: directly clicking the content of the catalog to select the area of your research and browse related papers.
  • ✅ Paper searching via author name: Feel free to search papers of a specific author via ctrl + F and then type the author name. The dropdown list of authors will automatically expand when searching.
  • ✅ Multicontrol indicator: The tag M indicates "multi-control" following the title of the paper.

🌐 Structure Control

🏙️ Layout-Guided

  • DynamicCity: Large-Scale 4D Occupancy Generation from Dynamic Scenes M (23 Oct 2024)

[ICLR 2025 Spotlight] Hengwei Bian, Lingdong Kong, et al.

    Hengwei Bian, Lingdong Kong, Haozhe Xie, Liang Pan, Yu Qiao, Ziwei Liu 

Paper Code Project_Page

🕺 Pose-Guided

  • Hand2World: Autoregressive Egocentric Interaction Generation via Free-Space Hand Gestures (10 Feb 2026)

Yuxi Wang, Wenqi Ouyang, Tianyi Wei, et al. Yuxi Wang, Wenqi Ouyang, Tianyi Wei, Yi Dong, Zhiqi Shen, Xingang Pan Paper Project

  • MTVCrafter: 4D Motion Tokenization for Open-World Human Image AnimationM (30 May 2025)

Yanbo Ding, Xirui Hu, Zhizhi Guo, et al. Yanbo Ding, Xirui Hu, Zhizhi Guo, Chi Zhang, Yali Wang Paper Code Project

  • HyperMotion: DiT-Based Pose-Guided Human Image Animation of Complex MotionsM (29 May 2025)

Shuolin Xu, Siming Zheng, Ziyi Wang, et al. Shuolin Xu, Siming Zheng, Ziyi Wang, HC Yu, Jinwei Chen, Huaqi Zhang, Bo Li, Peng-Tao Jiang PaperCode Project

  • FlexiAct: Towards Flexible Action Control in Heterogeneous Scenarios M (6 May 2025)

[SIGGRAPH 2025] Shiyi Zhang*, Junhao Zhuang*, et al. Shiyi Zhang*, Junhao Zhuang*, Zhaoyang Zhang, Ying Shan, Yansong Tang Paper Code Project_Page

  • DualReal: Joint Training for Lossless Identity-Motion Fusion in Video Customization M (4 May 2025)

Wenchuan Wang, Mengqi Huang, Yijing Tu, et al. Wenchuan Wang, Mengqi Huang, Yijing Tu, Zhendong Mao Paper

  • DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation M (23 May 2025)

Junhao Chen, Mingjin Chen, Jianjin Xu, et al. Junhao Chen, Mingjin Chen, Jianjin Xu, Xiang Li, Junting Dong, Mingze Sun, Puhua Jiang, Hongxiang Li, Yuhang Yang, Hao Zhao, Xiaoxiao Long, Ruqi Huang Paper

  • TASTE-Rob: Advancing Video Generation of Task-Oriented Hand-Object Interaction for Generalizable Robotic Manipulation M (14 Mar 2025)

Hongxiang Zhao, Xingchen Liu, et al. Hongxiang Zhao, Xingchen Liu, Mutian Xu, Yiming Hao, Weikai Chen, Xiaoguang Han Paper Project_Page

  • Point-to-Point Video Generation (14 Mar 2025)

Tsun-Hsuan Wang, Yen-Chi Cheng, et al. Tsun-Hsuan Wang, Yen-Chi Cheng, Chieh Hubert Lin, Hwann-Tzong Chen, Min Sun Paper Code

  • Pose Guided Human Video Generation (14 Mar 2025)

Ceyuan Yang, Zhe Wang, et al. Ceyuan Yang, Zhe Wang, Xinge Zhu, Chen Huang, Jianping Shi, Dahua Lin Paper

  • SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers M (15 Feb 2025)

Di Qiu, Zhengcong Fei, et al. Di Qiu, Zhengcong Fei, Rui Wang, Jialin Bai, Changqian Yu, Mingyuan Fan, Guibin Chen, Xiang Wen Paper Code Project_Page

  • AnyCharV: Bootstrap Controllable Character Video Generation with Fine-to-Coarse Guidance M (12 Feb 2025)

Zhao Wang, Hao Wen, et al. Zhao Wang, Hao Wen, Lingting Zhu, Chenming Shang, Yujiu Yang, Qi Dou Paper Code Project_Page

  • Animate Anyone 2: High-Fidelity Character Image Animation with Environment Affordance M (10 Feb 2025)

Li Hu, Guangyuan Wang, et al. Li Hu, Guangyuan Wang, Zhen Shen, Xin Gao, Dechao Meng, Lian Zhuo, Peng Zhang, Bang Zhang, Liefeng Bo Paper Project_Page

  • DirectorLLM for Human-Centric Video Generation (19 Dec 2024)

Kunpeng Song, Tingbo Hou, et al. Kunpeng Song, Tingbo Hou, Zecheng He, Haoyu Ma, Jialiang Wang, Animesh Sinha, Sam Tsai, Yaqiao Luo, Xiaoliang Dai, Li Chen, Xide Xia, Peizhao Zhang, Peter Vajda, Ahmed Elgammal, Felix Juefei-Xu Paper

  • Generative Inbetweening through Frame-wise Conditions-Driven Video Generation M (16 Dec 2024)

[CVPR 2025] Tianyi Zhu, Dongwei Ren, et al. Tianyi Zhu, Dongwei Ren, Qilong Wang, Xiaohe Wu, Wangmeng Zuo Paper Code Project_Page

  • DisPose: Disentangling Pose Guidance for Controllable Human Image Animation M (12 Dec 2024)

[ICLR2025] Hongxiang Li, Yaowei Li, et al. Hongxiang Li, Yaowei Li, Yuhang Yang, Junjie Cao, Zhihong Zhu, Xuxin Cheng, Long Chen Paper Code Project_Page

  • StableAnimator: High-Quality Identity-Preserving Human Image Animation M (26 Nov 2024)

[CVPR 2025] Shuyuan Tu, Zhen Xing, Xintong Han, et al. Shuyuan Tu, Zhen Xing, Xintong Han, Zhi-Qi Cheng, Qi Dai, Chong Luo, Zuxuan Wu Paper Code Project

  • AnimateAnywhere: Context-Controllable Human Video Generation with ID-Consistent One-shot Learning M (28 Oct 2024)

[ACMMM 2024] Hengyuan Liu, Xiaodong Chen, Xinchen Liu, et al. Hengyuan Liu, Xiaodong Chen, Xinchen Liu, Xiaoyan Gu, Wu Liu Paper

  • ControlNeXt: Powerful and Efficient Control for Image and Video Generation M (12 Aug 2024)

Bohao Peng, Jian Wang, et al. Bohao Peng, Jian Wang, Yuechen Zhang, Wenbo Li, Ming-Chang Yang, Jiaya Jia Paper Code Project_Page

  • TCAN: Animating Human Images with Temporally Consistent Pose Guidance using Diffusion Models M (12 Jul 2024)

Jeongho Kim, Min-Jung Kim, Junsoo Lee, et al. Jeongho Kim, Min-Jung Kim, Junsoo Lee, Jaegul Choo Paper Code Project

  • MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance M (28 Jun 2024)

Yuang Zhang, Jiaxi Gu, Li-Wen Wang, et al. Yuang Zhang, Jiaxi Gu, Li-Wen Wang, Han Wang, Junqi Cheng, Yuefeng Zhu, Fangyuan Zou Paper Code Project

  • Follow-Your-Pose v2: Multiple-Condition Guided Character Image Animation for Stable Pose Control M (05 Jun 2024)

Jingyun Xue, Hongfa Wang, Qi Tian, et al. Jingyun Xue, Hongfa Wang, Qi Tian, Yue Ma, Andong Wang, Zhiyuan Zhao, Shaobo Min, Wenzhe Zhao, Kaihao Zhang, Heung-Yeung Shum, Wei Liu, Mengyang Liu, Wenhan Luo Paper Project

  • UniAnimate: Taming Unified Video Diffusion Models for Consistent Human Image Animation M (3 Jun 2024)

Xiang Wang, Shiwei Zhang, Changxin Gao, et al. Xiang Wang, Shiwei Zhang, Changxin Gao, Jiayu Wang, Xiaoqiang Zhou, Yingya Zhang, Luxin Yan, Nong Sang Paper Code Project

  • VividPose: Advancing Stable Video Diffusion for Realistic Human Image Animation M (28 May 2024)

Qilin Wang, Zhengkai Jiang, Chengming Xu, et al. Qilin Wang, Zhengkai Jiang, Chengming Xu, Jiangning Zhang, Yabiao Wang, Xinyi Zhang, Yun Cao, Weijian Cao, Chengjie Wang, Yanwei Fu Paper Code Project

  • Disentangling Foreground and Background Motion for Enhanced Realism in Human Video Generation M (26 May 2024)

Jinlin Liu, Kai Yu, Mengyang Feng, et al. Jinlin Liu, Kai Yu, Mengyang Feng, Xiefan Guo, Miaomiao Cui Paper Project

  • PoseCrafter: One-Shot Personalized Video Synthesis Following Flexible Pose Control M (23 May 2024)

[ECCV 2024] Yong Zhong, Min Zhao, Zebin You, et al. Yong Zhong, Min Zhao, Zebin You, Xiaofeng Yu, Changwang Zhang, Chongxuan Li Paper Project

  • Zero-shot High-fidelity and Pose-controllable Character Animation M (21 Apr 2024)

[IJCAI 2024] Bingwen Zhu, Fanyi Wang, Tianyi Lu, et al. Bingwen Zhu, Fanyi Wang, Tianyi Lu, Peng Liu, Jingwen Su, Jinxiu Liu, Yanhao Zhang, Zuxuan Wu, Guo-Jun Qi, Yu-Gang Jiang Paper

  • Champ: Controllable and Consistent Human Image Animation with 3D Parametric Guidance M (21 Mar 2024)

[ECCV 2024] Shenhao Zhu, Junming Leo Chen, Zuozhuo Dai, et al. Shenhao Zhu, Junming Leo Chen, Zuozhuo Dai, Qingkun Su, Yinghui Xu, Xun Cao, Yao Yao, Hao Zhu, Siyu Zhu Paper Code Project

  • Do You Guys Want to Dance: Zero-Shot Compositional Human Dance Generation with Multiple Persons M (24 Jan 2024)

Zhe Xu, Kun Wei, et al. Zhe Xu, Kun Wei, Xu Yang, Cheng Deng Paper

  • DreaMoving: A Human Video Generation Framework based on Diffusion Models M (8 Dec 2023)

Mengyang Feng, Jinlin Liu, Kai Yu, et al. Mengyang Feng, Jinlin Liu, Kai Yu, Yuan Yao, Zheng Hui, Xiefan Guo, Xianhui Lin, Haolan Xue, Chen Shi, Xiaowen Li, Aojie Li, Xiaoyang Kang, Biwen Lei, Miaomiao Cui, Peiran Ren, Xuansong Xie Paper Code Project

  • Generative Rendering: Controllable 4D-Guided Video Generation with 2D Diffusion Models M (3 Dec 2023)

[CVPR 2024] Shengqu Cai, Duygu Ceylan, et al. Shengqu Cai, Duygu Ceylan, Matheus Gadelha, Chun-Hao Paul Huang, Tuanfeng Yang Wang, Gordon Wetzstein Paper Project_Page

  • Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation M (28 Nov 2023)

[CVPR 2024] Li Hu, Xin Gao, Peng Zhang, et al. Li Hu, Xin Gao, Peng Zhang, Ke Sun, Bang Zhang, Liefeng Bo Paper Code Project

  • MagicAnimate: Temporally Consistent Human Image Animation using Diffusion Model M (27 Nov 2023)

[CVPR 2024] Zhongcong Xu, Jianfeng Zhang, et al. Zhongcong Xu, Jianfeng Zhang, Jun Hao Liew, Hanshu Yan, Jia-Wei Liu, Chenxu Zhang, Jiashi Feng, Mike Zheng Shou Paper Code Project_Page

  • MagicPose: Realistic Human Poses and Facial Expressions Retargeting with Identity-aware Diffusion M (18 Nov 2023)

[ICML 2024] Di Chang, Yichun Shi, Quankai Gao, et al. Di Chang, Yichun Shi, Quankai Gao, Jessica Fu, Hongyi Xu, Guoxian Song, Qing Yan, Yizhe Zhu, Xiao Yang, Mohammad Soleymani Paper Code Project_Page

  • Dancing Avatar: Pose and Text-Guided Human Motion Videos Synthesis with Image Diffusion Model (15 Aug 2023)

Bosheng Qin, Wentao Ye, et al. Bosheng Qin, Wentao Ye, Qifan Yu, Siliang Tang, Yueting Zhuang Paper

  • DISCO: Disentangled Control for Realistic Human Dance Generation M (30 Jun 2023)

[CVPR 2024] Tan Wang, Linjie Li, Kevin Lin, et al. Tan Wang, Linjie Li, Kevin Lin, Yuanhao Zhai, Chung-Ching Lin, Zhengyuan Yang, Hanwang Zhang, Zicheng Liu, Lijuan Wang Paper Code Project

  • DreamPose: Fashion Image-to-Video Synthesis via Stable Diffusion M (12 Apr 2023)

[ICCV 2023] Johanna Karras, Aleksander Holynski, Ting-Chun Wang, et al. Johanna Karras, Aleksander Holynski, Ting-Chun Wang, Ira Kemelmacher-Shlizerman Paper Code Project

  • Follow Your Pose: Pose-Guided Text-to-Video Generation using Pose-Free Videos (3 Apr 2023)

[AAAI 2024] Yue Ma, Yingqing He, et al. Yue Ma, Yingqing He, Xiaodong Cun, Xintao Wang, Siran Chen, Ying Shan, Xiu Li, Qifeng Chen Paper Code Project_Page

  • vid2vid:Video-to-Video SynthesisM (3 Dec 2018)

Ting-Chun Wang, Ming-Yu Liu, Jun-Yan Zhu, et al. Ting-Chun Wang, Ming-Yu Liu, Jun-Yan Zhu, Guilin Liu, Andrew Tao, Jan Kautz, Bryan Catanzaro Paper Code Project

📏 Depth-Guided

  • Frame Guidance: Training-Free Guidance for Frame-Level Control in Video Diffusion Models M (8 Jun 2025)

Sangwon Jang, Taekyung Ki, Jaehyeong Jo, et al.

     Sangwon Jang, Taekyung Ki, Jaehyeong Jo, Jaehong Yoon, Soo Ye Kim, Zhe Lin, Sung Ju Hwang

Paper Code Project_Page

  • OmniVDiff: Omni Controllable Video Diffusion for Generation and Understanding M (15 Apr 2025)

Dianbing Xi, Jiepeng Wang, Yuanzhi Liang, et al.

Xi Qiu, Yuchi Huo, Rui Wang, Chi Zhang, Xuelong Li

Paper Code Project_Page

  • DreamDance: Animating Human Images by Enriching 3D Geometry Cues from 2D Poses M (30 Nov 2024)

Yatian Pang, Bin Zhu, Bin Lin, et al.

    Mingzhe Zheng, Francis E. H. Tay, Ser-Nam Lim, Harry Yang, Li Yuan 

Paper Code Project_Page

  • ControlNeXt: Powerful and Efficient Control for Image and Video Generation M (12 Aug 2024)

Bohao Peng, Jian Wang, Yuechen Zhang, et al.

    Wenbo Li, Ming-Chang Yang, Jiaya Jia

Paper Code Project_Page

  • Champ: Controllable and Consistent Human Image Animation with 3D Parametric Guidance M (21 Mar 2024)

[ECCV 2024] Shenhao Zhu, Junming Leo Chen, Zuozhuo Dai, et al.

  Qingkun Su, Yinghui Xu, Xun Cao, Yao Yao, Hao Zhu, Siyu Zhu

Paper Code Project_Page

  • MoonShot: Towards Controllable Video Generation and Editing with Multimodal Conditions M (3 Jan 2024)

David Junhao Zhang, Dongxu Li, Hung Le, et al.

  Mike Zheng Shou, Caiming Xiong, Doyen Sahoo

Paper Code Project_Page

  • SparseCtrl: Adding Sparse Controls to Text-to-Video Diffusion Models (28 Nov 2023)

[ECCV 2024] Yuwei Guo, Ceyuan Yang, Anyi Rao, et al.

    Maneesh Agrawala, Dahua Lin, Bo Dai

Paper Code Project_Page

  • GD-VDM: Generated Depth for better Diffusion-based Video Generation (19 Jun 2023)

Ariel Lapid, Idan Achituve, Lior Bracha, et al.

    Ethan Fetaya

Paper Code

  • Make-Your-Video: Customized Video Generation Using Textual and Structural Guidance M (1 Jun 2023)

[IEEE TVCG 2024] Jinbo Xing, Menghan Xia, Yuxin Liu, et al.

    Yuechen Zhang, Yong Zhang, Yingqing He, Hanyuan Liu, Haoxin Chen, Xiaodong Cun, Xintao Wang, Ying Shan, Tien-Tsin Wong

Paper Code Project_Page

  • Control-A-Video: Controllable Text-to-Video Diffusion Models with Motion Prior and Reward Feedback Learning M (23 May 2023)

Weifeng Chen, Yatai Ji, Jie Wu, et al.

    Hefeng Wu, Pan Xie, Jiashi Li, Xin Xia, Xuefeng Xiao, Liang Lin

Paper Code Project_Page

  • ControlVideo: Training-free Controllable Text-to-Video Generation (22 May 2023)

[ICLR 2024] Yabo Zhang, Yuxiang Wei, Dongsheng Jiang, et al.

  Xiaopeng Zhang, Wangmeng Zuo, Qi Tian

Paper Code Project_Page

🗺️ Landmark-Guided

  • HunyuanPortrait: Implicit Condition Control for Enhanced Portrait Animation M (24 Mar 2024)

[CVPR 2025] Zunnan Xu, Zhentao Yu, et al.

    Zunnan Xu, Zhentao Yu, Zixiang Zhou, Jun Zhou, Xiaoyu Jin, Fa-Ting Hong, Xiaozhong Ji, Junwei Zhu, Chengfei Cai, Shiyu Tang, Qin Lin, Xiu Li, Qinglin Lu 

Paper Code Project_Page

  • TASTE-Rob: Advancing Video Generation of Task-Oriented Hand-Object Interaction for Generalizable Robotic Manipulation M (14 Mar 2025)

Hongxiang Zhao, Xingchen Liu, et al.

    Hongxiang Zhao, Xingchen Liu, Mutian Xu, Yiming Hao, Weikai Chen, Xiaoguang Han 

Paper Project_Page

  • Identity-Preserving Text-to-Video Generation by Frequency Decomposition M (26 Nov 2024)

[CVPR 2025] Shenghai Yuan, Jinfa Huang, et al.

    Shenghai Yuan, Jinfa Huang, Xianyi He, Yunyuan Ge, Yujun Shi, Liuhan Chen, Jiebo Luo, Li Yuan 

Paper Code Project_Page

  • EchoMimicV2: Towards Striking, Simplified, and Semi-Body Human Animation M (15 Nov 2024)

[CVPR 2025] Rang Meng, Xingyu Zhang, Yuming Li, et al.

Chenguang Ma

Paper Project_Page Code

  • Takin-ADA: Emotion Controllable Audio-Driven Animation with Canonical and Landmark Loss Optimization M (18 Oct 2024)

Bin Lin, Yanzhen Yu, et al.

    Bin Lin, Yanzhen Yu, Jianhao Ye, Ruitao Lv, Yuguang Yang, Ruoye Xie, Pan Yu, Hongbin Zhou 

Paper Project_Page

  • EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions M (12 Jul 2024)

[AAAI 2025] Zhiyuan Chen, Jiajiong Cao, Zhiquan Chen, et al.

Yuming Li, Chenguang Ma

Paper Project_Page Code Demo

  • LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control M (3 Jul 2024)

Jianzhu Guo, Dingyun Zhang, et al.

    Jianzhu Guo, Dingyun Zhang, Xiaoqiang Liu, Zhizhou Zhong, Yuan Zhang, Pengfei Wan, Di Zhang 

Paper Code Project_Page

  • Follow-Your-Emoji: Fine-Controllable and Expressive Freestyle Portrait Animation M (4 Jun 2024)

[Siggraph Asia 2024] Yue Ma, Hongyu Liu, et al.

    Yue Ma, Hongyu Liu, Hongfa Wang, Heng Pan, Yingqing He, Junkun Yuan, Ailing Zeng, Chengfei Cai, Heung-Yeung Shum, Wei Liu, Qifeng Chen 

Paper Code Project_Page

  • Follow Your Pose: Pose-Guided Text-to-Video Generation using Pose-Free Videos (3 Apr 2023)

[AAAI 2024] Yue Ma, Yingqing He, et al.

    Yue Ma, Yingqing He, Xiaodong Cun, Xintao Wang, Siran Chen, Ying Shan, Xiu Li, Qifeng Chen 

Paper Code Project_Page

✏️ Sketch-Guided

  • Frame Guidance: Training-Free Guidance for Frame-Level Control in Video Diffusion Models M (8 Jun 2025)

Sangwon Jang, Taekyung Ki, Jaehyeong Jo, et al.

     Sangwon Jang, Taekyung Ki, Jaehyeong Jo, Jaehong Yoon, Soo Ye Kim, Zhe Lin, Sung Ju Hwang

Paper Code Project_Page

  • OmniVDiff: Omni Controllable Video Diffusion for Generation and Understanding (15 Apr 2025)

Dianbing Xi, Jiepeng Wang, Yuanzhi Liang, et al.

Xi Qiu, Yuchi Huo, Rui Wang, Chi Zhang, Xuelong Li

Paper Code Project_Page

  • SketchVideo: Sketch-based Video Generation and Editing M (30 Mar 2025)

Feng-Lin Liu, Hongbo Fu, Xintao Wang, et al. Feng-Lin Liu, Hongbo Fu, Xintao Wang, Weicai Ye, Pengfei Wan, Di Zhang, Lin Gao

Paper Code

  • LayerAnimate: Layer-level Control for Animation M (22 Mar 2025)

Yuxue Yang, Lue Fan, Zuzeng Lin, et al. Feng Wang, Zhaoxiang Zhang

Paper Project_Page Code Demo

  • CameraCtrl II: Dynamic Scene Exploration via Camera-controlled Video Diffusion Models M (13 Mar 2025)

Hao He, Ceyuan Yang, Shanchuan Lin, et al. Yinghao Xu, Meng Wei, Liangke Gui, Qi Zhao, Gordon Wetzstein, Lu Jiang, Hongsheng Li

Paper Code Project_Page

  • CameraCtrl: Enabling Camera Control for Text-to-Video Generation M (13 Mar 2025)

[ICLR 2025] Hao He, Yinghao Xu, Yuwei Guo, et al. Gordon Wetzstein, Bo Dai, Hongsheng Li, Ceyuan Yang

Paper Project_Page Code Demo

  • VidSketch: Hand-drawn Sketch-Driven Video Generation with Diffusion Control M (17 Feb 2025)

Lifan Jiang, Shuang Chen, Boxi Wu, et al. Xiaotong Guan, Jiahui Zhang

Paper Project_Page Code

  • AniDoc: Animation Creation Made Easier M (30 Jan 2025)

[CVPR 2025] Yihao Meng, Hao Ouyang, Hanlin Wang, et al. Qiuyu Wang, Wen Wang, Ka Leong Cheng, Zhiheng Liu, Yujun Shen, Huamin Qu

Paper Project_Page Code

  • Latent-Reframe: Enabling Camera Control for Video Diffusion Model without Training M (8 Dec 2024)

Zhenghong Zhou, Jie An, Jiebo Luo, et al.

Paper Project_Page

  • CamI2V: Camera-Controlled Image-to-Video Diffusion Model M (4 Dec 2024)

Guangcong Zheng, Teng Li, Rui Jiang, et al. Yehao Lu, Tao Wu, Xi Li

Paper Code Project_Page

  • Motion Prompting: Controlling Video Generation with Motion Trajectories(frame+track+text) M (3 Dec 2024)

Daniel Geng, Charles Herrmann, Junhwa Hur, et al. Forrester Cole, Serena Zhang, Tobias Pfaff, Tatiana Lopez-Guevara, Carl Doersch, Yusuf Aytar, Michael Rubinstein, Chen Sun, Oliver Wang, Andrew Owens, Deqing Sun

Paper Code Project_Page

  • MOTIONFLOW: Learning Implicit Motion Flow for Complex Camera Trajectory Control in Video Generation M (Dec 2024)

Author list not fully provided

Paper Code Project_Page

  • I2VControl: Disentangled and Unified Video Motion Synthesis Control M (30 Nov 2024)

Zhiyuan Zhang, Dongdong Chen, Jing Liao

Paper Project_Page

  • Trajectory Attention: Enhancing Video Generation with Fine-Grained Motion Control M (28 Nov 2024)

Zeqi Xiao, Wenqi Ouyang, Yifan Zhou, et al. Shuai Yang, Lei Yang, Jianlou Si, Xingang Pan

Paper Code Project_Page

  • Open-Sora Plan: Open-Source Large Video Generation Model M (28 Nov 2024)

Bin Lin, Yunyang Ge, Xinhua Cheng, et al. Zongjian Li, Bin Zhu, Shaodong Wang, Xianyi He, Yang Ye, Shenghai Yuan, Liuhan Chen, Tanghui Jia, Junwu Zhang, Zhenyu Tang, Yatian Pang, Bin She, Cen Yan, Zhiheng Hu, Xiaoyi Dong, Lin Chen, Zhang Pan, Xing Zhou, Shaoling Dong, Yonghong Tian, Li Yuan

Paper Code

  • ToonCrafter: Generative Cartoon Interpolation M (19 Nov 2024)

[ACM TOG] Jinbo Xing, Hanyuan Liu, Menghan Xia, et al. Yong Zhang, Xintao Wang, Ying Shan, Tien-Tsin Wong

Paper Project_Page Code Demo

  • MagicStick: Controllable Video Editing via Control Handle Transformations M (18 Nov 2024)

[WACV 2025] Yue Ma, Xiaodong Cun, Sen Liang, et al. Jinbo Xing, Yingqing He, Chenyang Qi, Siran Chen, Qifeng Chen

Paper Project_Page

  • Video Diffusion Models are Training-free Motion Interpreter and Controller M (12 Nov 2024)

Zeqi Xiao, Yifan Zhou, Shuai Yang, Xingang Pan, et al.

Paper Code Project_Page

  • DimensionX: Create Any 3D and 4D Scenes from a Single Image with Controllable Video Diffusion M (7 Nov 2024)

Wenqiang Sun, Shuo Chen, Fangfu Liu, et al. Zilong Chen, Yueqi Duan, Jun Zhang, Yikai Wang

Paper Code Project_Page

  • MotionClone: Training-Free Motion Cloning for Controllable Video Generation M (22 Oct 2024)

Pengyang Ling, Jiazi Bu, Pan Zhang, et al. Xiaoyi Dong, Yuhang Zang, Tong Wu, Huaian Chen, Jiaqi Wang, Yi Jin

Paper Project_Page Code

  • Boosting Camera Motion Control for Video Diffusion Transformers M (14 Oct 2024)

Soon Yau Cheong, Duygu Ceylan, Armin Mustafa, et al. Andrew Gilbert, Chun-Hao Paul Huang

Paper Code Project_Page

  • Cavia: Camera-controllable Multi-view Video Diffusion with View-Integrated Attention M (14 Oct 2024)

Dejia Xu, Yifan Jiang, Chen Huang, et al. Liangchen Song, Thorsten Gernoth, Liangliang Cao, Zhangyang Wang, Hao Tang

Paper Project_Page

  • LVCD: Reference-based Lineart Video Colorization with Diffusion Models M (19 Sep 2024)

Zhitong Huang, Mohan Zhang, Jing Liao

Paper Project_Page Code

  • EasyControl: Transfer ControlNet to Video Diffusion for Controllable Generation and Interpolation M (16 Sep 2024)

Cong Wang, Jiaxi Gu, Panwen Hu, et al. Haoyu Zhao, Yuanfan Guo, Jianhua Han, Hang Xu, Xiaodan Liang

Paper

  • ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis M (3 Sep 2024)

Wangbo Yu, Jinbo Xing, Li Yuan, et al. Wenbo Hu, Xiaoyu Li, Zhipeng Huang, Xiangjun Gao, Tien-Tsin Wong, Ying Shan, Yonghong Tian

Paper Code Project_Page

  • VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control M (17 Jul 2024)

Sherwin Bahmani, Ivan Skorokhodov, Aliaksandr Siarohin, et al. Sherwin Bahmani, Ivan Skorokhodov, Aliaksandr Siarohin, Willi Menapace, Guocheng Qian, Michael Vasilkovsky, Hsin-Ying Lee, Chaoyang Wang, Jiaxu Zou, Andrea Tagliasacchi, David B. Lindell, Sergey Tulyakov

Paper Code Project_Page

  • MotionCtrl: A Unified and Flexible Motion Controller for Video Generation M (16 Jul 2024)

Zhouxia Wang, Ziyang Yuan, Xintao Wang, et al. Zhouxia Wang, Ziyang Yuan, Xintao Wang, Tianshui Chen, Menghan Xia, Ping Luo, Ying Shan

Paper Project Page Code

  • Ctrl-Adapter: An Efficient and Versatile Framework for Adapting Diverse Controls to Any Diffusion Model M (24 May 2024)

[ICLR 2025] Han Lin, Jaemin Cho, Abhay Zala, et al. Mohit Bansal

Paper Project_Page Code

  • A Recipe for Scaling up Text-to-Video Generation with Text-free Videos (25 Dec 2023)

[CVPR 2024] Xiang Wang, Shiwei Zhang, Hangjie Yuan, et al.

Zhiwu Qing, Biao Gong, Yingya Zhang, Yujun Shen, Changxin Gao, Nong Sang

Paper Project_Page Code

  • VideoLCM: Video Latent Consistency Model M (14 Dec 2023)

Xiang Wang, Shiwei Zhang, Han Zhang, et al. Yu Liu, Yingya Zhang, Changxin Gao, Nong Sang

Paper

  • SparseCtrl: Adding Sparse Controls to Text-to-Video Diffusion Models M (28 Nov 2023)

Yuwei Guo, Ceyuan Yang, Anyi Rao, et al. Maneesh Agrawala, Dahua Lin, Bo Dai

Paper Project_Page Code

  • Make Pixels Dance: High-Dynamic Video Generation (18 Nov 2023)

[CVPR 2024] Yan Zeng, Guoqiang Wei, Jiani Zheng, et al.

Jiaxin Zou, Yang Wei, Yuchen Zhang, Hang Li

Paper Project_Page Demo

  • TaleCrafter: Interactive Story Visualization with Multiple Characters M (30 May 2023)

[SIGGRAPH Asia 2023] Yuan Gong, Youxin Pang, Xiaodong Cun, et al. Menghan Xia, Yingqing He, Haoxin Chen, Longyue Wang, Yong Zhang, Xintao Wang, Ying Shan, Yujiu Yang

Paper Project_Page Code

  • Sketching the Future(STF): Applying Conditional Control Techniques to Text-to-Video Models M (10 May 2023)

Rohan Dhesikan, Vignesh Rajmohan

Paper Project_Page Code Demo

  • SketchBetween: Video-to-Video Synthesis for Sprite Animation via Sketches (1 Sep 2022)

Dagmar Lukka Loftsdóttir, Matthew Guzdial

Paper Code

  • Sketch Me A Video (10 Oct 2021)

Haichao Zhang, Gang Yu, Tao Chen, et al. Haichao Zhang, Gang Yu, Tao Chen, Guozhong Luo

Paper

  • vid2vid:Video-to-Video SynthesisM (3 Dec 2018)

Ting-Chun Wang, Ming-Yu Liu, Jun-Yan Zhu, et al. Ting-Chun Wang, Ming-Yu Liu, Jun-Yan Zhu, Guilin Liu, Andrew Tao, Jan Kautz, Bryan Catanzaro Paper Code Project

📦 BBox-Guided

  • HoloDrive: Holistic 2D-3D Multi-Modal Street Scene Generation for Autonomous Driving M (02 Dec 2024)

Zehuan Wu, Jingcheng Ni, Xiaodong Wang, et al.

Zehuan Wu, Jingcheng Ni, Xiaodong Wang, Yuxin Guo, Rui Chen, Lewei Lu, Jifeng Dai, Yuwen Xiong

Paper

  • Higher fidelity autonomous vehicle video generation with bounding-box controlled object motion M (8 Dec 2024 )

Ge Ya Luo, Zhi Hao Luo, et al.

Ge Ya Luo, Zhi Hao Luo, Anthony Gosselin, Alexia Jolicoeur-Martineau, Christopher Pal

Paper Code

  • MagicDrive-V2: High-Resolution Long Video Generation for Autonomous Driving with Adaptive Control M (21 Nov 2024)

Ruiyuan Gao, Kai Chen, Bo Xiao, et al.

Ruiyuan Gao, Kai Chen, Bo Xiao, Lanqing Hong, Zhenguo Li, Qiang Xu

Paper Code Project

  • DreamForge: Motion-Aware Autoregressive Video Generation for Multi-View Driving Scenes M (06 Sep 2024)

Jianbiao Mei, Tao Hu, Xuemeng Yang, et al.

Jianbiao Mei, Tao Hu, Xuemeng Yang, Licheng Wen, Yu Yang, Tiantian Wei, Yukai Ma, Min Dou, Botian Shi, Yong Liu

Paper Code Project

  • DriveScape: Towards High-Resolution Controllable Multi-View Driving Video Generation M (09 Sep 2024)

Wei Wu, Xi Guo, Weixuan Tang, et al.

Wei Wu, Xi Guo, Weixuan Tang, Tingxuan Huang, Chiyu Wang, Dongyue Chen, Chenjing Ding

Paper Project

  • DriveScape: Towards High-Resolution Controllable Multi-View Driving Video Generation M (09 Sep 2024)

Wei Wu, Xi Guo, Weixuan Tang, et al.

Wei Wu, Xi Guo, Weixuan Tang, Tingxuan Huang, Chiyu Wang, Dongyue Chen, Chenjing Ding

Paper

  • DiVE: DiT-based Video Generation with Enhanced Control M (03 Sep 2024)

Junpeng Jiang, Gangyi Hong, Lijun Zhou, et al.

Junpeng Jiang, Gangyi Hong, Lijun Zhou, Enhui Ma, Hengtong Hu, Xia Zhou, Jie Xiang, Fan Liu, Kaicheng Yu, Haiyang Sun, Kun Zhan, Peng Jia, Miao Zhang

Paper Code Project

  • Unleashing Generalization of End-to-End Autonomous Driving with Controllable Long Video Generation M (3 Jun 2024)

Enhui Ma, Lijun Zhou, Tao Tang, et al.

Enhui Ma, Lijun Zhou, Tao Tang, Zhan Zhang, Dong Han, Junpeng Jiang, Kun Zhan, Peng Jia, Xianpeng Lang, Haiyang Sun, Di Lin, Kaicheng Yu

Paper Code Project

  • Boximator: Generating Rich and Controllable Motions for Video Synthesis M (2 Feb 2024)

Jiawei Wang, Yuchen Zhang, Jiaxin Zou, et al. Yan Zeng, Guoqiang Wei, Liping Yuan, Hang Li

Paper Project_Page

  • Panacea: Panoramic and Controllable Video Generation for Autonomous Driving M (28 Nov 2023)

Yuqing Wen, Yucheng Zhao, Yingfei Liu, et al.

Yuqing Wen, Yucheng Zhao, Yingfei Liu, Fan Jia, Yanhui Wang, Chong Luo, Chi Zhang, Tiancai Wang, Xiaoyan Sun, Xiangyu Zhang

Paper Code Project

  • MagicDrive: Street View Generation with Diverse 3D Geometry Control M (04 Oct 2023)

Ruiyuan Gao, Kai Chen, Enze Xie, et al.

Ruiyuan Gao, Kai Chen, Enze Xie, Lanqing Hong, Zhenguo Li, Dit-Yan Yeung, Qiang Xu

Paper Code Project

  • DriveDreamer: Towards Real-world-driven World Models for Autonomous Driving M (18 Sep 2023)

Xiaofeng Wang, Zheng Zhu, Guan Huang, et al.

Xiaofeng Wang, Zheng Zhu, Guan Huang, Xinze Chen, Jiagang Zhu, Jiwen Lu

Paper Code Project

  • LLM-grounded Video Diffusion Models (29 Sep 2023)

Long Lian, Baifeng Shi, Adam Yala, et al.

Long Lian, Baifeng Shi, Adam Yala, Trevor Darrell, Boyi Li

Paper Code Project

  • Multi-object Video Generation from Single Frame Layouts M (06 May 2023)

Yang Wu, Zhibin Liu, Hefeng Wu, et al.

Yang Wu, Zhibin Liu, Hefeng Wu, Liang Lin

Paper

🧬 ID Control

🧑 Person-Guided

  • DanceTogether! Identity-Preserving Multi-Person Interactive Video GenerationM (23 May 2025)

Junhao Chen, Mingjin Chen, Jianjin Xu, et al.

     Junhao Chen, Mingjin Chen, Jianjin Xu, Xiang Li, Junting Dong, Mingze Sun, Puhua Jiang, Hongxiang Li, Yuhang Yang, Hao Zhao, Xiaoxiao Long, Ruqi Huang

Paper

  • MTVCrafter: 4D Motion Tokenization for Open-World Human Image AnimationM(30 May 2025)

Yanbo Ding, Xirui Hu, Zhizhi Guo, et al.

     Yanbo Ding, Xirui Hu, Zhizhi Guo, Chi Zhang, Yali Wang

Paper Code Project

  • Frame In-N-Out: Unbounded Controllable Image-to-Video Generation (27 May 2025)

Boyang Wang, Xuweiyi Chen, Matheus Gadelha, et al. Boyang Wang, Xuweiyi Chen, Matheus Gadelha, Zezhou Cheng

Paper Code Project

  • SkyReels-A2: Compose Anything in Video Diffusion TransformersM (3 Apr 2025)

Zhengcong Fei, Debang Li, Di Qiu, et al.

   Zhengcong Fei, Debang Li, Di Qiu, Jiahua Wang, Yikun Dou, Rui Wang, Jingtao Xu, Mingyuan Fan, Guibin Chen, Yang Li, Yahui Zhou

Paper Code Project_Page

  • AnimateAnywhere: Rouse the Background in Human Image AnimationM (28 Apr 2025)

Xiaoyu Liu, Mingshuai Yao, Yabo Zhang, et al.

     Xiaoyu Liu, Mingshuai Yao, Yabo Zhang, Xianhui Lin, Peiran Ren, Xiaoming Li, Ming Liu, Wangmeng Zuo

Paper

  • Concat-ID: Towards Universal Identity-Preserving Video SynthesisM (19 Apr 2025)

Yong Zhong, Zhuoyi Yang, Jiayan Teng, et al.

     Yong Zhong, Zhuoyi Yang, Jiayan Teng, Xiaotao Gu, Chongxuan Li

Paper Code

  • PERSONALVIDEO: High ID-Fidelity Video Customization with Static Images (16 Mar 2025)

Hengjia Li, Haonan Qiu, Shiwei Zhang, Xiang Wang, et al.

     Hengjia Li, Haonan Qiu, Shiwei Zhang, Xiang Wang, Yujie Wei, Zekun Li, Yingya Zhang, Boxi Wu, Deng Cai

Paper

  • AnyCharV: Bootstrap Controllable Character Video Generation with Fine-to-Coarse Guidance M(12 Feb 2025)

Zhao Wang, Hao Wen, Lingting Zhu, et al.

     Zhao Wang, Hao Wen, Lingting Zhu, Chenming Shang, Yujiu Yang, Qi Dou

Paper Code Project_Page

  • Movie Weaver: Tuning-Free Multi-Concept Video Personalization with Anchored Prompts (4 Feb 2025)

Feng Liang, Haoyu Ma, Zecheng He, et al.

     Feng Liang, Haoyu Ma, Zecheng He, Tingbo Hou, Ji Hou, Kunpeng Li, Xiaoliang Dai, Felix Juefei-Xu, Samaneh Azadi, Animesh Sinha, Peizhao Zhang, Peter Vajda, Diana Marculescu

Paper

  • EchoVideo: Identity-Preserving Human Video Generation by Multimodal Feature Fusion (23 Jan 2025)

Jiangchuan Wei, Shiyue Yan, Wenfeng Lin, et al.

     Jiangchuan Wei, Shiyue Yan, Wenfeng Lin, Boyuan Liu, Renjie Chen, Mingyu Guo

Paper Code

  • VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention (03 Dec 2024)

Mingzhe Zheng, Yongqi Xu, Haojian Huang, et al.

    Mingzhe Zheng, Yongqi Xu, Haojian Huang, Xuran Ma, Yexin Liu, Wenjie Shu, Yatian Pang, Feilong Tang, Qifeng Chen, Harry Yang, Ser-Nam Lim

  [![Paper](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2412.02259)
  [![Code](https://img.shields.io/github/stars/DuNGEOnmassster/VideoGen-of-Thought.svg?style=social&label=Star)](https://github.com/DuNGEOnmassster/VideoGen-of-Thought)
  [![Project](https://img.shields.io/badge/Project_Page-00CED1)](https://cheliosoops.github.io/VGoT/)
  • Identity-Preserving Text-to-Video Generation by Frequency Decomposition (25 Nov 2024)

Shenghai Yuan, Jinfa Huang, et al.

    Shenghai Yuan, Jinfa Huang, Xianyi He, Yunyuan Ge, Yujun Shi, Liuhan Chen, Jiebo Luo, Li Yuan

Paper Code Project

  • MIMO: Controllable Character Video Synthesis with Spatial Decomposed ModelingM (24 Sep 2024)

Yifang Men, Yuan Yao, Miaomiao Cui, et al.

    Yifang Men, Yuan Yao, Miaomiao Cui, Liefeng Bo

    [![Paper](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2409.16160)
    [![Code](https://img.shields.io/github/stars/menyifang/MIMO.svg?style=social&label=Star)](https://github.com/menyifang/MIMO)
    [![Project](https://img.shields.io/badge/Project_Page-00CED1)](https://menyifang.github.io/projects/MIMO/index.html)
  • ID-Animator: Zero-Shot Identity-Preserving Human Video Generation (25 Jun 2024)

Xuanhua He, Quande Liu, et al.

     Xuanhua He, Quande Liu, Shengju Qian, Xin Wang, Tao Hu, Ke Cao, Keyu Yan, Jie Zhang

Paper GitHub Project

  • Magic-Me: Identity-Specific Video Customized Diffusion (14 Feb 2024)

Ze Ma, Daquan Zhou, Chun-Hsiao Yeh, et al.

    Ze Ma, Daquan Zhou, Chun-Hsiao Yeh, Xue-She Wang, Xiuyu Li, Huanrui Yang, Zhen Dong, Kurt Keutzer, Jiashi Feng

    [![Paper](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2402.09368)
    [![Code](https://img.shields.io/github/stars/Zhen-Dong/Magic-Me.svg?style=social&label=Star)](https://github.com/Zhen-Dong/Magic-Me)
  • Vlogger: Make Your Dream A Vlog (17 Jan 2024)

Shaobin Zhuang, Kunchang Li, Xinyuan Chen, et al.

    Shaobin Zhuang, Kunchang Li, Xinyuan Chen, Yaohui Wang, Ziwei Liu, Yu Qiao, Yali Wang

    [![Paper](https://img.shields.io/badge/arXiv-b31b1b.svg)](https://arxiv.org/abs/2401.09414)
    [![Code](https://img.shields.io/github/stars/zhuangshaobin/Vlogger.svg?style=social&label=Star)](https://github.com/zhuangshaobin/Vlogger)

🧑‍🤝‍🧑 Subject-Guided

  • DualReal: Joint Training for Lossless Identity-Motion Fusion in Video CustomizationM (4 May 2025)

Wenchuan Wang, Mengqi Huang, Yijing Tu, et al.

     Wenchuan Wang, Mengqi Huang, Yijing Tu, Zhendong Mao

Paper

  • Concat-ID: Towards Universal Identity-Preserving Video SynthesisM (19 Apr 2025)

Yong Zhong, Zhuoyi Yang, Jiayan Teng, et al.

     Yong Zhong, Zhuoyi Yang, Jiayan Teng, Xiaotao Gu, Chongxuan Li

Paper Code

  • VideoMage: Multi-Subject and Motion Customization of Text-to-Video Diffusion ModelsM (27 Mar 2025)

Chi-Pin Huang, Yen-Siang Wu, Hung-Kai Chung, et al.

     Chi-Pin Huang, Yen-Siang Wu, Hung-Kai Chung, Kai-Po Chang, Fu-En Yang, Yu-Chiang Frank Wang

Paper Project

  • DreamRelation: Relation-Centric Video Customization (10 Mar 2025)

Yujie Wei, Shiwei Zhang, Hangjie Yuan, et al.

     Yujie Wei, Shiwei Zhang, Hangjie Yuan, Biao Gong, Longxiang Tang, Xiang Wang, Haonan Qiu, Hengjia Li, Shuai Tan, Yingya Zhang, Hongming Shan

Paper

  • Get In Video: Add Anything You Want to the Video (8 Mar 2025)

Shaobin Zhuang, Zhipeng Huang, Binxin Yang, et al.

     Shaobin Zhuang, Zhipeng Huang, Binxin Yang, Ying Zhang, Fangyikang Wang, Canmiao Fu, Chong Sun, Zheng-Jun Zha, Chen Li, Yali Wang

Paper

  • Phantom: Subject-consistent Video Generation via Cross-modal Alignment (16 Feb 2025)

Lijie Liu, Tianxiang Ma, Bingchuan Li, et al.

     Lijie Liu, Tianxiang Ma, Bingchuan Li, Zhuowei Chen, Jiawei Liu, Qian He, Xinglong Wu

Paper Code Project_Page

  • Multi-subject Open-set Personalization in Video Generation (10 Jan 2025)

Tsai-Shien Chen, Aliaksandr Siarohin, Willi Menapace, et al.

     Tsai-Shien Chen, Aliaksandr Siarohin, Willi Menapace, Yuwei Fang, Kwot Sin Lee, Ivan Skorokhodov, Kfir Aberman, Jun-Yan Zhu, Ming-Hsuan Yang, Sergey Tulyakov

Paper
Code
Project_Page

  • ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning (8 Jan 2025)

Yuzhou Huang, Ziyang Yuan, Quande Liu, et al.

     Yuzhou Huang, Ziyang Yuan, Quande Liu, Qiulin Wang, Xintao Wang, Ruimao Zhang, Pengfei Wan, Di Zhang, Kun Gai

Paper Project_Page

  • VideoMaker: Zero-shot Customized Video Generation with the Inherent Force of Video Diffusion Models (27 Dec 2024)

Tao Wu, Yong Zhang, Xiaodong Cun, et al.

     Tao Wu, Yong Zhang, Xiaodong Cun, Zhongang Qi, Junfu Pu, Huanzhang Dou, Guangcong Zheng, Ying Shan, Xi Li

Paper Code Project_Page

  • Customcrafter: Customized Video Generation with Preserving Motion and Concept Composition Abilities (27 Dec 2024)

Tao Wu, Yong Zhang, Xintao Wang, et al.

     Tao Wu, Yong Zhang, Xintao Wang, Xianpan Zhou, Guangcong Zheng, Zhongang Qi, Ying Shan, Xi Li

Paper Code Project_Page

  • CustomTTT: Motion and Appearance Customized Video Generation via Test-Time Training (20 Dec 2024)

Xiuli Bi, Jian Lu, Bo Liu, et al.

     Xiuli Bi, Jian Lu, Bo Liu, Xiaodong Cun, Yong Zhang, Weisheng Li, Bin Xiao

Paper Code

  • SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner (13 Dec 2024)

Yufan Zhou, Ruiyi Zhang, Jiuxiang Gu, et al.

     Yufan Zhou, Ruiyi Zhang, Jiuxiang Gu, Nanxuan Zhao, Jing Shi, Tong Sun

Paper

  • DreamRunner: Fine-Grained Compositional Story-to-Video Generation with Retrieval-Augmented Motion Adaptation (25 Nov 2024)

Zun Wang, Jialu Li, Han Lin, et al.

     Zun Wang, Jialu Li, Han Lin, Jaehong Yoon, Mohit Bansal

Paper Code Project_Page

  • VideoAlchemy: Open-set Personalization in Video Generation (15 Nov 2024)

Tsai-Shien Chen, Aliaksandr Siarohin, et al.

     Tsai-Shien Chen, Aliaksandr Siarohin, Willi Menapace, Yuwei Fang, Ivan Skorokhodov, Jun-Yan Zhu, Kfir Aberman, Ming-Hsuan Yang, Sergey Tulyakov

Paper

  • StoryAgent: Customized Storytelling Video Generation via Multi-Agent Collaboration (7 Nov 2024)

Panwen Hu, Jin Jiang, Jianqi Chen, et al.

     Panwen Hu, Jin Jiang, Jianqi Chen, Mingfei Han, Shengcai Liao, Xiaojun Chang, Xiaodan Liang

Paper

  • MotionBooth: Motion-Aware Customized Text-to-Video Generation (29 Oct 2024)

Jianzong Wu, Xiangtai Li, Yanhong Zeng, et al.

     Jianzong Wu, Xiangtai Li, Yanhong Zeng, Jiangning Zhang, Qianyu Zhou, Yining Li, Yunhai Tong, Kai Chen

Paper Code Project_Page

  • Anim-Director: A Large Multimodal Model Powered Agent for Controllable Animation Video Generation (19 Aug 2024)

Yunxin Li, Haoyuan Shi, Baotian Hu, et al.

     Yunxin Li, Haoyuan Shi, Baotian Hu, Longyue Wang, Jiashun Zhu, Jinyi Xu, Zhen Zhao, Min Zhang

Paper Code

  • Still-Moving: Customized Video Generation Without Customized Video Data (11 Jul 2024)

Hila Chefer, Shiran Zada, Roni Paiss, Ariel Ephrat, et al.

     Hila Chefer, Shiran Zada, Roni Paiss, Ariel Ephrat, Omer Tov, Michael Rubinstein, Lior Wolf, Tali Dekel, Tomer Michaeli, Inbar Mosseri

Paper Code Project_Page

  • VIMI: Grounding Video Generation through Multi-modal Instruction (8 Jul 2024)

Yuwei Fang, Willi Menapace, Aliaksandr Siarohin, et al.

     Yuwei Fang, Willi Menapace, Aliaksandr Siarohin, Tsai-Shien Chen, Kuan-Chien Wang, Ivan Skorokhodov, Graham Neubig, Sergey Tulyakov

Paper

  • Customvideo: Customizing Text-to-Video Generation with Multiple Subjects (22 May 2024)

Zhao Wang, Aoxue Li, et al.

     Zhao Wang, Aoxue Li, Lingting Zhu, Yong Guo, Qi Dou, Zhenguo Li

Paper Project_Page

  • DisenStudio: Customized Multi-subject Text-to-Video Generation with Disentangled Spatial Control (21 May 2024)

Hong Chen, Xin Wang, Yipeng Zhang, et al.

     Hong Chen, Xin Wang, Yipeng Zhang, Yuwei Zhou, Zeyang Zhang, Siao Tang, Wenwu Zhu

Paper GitHub

  • Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers (9 May 2024)

Peng Gao, Le Zhuo, Dongyang Liu, et al.

     Peng Gao, Le Zhuo, Dongyang Liu, Ruoyi Du, Xu Luo, Longtian Qiu, Yuhang Zhang, Chen Lin, Rongjie Huang, Shijie Geng, Renrui Zhang, Junlin Xi, Wenqi Shao, Zhengkai Jiang, Tianshuo Yang, Weicai Ye, He Tong, Jingwen He, Yu Qiao, Hongsheng Li

Paper Code

  • SubjectDrive: Scaling Generative Data in Autonomous Driving via Subject Control (28 Mar 2024)

Zheng Chen, Di Qiu, Rui Wang, et al.

     Zheng Chen, Di Qiu, Rui Wang, Binyuan Huang, Yuqing Wen, Yucheng Zhao, Yaosi Hu, Yingfei Liu, Fan Jia, Weixin Mao, Tiancai Wang, Chi Zhang, Chang Wen Chen, Zhenzhong Chen, Xiangyu Zhang

Paper Project_Page

  • AesopAgent: Agent-driven Evolutionary System on Story-to-Video Production (12 Mar 2024)

Jiuniu Wang, Zehua Du, Yuyuan Zhao, et al.

     Jiuniu Wang, Zehua Du, Yuyuan Zhao, Bo Yuan, Kexiang Wang, Jian Liang, Yaxi Zhao, Yihen Lu, Gengliang Li, Junlong Gao, Xin Tu, Zhenyu Guo

Paper Project_Page

  • VideoDrafter: Content-Consistent Multi-Scene Video Generation with LLM (2 Jan 2024)

Fuchen Long, Zhaofan Qiu, Ting Yao, et al.

     Fuchen Long, Zhaofan Qiu, Ting Yao, Tao Mei

Paper Project_Page

  • Dreamvideo: Composing Your Dream Videos with Customized Subject and Motion (7 Dec 2023)

Yujie Wei, Shiwei Zhang, Zhiwu Qing, et al.

     Yujie Wei, Shiwei Zhang, Zhiwu Qing, Hangjie Yuan, Zhiheng Liu, Yu Liu, Yingya Zhang, Jingren Zhou, Hongming Shan

Paper Code Project_Page

  • VideoBooth: Diffusion-based Video Generation with Image Prompts (1 Dec 2023)

Yuming Jiang, Tianxing Wu, Shuai Yang, et al.

     Yuming Jiang, Tianxing Wu, Shuai Yang, Chenyang Si, Dahua Lin, Yu Qiao, Chen Change Loy, Ziwei Liu

Paper Code Project_Page

  • Videodreamer: Customized Multi-Subject Text-to-Video Generation with Disen-Mix Finetuning (2 Nov 2023)

Hong Chen, Xin Wang, Guanning Zeng, et al.

     Hong Chen, Xin Wang, Guanning Zeng, Yipeng Zhang, Yuwei Zhou, Feilin Han, Wenwu Zhu

Paper Project_Page

  • Animate-A-Story: Storytelling with Retrieval-Augmented Video Generation (13 Jul 2023)

Yingqing He, Menghan Xia, Haoxin Chen, et al.

     Yingqing He, Menghan Xia, Haoxin Chen, Xiaodong Cun, Yuan Gong, Jinbo Xing, Yong Zhang, Xintao Wang, Chao Weng, Ying Shan, Qifeng Chen

Paper Code Project_Page

  • TaleCrafter: Interactive Story Visualization with Multiple Characters (30 May 2023)

Yuan Gong, Youxin Pang, et al.

     Yuan Gong, Youxin Pang, Xiaodong Cun, Menghan Xia, Yingqing He, Haoxin Chen, Longyue Wang, Yong Zhang, Xintao Wang, Ying Shan, Yujiu Yang

Paper GitHub Project_Page

  • Dreamix: Video Diffusion Models are General Video Editors (2 Feb 2023)

Eyal Molad, Eliahu Horwitz, et al.

     Eyal Molad, Eliahu Horwitz, Dani Valevski, Alex Rav Acha, Yossi Matias, Yael Pritch, Yaniv Leviathan, Yedid Hoshen

Paper

🖼️ Image Control

  • Frame Guidance: Training-Free Guidance for Frame-Level Control in Video Diffusion Models M (8 Jun 2025)

Sangwon Jang, Taekyung Ki, Jaehyeong Jo, et al.

     Sangwon Jang, Taekyung Ki, Jaehyeong Jo, Jaehong Yoon, Soo Ye Kim, Zhe Lin, Sung Ju Hwang

Paper Code Project_Page

  • DanceTogether! Identity-Preserving Multi-Person Interactive Video GenerationM (23 May 2025)

Junhao Chen, Mingjin Chen, Jianjin Xu, et al.

     Junhao Chen, Mingjin Chen, Jianjin Xu, Xiang Li, Junting Dong, Mingze Sun, Puhua Jiang, Hongxiang Li, Yuhang Yang, Hao Zhao, Xiaoxiao Long, Ruqi Huang

Paper

  • OmniVDiff: Omni Controllable Video Diffusion for Generation and Understanding (15 Apr 2025)

Dianbing Xi, Jiepeng Wang, Yuanzhi Liang, et al.

Xi Qiu, Yuchi Huo, Rui Wang, Chi Zhang, Xuelong Li

Paper Code Project_Page

  • HunyuanVideo: A Systematic Framework For Large Video Generative ModelsM (11 Mar 2025)

Weijie Kong, Qi Tian, Zijian Zhang, et al. Rox Min, Zuozhuo Dai, Jin Zhou, Jiangfeng Xiong, Xin Li, Bo Wu, Jianwei Zhang, Kathrina Wu, Qin Lin, Junkun Yuan, Yanxin Long, Aladdin Wang, Andong Wang, Changlin Li, Duojun Huang, Fang Yang, Hao Tan, Hongmei Wang, Jacob Song, Jiawang Bai, Jianbing Wu, Jinbao Xue, Joey Wang, Kai Wang, Mengyang Liu, Pengyu Li, Shuai Li, Weiyan Wang, Wenqing Yu, Xinchi Deng, Yang Li, Yi Chen, Yutao Cui, Yuanbo Peng, Zhentao Yu, Zhiyu He, Zhiyong Xu, Zixiang Zhou, Zunnan Xu, Yangyu Tao, Qinglin Lu, Songtao Liu, Dax Zhou, Hongfa Wang, Yong Yang, Di Wang, Yuhong Liu, Jie Jiang, Caesar Zhong

Paper Project_Page Code

  • Extrapolating and Decoupling Image-to-Video Generation Models: Motion Modeling is Easier Than You Think (2 Mar 2025)

[CVPR 2025] Jie Tian, Xiaoye Qu, Zhenyi Lu, et al. Wei Wei, Sichen Liu, Yu Cheng

Paper Code

  • Adapting Image-to-Video Diffusion Models for Large-Motion Frame Interpolation (17 Feb 2025)

Luoxu Jin, Hiroshi Watanabe

Paper

  • Generative Inbetweening: Adapting Image-to-Video Models for Keyframe Interpolation (12 Feb 2025)

[ICLR 2025] Xiaojuan Wang, Boyang Zhou, Brian Curless, et al. Ira Kemelmacher-Shlizerman, Aleksander Holynski, Steven M. Seitz

Paper Project_Page Code Demo

  • Autoregressive Video Generation without Vector Quantization (9 Jan 2025)

[ICLR 2025] Haoge Deng, Ting Pan, Haiwen Diao, et al. Zhengxiong Luo, Yufeng Cui, Huchuan Lu, Shiguang Shan, Yonggang Qi, Xinlong Wang

Paper Code Demo

  • Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation (6 Jan 2025)

[CVPR 2025] Guy Yariv, Yuval Kirstain, Amit Zohar, et al. Shelly Sheynin, Yaniv Taigman, Yossi Adi, Sagie Benaim, Adam Polyak

Paper Project_Page

  • STIV: Scalable Text and Image Conditioned Video Generation (10 Dec 2024)

Zongyu Lin, Wei Liu, Chen Chen, et al. Jiasen Lu, Wenze Hu, Tsu-Jui Fu, Jesse Allardice, Zhengfeng Lai, Liangchen Song, Bowen Zhang, Cha Chen, Yiran Fei, Yifan Jiang, Lezhi Li, Yizhou Sun, Kai-Wei Chang, Yinfei Yang

Paper

  • MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation (8 Dec 2024)

Shuwei Shi, Biao Gong, Xi Chen, et al. Dandan Zheng, Shuai Tan, Zizheng Yang, Yuyuan Li, Jingwen He, Kecheng Zheng, Jingdong Chen, Ming Yang, Yinqiang Zheng

Paper

  • Lumiere: A Space-Time Diffusion Model for Video GenerationM (3 Dec 2024)

[SIGGRAPH Asia 2024] Omer Bar-Tal, Hila Chefer, Omer Tov, et al. Charles Herrmann, Roni Paiss, Shiran Zada, Ariel Ephrat, Junhwa Hur, Guanghui Liu, Amit Raj, Yuanzhen Li, Michael Rubinstein, Tomer Michaeli, Oliver Wang, Deqing Sun, Tali Dekel, Inbar Mosseri

Paper Project_Page

  • Identifying and Solving Conditional Image Leakage in Image-to-Video Diffusion Model (6 Nov 2024)

[NeurIPS 2024] Min Zhao, Hongzhou Zhu, Chendong Xiang, et al. Kaiwen Zheng, Chongxuan Li, Jun Zhu

Paper Project_Page Code Demo

  • FrameBridge: Improving Image-to-Video Generation with Bridge Models (20 Oct 2024)

Yuji Wang, Zehua Chen, Xiaoyu Chen, et al. Jun Zhu, Jianfei Chen

Paper Project_Page

  • I4VGen: Image as Free Stepping Stone for Text-to-Video GenerationM (3 Oct 2024)

Xiefan Guo, Jinlin Liu, Miaomiao Cui, et al. Liefeng Bo, Di Huang

Paper Project_Page Code

  • DynamiCrafter: Animating Open-Domain Images with Video Diffusion Priors (1 Oct 2024)

[ECCV 2024] Jinbo Xing, Menghan Xia, Yong Zhang, et al. Haoxin Chen, Wangbo Yu, Hanyuan Liu, Gongye Liu, Xintao Wang, Ying Shan, Tien-Tsin Wong

Paper Project_Page Code Demo

  • PhysGen: Rigid-Body Physics-Grounded Image-to-Video Generation (27 Sep 2024)

[ECCV 2024] Shaowei Liu, Zhongzheng Ren, Saurabh Gupta, et al. Shenlong Wang

Paper Project_Page Code

  • Structure and Content-Guided Video Synthesis with Diffusion Models (27 Sep 2024)

[ICCV 2023] Patrick Esser, Johnathan Chiu, Parmida Atighehchian, et al. Jonathan Granskog, Anastasis Germanidis

Paper Project_Page

  • DreamVideo: High-Fidelity Image-to-Video Generation with Image Retention and Text Guidance (16 Sep 2024)

[ICASSP 2025] Cong Wang, Jiaxi Gu, Panwen Hu, et al. Songcen Xu, Hang Xu, Xiaodan Liang

Paper Project_Page Code

  • Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning (2 Aug 2024)

[ECCV 2024] Rohit Girdhar, Mannat Singh, Andrew Brown, et al. Quentin Duval, Samaneh Azadi, Sai Saketh Rambhatla, Akbar Shah, Xi Yin, Devi Parikh, Ishan Misra

Paper Project_Page Demo

  • MoVideo: Motion-Aware Video Generation with Diffusion Model (29 Jul 2024)

[ECCV 2024] Jingyun Liang, Yuchen Fan, Kai Zhang, et al. Radu Timofte, Luc Van Gool, Rakesh Ranjan

Paper Project_Page

  • I2V-Adapter: A General Image-to-Video Adapter for Diffusion Models (13 Jul 2024)

[ACM SIGGRAPH 2024] Xun Guo1, Mingwu Zheng, Liang Hou, et al. Yuan Gao, Yufan Deng, Pengfei Wan, Di Zhang, Yufan Liu, Weiming Hu, Zhengjun Zha, Haibin Huang, Chongyang Ma

Paper

  • EasyAnimate: A High-Performance Long Video Generation Method based on Transformer Architecture (5 Jul 2024)

Jiaqi Xu, Xinyi Zou, Kunzhe Huang, et al. Yunkuo Chen, Bo Liu, MengLi Cheng, Xing Shi, Jun Huang

Paper Project_Page Code Demo

  • ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation (1 Jul 2024)

[TMLR 2024] Weiming Ren, Huan Yang, Ge Zhang, et al. Cong Wei, Xinrun Du, Wenhao Huang, Wenhu Chen

Paper Project_Page Code Demo

  • OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation (13 Jun 2024)

[NeurIPS 2024] Junke Wang, Yi Jiang, Zehuan Yuan, et al. Binyue Peng, Zuxuan Wu, Yu-Gang Jiang

Paper Code

  • AID: Adapting Image2Video Diffusion Models for Instruction-guided Video Prediction (10 Jun 2024)

Zhen Xing, Qi Dai, Zejia Weng, et al. Zuxuan Wu, Yu-Gang Jiang

Paper Project_Page Code

  • TI2V-Zero: Zero-Shot Image Conditioning for Text-to-Video Diffusion Models (25 Apr 2024)

[CVPR 2024] Haomiao Ni, Bernhard Egger, Suhas Lohit, et al. Anoop Cherian, Ye Wang, Toshiaki Koike-Akino, Sharon X. Huang, Tim K. Marks

Paper Project_Page Code

  • TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models (25 Mar 2024)

[CVPR 2024] Zhongwei Zhang, Fuchen Long, Yingwei Pan, et al. Zhaofan Qiu, Ting Yao, Yang Cao, Tao Mei

Paper Project_Page

  • Follow-Your-Click: Open-domain Regional Image Animation via Short Prompts (13 Mar 2024)

Yue Ma, Yingqing He, Hongfa Wang, et al. Andong Wang, Chenyang Qi, Chengfei Cai, Xiu Li, Zhifeng Li, Heung-Yeung Shum, Wei Liu, Qifeng Chen

Paper Project_Page Code

  • AtomoVideo: High Fidelity Image-to-Video Generation (5 Mar 2024)

Litong Gong, Yiran Zhu, Weijie Li, et al. Xiaoyang Kang, Biao Wang, Tiezheng Ge, Bo Zheng

Paper Project_Page

  • Tuning-Free Noise Rectification for High Fidelity Image-to-Video Generation (5 Mar 2024)

Weijie Li, Litong Gong, Yiran Zhu, et al. Fanda Fan, Biao Wang, Tiezheng Ge, Bo Zheng

Paper Project_Page [![Code](https://img.shields.io/github/stars/alimama-creative/Noise-Rect