SadTalker 四步跑通:从环境配置到第一次生成说话人脸视频的完整实操
2026/9/12 15:41:54 网站建设 项目流程

SadTalker 四步跑通:从环境配置到第一次生成说话人脸视频的完整实操

【免费下载链接】SadTalker[CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker

SadTalker 是一个发表于 CVPR 2023 的说话人脸视频生成工具:给它一张人像图片和一段音频,就能生成口型、表情与头部姿态同步说话的动画视频。本文面向会基本命令行操作、但没有接触过该项目的读者,带你完成环境配置、下载预训练模型并在本机生成第一段视频,随后讲解结果确认方法与常用参数调整。

安装前检查

开始之前,请逐项核对以下条件:

  • 系统:Linux、macOS 或 Windows(Windows 需先安装 Python 3.8 与 git)
  • Python:建议使用 conda 创建 3.8 虚拟环境,避免依赖冲突
  • PyTorch:官方推荐 1.12.1(cu113)版本;无独立显卡的机器可以加--cpu参数在 CPU 上运行,速度较慢
  • ffmpeg:必须安装,用于音频解码与视频编码
  • 磁盘:为预训练模型文件与生成结果预留足够空间

快速上手:四步生成第一段视频

第一步:克隆仓库并创建虚拟环境

拉取代码,并建立隔离的 Python 3.8 环境。

git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker conda create -n sadtalker python=3.8 conda activate sadtalker

第二步:安装依赖

安装 PyTorch、ffmpeg 以及项目依赖清单。若上面安装的 PyTorch 版本与你的显卡驱动不匹配,按 README 安装章节给出的版本命令重装。

pip install torch torchvision torchaudio conda install ffmpeg pip install -r requirements.txt

第三步:下载预训练模型

执行官方下载脚本,一次性获取人脸渲染、音频到表情/姿态、人脸增强等模型,分别存放在checkpoints/gfpgan/目录。

bash scripts/download_models.sh

Windows 上可改为手动下载,按 README「Download Models」一节列出的清单把文件放到相同目录结构。

第四步:首次运行

使用仓库自带的音频与人像完成第一次生成。默认是crop模式,只动画人脸裁剪区域,输出保存在results/下。

python inference.py --driven_audio examples/driven_audio/chinese_news.wav \ --source_image examples/source_image/full_body_1.png \ --result_dir results

整个过程依次完成音频特征提取、3D 运动系数生成、逐帧人脸渲染合成三个阶段,全程离线。

确认生成结果

  1. 查看终端输出:成功时最后一行打印The generated video is named:并给出完整视频路径。
  2. 打开results/目录下带时间戳子目录的 mp4 文件,播放确认人像口型与音频内容同步。

注意:不追加--verbose参数时,中间文件会在生成结束后自动清理,目录中只保留最终视频。

常用参数与进阶场景

以下三个参数来自 docs/best_practice.md,覆盖了多数使用场景。

全身图片动画

--preprocess full让动画作用于整张图片,配合--still保持原始头部姿态,适合全身人像素材。

python inference.py --driven_audio examples/driven_audio/chinese_poem1.wav \ --source_image examples/source_image/full_body_2.png \ --preprocess full --still --result_dir results_full

人脸增强

--enhancer gfpgan在生成后执行人脸修复,可提升面部细节质量。

python inference.py --driven_audio examples/driven_audio/imagine.wav \ --source_image examples/source_image/art_2.png \ --enhancer gfpgan --result_dir results_enhanced

调整表情幅度

--expression_scale是表情强度倍数,取值大于 1 时动画幅度更明显。

python inference.py --driven_audio examples/driven_audio/bus_chinese.wav \ --source_image examples/source_image/art_3.png \ --expression_scale 1.5 --result_dir results_expressive

SadTalker 常见报错与处理

报错现象原因解决命令
ffmpeg is not recognizedffmpeg 未安装或未加入 PATHconda install ffmpeg(macOS 可改用brew install ffmpeg
CUDA out of memory显存不足运行前执行export PYTORCH_CUDA_ALLOC_CONF=max_split_size_mb:128(Windows 用set代替export
FileNotFoundError: ... checkpoints/BFM_Fitting/similarity_Lm3D_all.mat模型文件缺失或目录位置不对重新执行bash scripts/download_models.sh并检查checkpoints/目录结构
音频解码错误(如mp3float ... Header missing音频格式不受支持项目只接受wavmp3,先用 ffmpeg 转成wav
RuntimeError: unexpected EOF ... file might be corrupted模型文件下载损坏删除损坏文件后重新执行bash scripts/download_models.sh

后续探索

更完整的参数说明(参考视频--ref_pose--ref_eyeblink,自由视角--input_yaw等)见 docs/best_practice.md,更多问题可查 docs/FAQ.md;examples/ 目录提供了更多驱动音频与人像素材,可替换为自己的素材继续尝试。如果偏好图形界面,先执行pip install TTS,再运行python app_sadtalker.py即可启动本地 gradio 演示。建议先跑通参考视频模式,观察姿态控制对成片自然度的影响。

【免费下载链接】SadTalker[CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询