SadTalker 语音驱动人脸动画首次安装一次跑通的 6 个关键点【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalkerCVPR 2023 开源项目做的事给一张人像图和一段音频输出说话人视频。原理一句话音频 → 表情与姿态系数 → 渲染合成。本文面向第一次搭建的用户覆盖 SadTalker 安装教程、首次运行和常见报错。⚙️ 开始前先备齐 3 样东西开工前确认三样东西缺一样后面都会卡住类别要求说明硬件NVIDIA 显卡推荐没有显卡时可用--cpu参数速度慢但能跑软件Anaconda、Python 3.8、ffmpeg项目按 Python 3.8 构建ffmpeg 用于合成视频素材wav/mp3 音频 正脸人像图音频仅支持 wav、mp3图里人脸要清晰仓库 examples/ 内自带样例模型权重不算“装环境”但属于必装项后面单独一步下载漏了它就会出现 SadTalker 常见报错 里最常见的那种。 装环境命令能少则少装环境只要 5 行命令全部按顺序执行即可。拉代码git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker建环境并激活版本别升3.8 最稳conda create -n sadtalker python3.8 conda activate sadtalker装 PyTorchCUDA 11.3 选 cu113 的 wheel其他版本按 官网 对应关系替换pip install torch torchvision torchaudio装 ffmpeg 和其余依赖conda install ffmpeg pip install -r requirements.txt最后下载模型权重这一步会拉满两个目录checkpoints/表情、姿态映射与 256/512 两档人脸生成器和gfpgan/weights/增强模型bash scripts/download_models.sh下载完即离线可用运行期间不会再去网络取文件。✅ 装好了吗三条命令确认确认只有三条全部通过再开始首次运行python -c import torch; print(torch.__version__, torch.cuda.is_available())版本号正常打印、后半段为True说明 GPU 可用False也能跑速度差。ffmpeg -version有版本信息输出即可提示不是内部命令时回到上面conda install ffmpeg重装。ls checkpoints能看到.safetensors与BFM_Fitting等文件说明模型齐全缺哪个就重跑一次下载脚本它支持断点续传。 跑不起来按症状对号入座症状原因处理No module named ai3DMM 模型文件epoch_20.pth损坏或未下全删除后重新执行下载脚本FileNotFoundError: checkpoints/...模型未下载或目录放错在仓库根目录重跑bash scripts/download_models.shCUDA out of memory显存不足运行前先export PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128音频解码报错音频不是 wav/mp3先转成 wav 或 mp3 再输入Cant get the coeffs of the input图中没检测出人脸换更清晰、角度更正的单人像更多细节见 docs/FAQ.md。 出第一个视频只记这一条命令首次运行命令只有一条素材直接用仓库自带样例python inference.py --driven_audio examples/driven_audio/chinese_news.wav --source_image examples/source_image/full_body_1.png --result_dir results跑完终端会打印results下一个带时间戳的*.mp4那就是成片。默认是crop模式输出只含人脸区域属正常现象想要全身或整图效果加--preprocess full再跑一遍。 让效果更好5 个值得调的参数参数作用建议值--expression_scale表情幅度调低更克制默认 1.00.5~1.5 之间试--enhancer gfpgan用人脸修复网络提升清晰度开启--background_enhancer realesrgan整段视频超分显存够时开启--ref_eyeblink/--ref_pose借参考视频的眨眼与头部动作传 mp4 路径--size 512提高输出分辨率显存紧张时退回 256进阶用法示例python inference.py --driven_audio examples/driven_audio/chinese_poem1.wav --source_image examples/source_image/full_body_1.png --preprocess full --still --enhancer gfpgan--still配合full模式能保持原图头姿、只做局部动效效果最自然。参数全集见 docs/best_practice.md。➡️ 下一步跑通 CLI 后可以启动 Gradio 本地界面python app_sadtalker.py在浏览器里点选素材效率更高。把参考视频、pose_style和表情强度各换一组试一遍你就掌握了这个工具的全部日常用法。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考