当前位置: 首页 > news >正文

15分钟跑通SadTalker:音频驱动面部动画从环境搭建到出片

15分钟跑通SadTalker:音频驱动面部动画从环境搭建到出片

【免费下载链接】SadTalker[CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker

SadTalker 是一款音频驱动面部动画工具:输入一张静态人像加一段语音,就能生成嘴型、表情都与音频对齐的说话视频。这篇安装教程带你走环境、模型、出片三步。

先看效果:一张照片加一段音频能变成什么

最终产物是 mp4:人物对着镜头说话,口型、眨眼和头部微动都跟着语音走,全身照输入也不会崩坏。下面这段动图就是一次完整运行的输出。

图注:SadTalker 音频驱动面部动画的出片效果,嘴型随语音逐帧变化

原理拆开并不玄:先从照片里恢复出三维人脸参数,再把音频转成头部和口型的运动系数,最后逐帧渲染合成视频。仓库自带的演示素材都在 examples/ 目录,音频和照片可以直接拿来试。

硬件底线:你的配置够不够

维度最低更从容
显卡6GB 显存(RTX 2060 一档)8GB 以上(RTX 3060 起)
内存8GB16GB 以上
磁盘留 10GB留 20GB

没有独显也能跑:脚本检测不到 CUDA 会自动切到 CPU,十几秒音频大概要等几分钟,适合先验证流程、后面再考虑提速。

环境一次搭好:conda、PyTorch 与依赖

先建隔离环境

克隆仓库后,用 conda 拉一个 Python 3.8 的独立环境,把依赖隔离开,冲突会少很多:

git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker conda create -n sadtalker python=3.8 conda activate sadtalker

再装依赖

PyTorch 按机器的 CUDA 版本去官网挑对应命令,纯 CPU 机器装 CPU 版;ffmpeg 交给 conda 最省事,最后补齐项目依赖:

pip install torch torchvision torchaudio conda install -y ffmpeg pip install -r requirements.txt

macOS 上装完还要补装 dlib,仓库 docs 目录的 install.md 里写了分平台的额外事项。

模型自动下载与第一次推理

一条命令拉全模型

bash scripts/download_models.sh

它会自动创建 checkpoints 目录,把 256 和 512 两档的 safetensors 主权重、两个 mapping 网络的 pth 文件,以及 GFPGAN 人脸增强权重全部取回本地;下载用的是断点续传写法,重跑不会重复拉已存在的文件。

GPU 与 CPU 各一套参数

第一次先按 256 分辨率把全链路跑通:

python inference.py --source_image examples/source_image/full_body_1.png \ --driven_audio examples/driven_audio/bus_chinese.wav --size 256

图注:上面命令默认的全身输入图,面部区域清晰是全身照能跑好的前提

完成后视频按时间戳落在 results 目录。显卡有富余,把--size提到 512、--batch_size提到 4,画面更细;CPU 机器在命令里加--cpu,并把--batch_size压到 1。除了真实照片,风格化插画也可以直接当输入:

图注:风格化插画同样能驱动出自然的说话动画

出片不顺时先查这三处

  • 显存吃紧:先把--batch_size降到 1、--size降到 256;还报 OOM,就设置PYTORCH_CUDA_ALLOC_CONF环境变量让显存分配更紧凑。
  • 依赖版本打架:别在原环境里打补丁,删掉 conda 环境从头重建一次最干净。
  • 加载权重报错:多半是某个模型文件没拉全,重跑一遍下载脚本即可,它会跳过已存在的文件。

最后给挑输入素材定个标:正脸、清晰、光线足,音频用 WAV 最稳。

图注:正脸清晰的这类人像,是音频驱动面部动画最省心的输入

到这里环境、模型、命令都齐了,换一张自己的照片和一段自己的音频,跑一条属于自己的出片命令就好。

【免费下载链接】SadTalker[CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

http://www.cnnetsun.cn/news/4185017.html

相关文章:

  • STM32开发环境搭建:Keil与VS Code高效组合配置指南
  • 智能体不确定性量化:Proper Scoring Rules评估与工程实践
  • 三步打造高含金量实习报告:从流水账到专业文档
  • ABAP对接企业微信机器人:模版卡片消息的实战开发指南
  • Java全栈工程师面试技术栈梳理与实战技巧
  • Agentic AI:从工具到伙伴,如何用Python构建自动化科研智能体
  • Java大厂面试全攻略:从基础到架构深度解析
  • 技术人做产品:用最小验证替代大而全方案
  • 基于springboot德育家校共建平台系统(源代码+文档+PPT+调试+讲解)
  • SSRF漏洞原理与实战:从内网探测到Gopher协议攻击Redis
  • DeepSeek Harness 插件开发简易指南
  • PT助手Plus上手指南:把PT站点的种子下载变成一次点击
  • 三星笔记能在非三星 Windows 电脑上跑吗?GalaxyBook Mask 快速伪装指南
  • 一条命令装好第一个 Codex 技能:Agent Skills 实战入门
  • 从一道CSP-J真题出发:聊聊贪心排序与计数排序
  • 小户型可折叠跑步机怎么选?十款机型收纳与实用性盘点
  • curl 邮件协议实战:SMTP、POP3、IMAP 几分钟完整上手
  • 技术面试全攻略:算法、系统设计与行为面试实战技巧
  • Apktool ApkInfo 完全指南:APK 元数据加载机制全解
  • 人工智能应用安全在版本更新后先测什么
  • 智能体框架防遗忘机制:工程部署、资源评估与避坑指南
  • Java后端面试突击:两周系统备战高并发与JVM调优
  • 基于多智能体协同的图表深度洞察框架:从视觉解析到业务报告自动生成
  • Windows系统文件wbiosrvc.dll丢失找不到问题解决
  • 用 Freescout 搭建免费客服工单系统:开源帮助台部署与常用配置
  • Maven编译卡住40分钟?我用AI助手30分钟定位修复2处隐蔽类型错误
  • Java面试核心知识点:从基础到框架的深度解析
  • 移动智能体在线强化学习泛化:从原理到AndroidWorld实践
  • gcr.io_mirror GCR 镜像加速使用指南:3 步拉取 GCR 镜像
  • 20天斩获5家互联网公司offer的求职闪电战策略