Duix.Avatar 免费开源 AI 数字人部署教程:10 秒视频克隆形象,离线生成口播视频
2026/9/11 3:56:24 网站建设 项目流程

Duix.Avatar 免费开源 AI 数字人部署教程:10 秒视频克隆形象,离线生成口播视频

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

做一条真人出镜的口播视频,最省事的方式大概是:录一段 10 秒左右的视频喂给Duix.Avatar,让它克隆你的形象和声音;之后你只管把文案贴进去,或者上传一段音频,它就能自动把口型对上,吐出一条完整的口播视频。整个过程在本地离线完成,素材不经过外网,隐私不用太担心。

它是什么,凭什么免费

  • 一个完全开源的 AI 数字人工具,本地部署后可无限次生成,不限量、不收订阅费
  • 服务端基于 Docker 跑在你自己的显卡上,三个服务分别负责语音识别(ASR)、语音克隆合成(TTS)和视频合成,全程离线
  • 克隆只依赖一段 10 秒视频;脚本支持 8 种语言(中、英、日、韩、法、德、阿拉伯、西班牙语)
  • 客户端是 Electron 桌面程序,Windows 和 Ubuntu 22.04 Desktop 都有安装包
  • 也开放本地 API(http://127.0.0.1),方便你接到自己的业务流程里

一句话区分它和其他数字人方案:商业 3D 数字人动辄报价数万元,而这里你只需要一台带 NVIDIA 显卡的电脑。

部署前的环境检查:硬盘、显存、驱动

先对照一下配置,差一项都可能卡住:

项目要求
Windows 系统Windows 10 19042.1526 或更高版本
D 盘存数字人和作品数据,空闲 > 30G
C 盘(Docker 镜像位置)空闲 > 100G,不够时可在 Docker 设置里把磁盘镜像换到别的盘
推荐硬件i5-13400F / 32G 内存(必要)/ RTX 4070
显卡必须有 NVIDIA 显卡且驱动装好——所有算力都在本地,没有它三个服务起不来
Ubuntu 用户22.04 Desktop(内核 6.8.0-52-generic 已验证),硬盘空闲 > 100G

依赖方面,服务端需要 Nodejs 18 和三个 Docker 镜像:docker pull guiji2025/fun-asrdocker pull guiji2025/fish-speech-zimingdocker pull guiji2025/duix.avatar

Windows 上装 Docker 前,先用wsl --list --verbose看看 WSL 在不在,没有就执行wsl --install(网络原因可能失败,多试几次),装完用wsl --update更新,再安装 Docker Desktop。C 盘空间不够时,在 Settings → Resources → Advanced 里把 Disk image location 指到另一块盘:

服务端部署:一条命令拉起三个容器

仓库里deploy/目录放好了 compose 文件,进目录起容器:

cd /deploy docker-compose up -d

想要 lite 版(只有视频生成服务Duix.Avatar-gen-video,没有 ASR 和 TTS),用:

docker-compose -f docker-compose-lite.yml up -d

耐心等半小时左右,这一轮会拉大约 70G 的镜像,建议连 WiFi。Docker 里看到duix-avatar-asrduix-avatar-ttsduix-avatar-gen-video三个服务都 Running,服务端就算就绪了(lite 版只有一个)。

两个变体场景:

  • NVIDIA 50 系列显卡(30/40 系列用 cuda 12.8 的也可以):改用cd /deploy && docker-compose -f docker-compose-5090.yml up -d,它基于 torch 官方预览版构建,已在 5090 上验证通过
  • Ubuntu 服务端:装好 Docker、显卡驱动和 NVIDIA Container Toolkit(装完nvidia-smi能显示显卡即成功)后,执行cd /deploy && docker-compose -f docker-compose-linux.yml up -d

镜像拉得慢或超时,就在/etc/docker/daemon.json里加镜像源(源会随时间失效,自行搜最新的):

{ "registry-mirrors": [ "https://docker.mirrors.ustc.edu.cn", "https://hub-mirror.c.163.com" ] }

客户端安装:Windows 装 exe,Ubuntu 跑 AppImage

  • Windows:下载官方构建的Duix.Avatar-x.x.x-setup.exe,双击安装
  • Ubuntu:下载 Linux 版Duix.Avatar-x.x.x.AppImage双击即可,无需安装;如果以 root 用户登录桌面双击没反应,在终端执行./Duix.Avatar-x.x.x.AppImage --no-sandbox加上参数就能跑

客户端首次打开会要求你接受用户协议。装好之后你就在首页看到两个入口:Create Video(生成视频)和 Create Avatar(创建数字人),下面挂着"我的作品 / 我的数字人"两个列表。

从零生成第一条数字人口播视频

第 1 步:准备素材。录一段 10 秒左右的视频,要求:画面里的人在开口说话、环境音干净。注意素材必须带人声——程序要拿这段声音做声音克隆,静音视频直接报错。

第 2 步:克隆形象与声音。在 Create Avatar 里提交这段视频。后台会自动做三件事:把视频转成 H.264 的无声视频、用 ffmpeg 分离出音频、再调用 TTS 服务训练语音模型。对应代码在 src/main/service/model.js,它内部会串起 src/main/service/voice.js 完成声音训练。

第 3 步:写文案或传音频。进入视频编辑页后,先选一个数字人(左侧列表可以搜索),中间编辑区有两个 Tab:

  • 文本驱动:输入文案,系统先把它转成你克隆的声音,再驱动口型
  • 语音驱动:直接上传音频文件,数字人按音频的节奏做口型

第 4 步:生成并下载。提交后视频进入 waiting 队列,"我的作品"里能看到排队进度;生成完可以直接播放下载。支持批量生成,也支持导入多个模型按场景切换。

进阶:本地 API 与高级参数

不想走客户端界面、想批量跑任务的话,Docker 起完后本地就能调 API(可参考 src/main/api/f2f.js 的调用方式):

  • 模特训练:视频分离出音频后放到D:\duix_avatar_data\voice\data(该路径与guiji2025/fish-speech-ziming服务约定,可在 docker-compose 里改),然后 POSThttp://127.0.0.1:18180/v1/preprocess_and_tran,请求体:
{ "format": ".wav", "reference_audio": "xxxxxx/xxxxx.wav", "lang": "zh" }

返回的asr_format_audio_urlreference_audio_text要记下来,后面音频合成要用。

  • 音频合成:POSThttp://127.0.0.1:18180/v1/invokespeaker传一个唯一 UUID,text传要合成的文案,reference_audio/reference_text填上一步的返回值,其余为固定传参:format: "wav"topP: 0.7max_new_tokens: 1024chunk_length: 100repetition_penalty: 1.2temperature: 0.7need_asr: falsestreaming: falseis_fixed_seed: 0is_norm: 0

  • 视频合成:POSThttp://127.0.0.1:8383/easy/submit,参数:audio_url(音频路径)、video_url(视频路径)、code(唯一 key)、chaofen: 0(超分开关)、watermark_switch: 0(水印开关)、pn: 1;再用 GEThttp://127.0.0.1:8383/easy/query?code=${taskCode}轮询进度。

    合成服务本体在 src/main/service/video.js。

这些坑大概率会踩到

镜像拉取超时(request canceled while waiting for connection可能原因:Docker Hub 官方源连接不稳定。 处理:开全局代理重试,或在daemon.json配置国内镜像源(见上文 JSON)。

新增数字人报错、克隆直接失败可能原因:上传的视频没有声音,或画面里的人没在说话,程序拿不到可克隆的声源。 处理:换一段 10 秒左右、人声清晰的视频重新提交。

克隆时报Connection refused可能原因:ASR 服务(duix-avatar-asr)启动很慢,服务端刚起就来请求会连不上;16G 内存的机器也可能起不来。 处理:服务端启动后等几分钟再克隆;内存紧张就升到 32G。

客户端连不上服务端可能原因:三个容器没全部 Running、防火墙挡了端口、或版本太旧。 处理:逐个检查容器状态;日志入口在客户端右上角菜单的 Open Log(日志文件在AppData\Roaming下的logs\main.log):

服务端日志则点开对应 Docker 容器的 Logs 页签查看,file not exists之类的报错多和数据目录路径没配对上有关:

视频生成进度卡在 20% 不动可能原因:显存不足或系统资源吃紧,合成任务中途被拖死。 处理:显存建议 8G 起步(12G 更稳)、加大虚拟内存、降低输出分辨率,或者直接改用 lite 版部署。

提问前可以先走一遍 docs/常见问题.md 里的自查步骤:三个服务是否都 Running、nvidia-smi是否正常、服务端和客户端是否都更新到了最新版。

写在最后

到这里,从环境检查、Docker 三容器、客户端安装到"10 秒视频 → 文案 → 成片"的完整链路都跑通了。后面项目大概率会朝实时对话、多模态输入等方向继续演进,但你现在手里的这套离线工具已经够做内容批量生产:课程口播、带货切片、企业宣发、个人 IP 都能用同一套流程批出来。遇到文档没覆盖的问题,优先翻 docs/常见问题.md 和容器日志,再考虑去社区提问。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询