Duix.Avatar 如何实现离线数字人视频生成:本地部署与二次开发指南
2026/9/11 3:39:44 网站建设 项目流程

Duix.Avatar 如何实现离线数字人视频生成:本地部署与二次开发指南

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

上传一段自己的出镜视频,再输入一段文本,就能在断网环境下得到口型同步的数字人视频,这是 Duix.Avatar 要解决的问题。作为一款开源的 AI 数字人离线视频生成与克隆工具,它把外观克隆、音色克隆和合成全部放在本机完成。

它到底解决什么问题

没有它时,数字人项目最常见的三个问题是这样:

  • 数据出域:SaaS 平台要求把出镜视频和语音样本传到云端,法务、医疗等场景难以合规;Duix.Avatar 的计算全部跑在本机显卡上,三个服务只对 127.0.0.1 可达。
  • 成本:传统 3D 数字人方案报价以十万美元计,官方团队用真人视频训练把成本压到 1000 美元量级,开源版本地使用不收费。
  • 链路长:自建管线要自己串 ASR、TTS 和视频驱动三类模型,这里的三项能力已预打包成 Docker 镜像。

核心机制拆解

三个本地服务怎么分工

重计算全在 deploy/docker-compose.yml 里:语音合成走 18180 端口,语音识别走 10095,face2face 视频生成走 8383。三个容器都只暴露给本机,lite 版只启动视频生成一个服务,适合已有音频、只需要驱动嘴型的场景。

桌面端为什么只是个调度器

Electron 主进程内置 SQLite,记录模特、音色和视频任务,任务按 draft → waiting → pending → success/failed 状态机流转,主进程每 2 秒轮询一次合成接口推进状态,逻辑见 src/main/service/video.js。客户端本身不做训练和推理,只做调接口、管状态、ffmpeg 收尾。

一次上传如何同时克隆形象和声音

新建模特时,客户端先把视频转成 H264,用 ffmpeg 分离出音轨,把音频送 TTS 服务做音色克隆训练,再一次性把模特、视频、音色写入本地库,流程在 src/main/service/model.js。这就是"一段视频换一个数字人加一个音色"的由来。

落地路径

  • 个人项目:执行git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar,确认 NVIDIA 驱动可用,在 deploy 目录执行docker-compose up -d(首次拉取约 70GB 镜像),再安装官方客户端安装包。C 盘空间不足 100GB 时先改 Docker 数据目录:

  • 中小团队:绕过图形界面,直接调开放接口——向127.0.0.1:8383/easy/submit提交合成任务,用/easy/query查进度,嵌入自有内容生产流水线。
  • 大型组织:50 系显卡使用 deploy 目录下对应的 5090 部署配置;注意许可边界,用户数超 10 万或年营收超 1000 万美元的企业商用前需签署商业授权协议。

生态位与趋势

Duix.Avatar 的位置是"SaaS 数字人的开源本地替身":技术用户拿完整源码做定制,业务用户可改走商业 API。原生支持来自三模型栈——ASR 基于 fun-asr,TTS 基于 fish-speech,二者都可独立替换,换一个更强的语音模型等于换一个容器镜像。未来 6~12 个月值得看两点:GPU 适配已覆盖 50 系(5090 实测)并发布了 Ubuntu 22.04 桌面版;实时交互目前只在官网提供,不在开源版中,face2face 推理能否做到实时,决定它能从"视频生成"走到"数字人对话"。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询