Duix.Avatar 如何实现离线数字人视频生成:本地部署与二次开发指南
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
上传一段自己的出镜视频,再输入一段文本,就能在断网环境下得到口型同步的数字人视频,这是 Duix.Avatar 要解决的问题。作为一款开源的 AI 数字人离线视频生成与克隆工具,它把外观克隆、音色克隆和合成全部放在本机完成。
它到底解决什么问题
没有它时,数字人项目最常见的三个问题是这样:
- 数据出域:SaaS 平台要求把出镜视频和语音样本传到云端,法务、医疗等场景难以合规;Duix.Avatar 的计算全部跑在本机显卡上,三个服务只对 127.0.0.1 可达。
- 成本:传统 3D 数字人方案报价以十万美元计,官方团队用真人视频训练把成本压到 1000 美元量级,开源版本地使用不收费。
- 链路长:自建管线要自己串 ASR、TTS 和视频驱动三类模型,这里的三项能力已预打包成 Docker 镜像。
核心机制拆解
三个本地服务怎么分工
重计算全在 deploy/docker-compose.yml 里:语音合成走 18180 端口,语音识别走 10095,face2face 视频生成走 8383。三个容器都只暴露给本机,lite 版只启动视频生成一个服务,适合已有音频、只需要驱动嘴型的场景。
桌面端为什么只是个调度器
Electron 主进程内置 SQLite,记录模特、音色和视频任务,任务按 draft → waiting → pending → success/failed 状态机流转,主进程每 2 秒轮询一次合成接口推进状态,逻辑见 src/main/service/video.js。客户端本身不做训练和推理,只做调接口、管状态、ffmpeg 收尾。
一次上传如何同时克隆形象和声音
新建模特时,客户端先把视频转成 H264,用 ffmpeg 分离出音轨,把音频送 TTS 服务做音色克隆训练,再一次性把模特、视频、音色写入本地库,流程在 src/main/service/model.js。这就是"一段视频换一个数字人加一个音色"的由来。
落地路径
- 个人项目:执行
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar,确认 NVIDIA 驱动可用,在 deploy 目录执行docker-compose up -d(首次拉取约 70GB 镜像),再安装官方客户端安装包。C 盘空间不足 100GB 时先改 Docker 数据目录:
- 中小团队:绕过图形界面,直接调开放接口——向
127.0.0.1:8383/easy/submit提交合成任务,用/easy/query查进度,嵌入自有内容生产流水线。 - 大型组织:50 系显卡使用 deploy 目录下对应的 5090 部署配置;注意许可边界,用户数超 10 万或年营收超 1000 万美元的企业商用前需签署商业授权协议。
生态位与趋势
Duix.Avatar 的位置是"SaaS 数字人的开源本地替身":技术用户拿完整源码做定制,业务用户可改走商业 API。原生支持来自三模型栈——ASR 基于 fun-asr,TTS 基于 fish-speech,二者都可独立替换,换一个更强的语音模型等于换一个容器镜像。未来 6~12 个月值得看两点:GPU 适配已覆盖 50 系(5090 实测)并发布了 Ubuntu 22.04 桌面版;实时交互目前只在官网提供,不在开源版中,face2face 推理能否做到实时,决定它能从"视频生成"走到"数字人对话"。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考