Duix.Avatar 本地部署实测:10 秒视频,在电脑上做出会说话的 AI 数字人
2026/9/11 19:02:22 网站建设 项目流程

Duix.Avatar 本地部署实测:10 秒视频,在电脑上做出会说话的 AI 数字人

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一款可以完全离线跑在自己电脑上的开源 AI 数字人工具:上传一段 10 秒的自拍视频,就能克隆你的脸和声音,再输入一段文案自动生成口型对得上的口播视频,数据全程不上传。本文按硬件检查、装 Docker、启动服务、做出第一支视频的顺序给出实测步骤,适合想体验数字人视频但没有技术背景的普通电脑用户。

从一个 10 秒的视频开始

假设你手边什么都没有:一台装了英伟达显卡的电脑、手机、一段自拍。你用手机录一段 10 秒左右的正面视频,边走边说话,丢进软件。几分钟后,你的"数字分身"建好了——同一张脸、同一个音色。接下来你只要在输入框里敲一段文案,它就能对着镜头把这段话"说"出来,嘴型基本对得上,最后导出一条可以发出去的 mp4。全程不用联网,视频和声音都没离开过你的硬盘。

它能不能做,先说清楚

它能做:

  • 用 10 秒左右带人声的视频,克隆你的外貌和声音
  • 输入文字自动生成口播视频,文案支持中、英、日、韩、法、德、阿拉伯、西语 8 种语言
  • 也可以上传自己的录音,让数字人照着这段声音表演
  • 全离线运行,素材和成片都留在本地
  • 一次建好形象后可以反复生成多条视频

它暂时做不了:

  • 实时互动问答(开源版做的是离线视频合成,不是直播数字人)
  • 没有英伟达显卡就跑不起来,AMD 显卡和核显都不支持
  • 客户端目前只适配 Windows 10(19042.1526 及以上)和 Ubuntu 22.04

先确认你的电脑跑不跑得动

所有算力都在本地显卡上,硬件达标是第一步。官方推荐配置如下:

项目建议配置说明
系统Windows 10(19042.1526+)或 Ubuntu 22.04客户端仅支持这两个平台
CPU13 代 i5-13400F 及以上主要吃内存和多任务
内存32GB16GB 偏紧,语音识别服务可能起不来
显卡英伟达独显(推荐 RTX 4070)显存 8GB 可用精简版服务
硬盘系统盘留 100GB、数据盘留 30GB(Windows)服务镜像约 70GB 流量

先做两个检查:打开终端输入nvidia-smi,能看到显卡型号和驱动版本就说明驱动装好了,这一步失败后面全部免谈;再用"此电脑"看一下磁盘剩余空间,不够就先清理。

从零到服务跑起来

1. 装好 Docker(Windows)

在命令提示符依次输入wsl --list --verbosewsl --update,前者确认 WSL 已安装,后者把内核升到最新。然后安装 Docker Desktop,首次启动接受协议、跳过登录。成功的样子:窗口左下角显示 Engine running。如果系统盘剩余空间不足 100GB,在设置 → Resources → Advanced 里把镜像存储位置改到空间更大的盘,改完点 Apply & restart:

Ubuntu 用户跳过这步,装好 Docker 和 NVIDIA Container Toolkit 即可。

2. 拿到代码并启动服务

执行git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar克隆仓库,进入deploy目录执行docker-compose up -d。它会拉取三个容器:语音识别(ASR)、语音合成(TTS)、视频渲染。首次下载约 70GB 流量,耐心等半小时到一小时,建议挂 WiFi 或有线。

成功的样子:打开 Docker,看到duix-avatar-asrduix-avatar-ttsduix-avatar-gen-video三个容器全部显示 Running,端口分别是 10095、18180、8383。显存只有 8GB 或硬盘紧张,改用docker-compose -f docker-compose-lite.yml up -d精简版,只起一个容器也能跑;RTX 50 系显卡用docker-compose-5090.yml

3. 装客户端

到项目 Releases 下载官方打包的安装包,Windows 双击 exe 安装、Ubuntu 直接运行 AppImage 文件。成功的样子:打开软件看到上面那张"Create Video / Create Avatar"主页,且"我的作品"页能正常加载(连不上就去检查三个容器是否都在运行)。

做出你的第一支数字人视频 🎬

素材比参数重要,先按这个标准录:时长 10 秒上下,正面机位,全程连续说话(必须有声音、人在说话,这是硬性要求,后面会解释),光线均匀、面部占满大半个画面。

操作顺序:

  1. 点"Create Avatar"上传刚才的视频,系统会自动把音频轨分离出来做声音克隆,同时在"我的数字人"里生成你的形象
  2. 点"Create Video",选中刚建好的形象
  3. 输入文案(或直接上传一段录音),文案写多少说多少
  4. 点生成,等待渲染;一条 1 分钟左右的视频通常要几分钟
  5. 到"我的作品"里预览、导出成片

两个小建议:首条视频先用 50 字以内的短句测通流程,别一上来就写长稿;语速保持默认即可,想更紧凑时把文案写短比调参数更直接。

10 秒视频怎么变成你的数字分身

打个比方:它不是给你的脸"贴了个面具",而是像学皮影戏。那 10 秒视频是教材——系统把你的脸拆成几百个关键点,逐帧记录每个点跟着声音怎么动:嘴唇什么时候开、下巴怎么落。这套"动作套路"连同你的音色一起被记住。合成时它先把文案变成你的声音,再逐帧比对声音,让脸上的关键点照着套路动起来,最后拼回视频。所以素材里你说得越清楚、画面越稳,"教材"质量越高,回放起来越像。

想批量做的时候

三个服务启动后都开了本地接口:18180 是语音合成,8383 是视频合成,10095 是语音识别,都可以通过http://127.0.0.1访问。比如用一行curl -X POST http://127.0.0.1:8383/easy/submit提交音频和形象的视频合成任务,再用GET http://127.0.0.1:8383/easy/query?code=任务码轮询进度。客户端源码里 src/main/service/ 下的 model、video、voice 三个文件就是现成的调用示例,照着改就能把自己的批量脚本接上。

最容易踩的三个坑

新建形象报错,声音克隆失败。原因几乎都是上传的视频里没有声音、或者人没在说话——程序靠这段音频做声音克隆,静音视频必然失败。处理:重录一段 10 秒连续说话的素材。想看具体报错,客户端右上角菜单"Open Log"可打开日志目录:

执行 docker-compose 时拉镜像超时,报 request canceled / Client.Timeout。原因是 Docker Hub 官方源连接不稳定。处理:在 Docker 设置 → Docker Engine 里加一段 registry-mirrors 加速镜像配置,保存后重启,再重新执行拉取:

服务起不来,或建形象时报 Connection refused。要么机器没有英伟达显卡/驱动没装好(本项目所有算力在本地 GPU 上,缺一个都启动不了),要么语音识别服务本身启动慢,服务端刚拉起来就急着克隆,16GB 内存的机器尤其明显。处理:先nvidia-smi确认驱动;服务启动后等几分钟再建形象;点容器看日志定位卡在哪一步:

更多自查步骤可以看仓库里的 doc/常见问题.md。

现在就可以开始

一句话总结:一块英伟达显卡 + 三个容器 + 一段 10 秒的说话视频,你在本地就有一个随叫随到的数字分身。第一步就去做:装好 Docker 后进入 deploy/ 目录执行启动命令,等三个容器变绿,剩下的交给客户端。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询