Duix.Avatar 开源数字人本地部署:3步在自家电脑跑通AI口播视频
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是一个开源数字人项目,支持完全离线的本地部署。上传一段10秒的视频,它能克隆你的形象和声音;输入一段文字,就能自动生成口型对得上的口播视频。内容创作者用它做视频,不用逐帧拍摄,也不用把素材传给任何第三方。
一分钟认识它:数字人为什么值得你折腾
打个比方:以前找主播录口播视频,改一次文案就要重录一次。有了 Duix.Avatar,你的形象被"拍"下来存成模型,之后想说什么,打一段字就行,几分钟后出一条新视频。
它有三个值得用的理由:
- 全离线运行。视频和声音都在你机器上处理,素材不经过外网,适合对隐私有要求的团队。
- 克隆门槛低。一段10秒左右的说话视频就能同时克隆脸和声音,不用录几十分钟素材。
- 不限次数免费用。本地跑起来之后,生成多少条都是零成本,脚本还支持中、英、日、韩等8种语言。
三步跑起来:数字人本地部署完整流程
先说清一个前提:这个项目分服务端和客户端两部分。服务端是3个 Docker 服务(语音合成、语音识别、视频合成),客户端是操作界面。下面三步就是把它跑起来。
第1步:拿到项目代码
git clone https://gitcode.com/GitHub_Trending/he/HeyGem.ai这条命令把项目代码拉到本地,进入目录后你会看到deploy/(服务端配置)和src/(客户端源码)等文件夹。
第2步:装好 Docker,备好硬盘
Windows 上先装 WSL(命令wsl --install),再装 Docker Desktop;Ubuntu 上直接装 docker 和 docker-compose 即可。
⚠️两个硬门槛:必须有 NVIDIA 显卡并装好驱动(跑nvidia-smi能看到显卡才算装好);首次拉镜像约消耗70G流量,建议 C 盘(或系统盘)留100G、数据盘留30G,内存32G起步。
第3步:启动服务端并验证
cd deploy docker-compose up -d在deploy/目录下执行这条命令,Docker 会自动拉取并启动3个服务。第一次执行请耐心等待,半小时左右。执行docker ps,看到duix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video三个服务都是 Running 状态,服务端就成功了。
客户端方面,可以用官方构建的安装包直接双击运行;想自己编译的话,在项目根目录执行npm install装好依赖,再执行npm run build:win(Windows)或npm run build:linux(Linux)即可打包出客户端。
第一次使用:10秒视频克隆出数字人,再让它替你说
服务端跑通后,打开客户端,首页就两个大入口:Create Video(生成视频)和Create Avatar(创建形象)。跟着做两件事。
场景一:创建你的数字人形象
- 点Create Avatar,上传一段10秒左右的视频。
- 要求很具体:画面里是你本人在说话,声音清晰。因为声音克隆用的就是这段视频里的音频。
- 提交后服务端会自动做三件事:把视频拆成画面和音频、用音频训练你的专属音色、用画面训练你的专属形象。
- 几分钟后回到首页,My Avatars里就多了一个和你同脸同声的模特。
场景二:输入文字,生成口播视频
- 点Create Video,左侧选中刚创建的形象。
- 右侧输入你要播报的文案,也可以改成上传一段音频文件。
- 点生成。系统先用你的克隆音色把文字变成语音,再让画面里的"你"对口型,最后合成整段视频。
- 完成后视频出现在My Works里,点开就能播放、保存。
到这里你就走完了"形象克隆 → 文字驱动 → 视频产出"的完整链路。以后换文案、换语言,重复第二步即可,形象只需克隆一次。
更进一步:精简部署与开放 API
显存吃紧?换 lite 版。完整版要跑3个服务,如果机器资源紧张,可以只启动视频合成这一个核心服务:
cd deploy docker-compose -f docker-compose-lite.yml up -d注意 lite 版仍需 NVIDIA 显卡。另外如果你是50系新卡(如5090),deploy/目录里的docker-compose-5090.yml是针对它的专用配置。
想把能力接进自己的程序?Docker 起来后会在本地开放接口:语音合成在http://127.0.0.1:18180,视频合成在http://127.0.0.1:8383。接口参数和调用示例可以参考 src/main/service/ 下的video.js、voice.js、model.js,三个文件分别对应视频合成、音频合成和形象训练,照抄就行。
快速排错:3个高频报错
- 拉镜像超时(Client.Timeout / request canceled):Docker Hub 连接不稳定。在 Docker 的 daemon.json 里配置国内镜像源后重启即可。
新增模特报错,提示视频需有人说话:上传的视频没有声音或画面里没人开口,声音克隆无从下手。换一段人在说话的清晰视频即可。
克隆时报 Connection refused:服务端刚启动时 ASR 服务还要几分钟才能就绪。等几分钟再试;如果16G内存的机器频繁出现,建议升内存。
更多问题可对照 doc/常见问题.md 自查,排查前先确认三个服务是否 Running、显卡驱动是否装好。
写在最后
至此,一套完全离线、不限次数的数字人生产线已经在你的电脑上跑起来了。先克隆一个属于自己的形象,再让一段文字变出第一条口播视频。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考