首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
用10秒视频克隆你自己:Duix-Avatar AI数字人本地部署教程
📅 2026/9/11 15:18:40
✍️ 爱科研究院
👁 阅读 3,247
用10秒视频克隆你自己Duix-Avatar AI数字人本地部署教程【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix-Avatar是一款全离线的开源AI数字人工具上传一段10秒的说话视频即可完成外貌和声音克隆输入任意文案就能生成口型准确的口播视频数据全程不离开你的电脑。本文带你走完三个Docker服务的本地部署流程拆开从一段视频到成片的完整数据流并附上避坑速查与本地API对接示例。素材不出门为什么数字人要跑在本地想录一条口播视频专业剪辑软件学不会把形象和声音传到云端平台又总担心素材被留着。Duix-Avatar把这事做反了它相当于把影视后期棚搬进了本地电脑你喂它一段10秒说话视频它还你一个数字分身之后输入什么文字它就用你的脸、你的声音念出来。形象、声音、成片全部落在你的硬盘里。整个流程只有三步克隆形象 → 输入文案 → 拿成片。它能干什么一段视频 一段文字 一条会说话的视频先花一分钟把它的能力盘清楚形象克隆10秒左右、带人声的视频一次克隆外观和声音文字驱动视频输入文案自动用你的克隆音色合成语音并驱动口型音频直驱不走文字也行直接上传音频文件驱动数字人多音色管理可以建多个数字人档案做不同内容的视频时随意切换八种语言中、英、日、韩、法、德、阿拉伯语、西班牙语本地API服务跑在Docker里、暴露本地端口能接进你自己的脚本图AI数字人本地部署的主界面上半部分是视频创作入口下半部分是我的作品和我的数字人两个档案区能力看完了第一步是把服务端拉起来。所有算力都在本机三个Docker容器里所以部署比想象中简单——难的是你的硬盘和显卡。半小时拉齐三个后端服务先看一张环境表不满足再往下看项目最低要求推荐配置系统Windows 1019042.1526/ Ubuntu 22.04Windows 11 / Ubuntu 22.04 Desktop内存16GB偏紧ASR可能起不来32GB显卡NVIDIA8GB显存可用lite版RTX 407012GB显存硬盘装镜像的盘留100GB数据盘留30GB200GB SSD⚠️ 唯一硬门槛必须有英伟达显卡且驱动装好。三个服务全部跑在CUDA上CUDA简单说就是让显卡干AI运算的专用加速包AMD或核显的服务根本起不来。先敲一下nvidia-smi能看到显卡信息再继续。 第一步拿到项目代码git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar这条命令把整个仓库拉到本地并进入项目目录。 第二步预拉三个Docker镜像不拉也行compose会自动拉但预拉方便你看进度docker pull guiji2025/fun-asr docker pull guiji2025/fish-speech-ziming docker pull guiji2025/duix.avatar⚠️ 首次下载大约70GB流量务必连Wi-Fi或网线。C盘空间不足100GB时先在Docker Desktop设置里把镜像存储位置换到别的盘。图把Docker镜像存储位置换到剩余空间大于100G的磁盘避免C盘被镜像占满 第三步启动服务cd deploy docker-compose up -d等上半小时左右打开Docker Desktop看到duix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video三个容器都是Running状态 ✅服务端就算就绪。不同环境的启动命令在 deploy/docker-compose.yml 旁边都有现成的NVIDIA 50系列显卡如5090docker-compose -f docker-compose-5090.yml up -dUbuntu 22.04先装NVIDIA Container Toolkit再docker-compose -f docker-compose-linux.yml up -d8GB显存机器docker-compose -f docker-compose-lite.yml up -d只启动视频合成这一个服务客户端不用装Windows装官方setup.exeUbuntu直接跑AppImageroot用户进桌面要加--no-sandbox参数。三个服务各自负责什么记住这张表服务本地端口干什么TTS语音合成fish-speech-ziming18180把文字读成你克隆的音色ASR语音识别fun-asr10095把视频里的人声转成文字视频合成duix.avatar8383按音频驱动数字人做口型服务跑起来了真正的活儿才开始。不过先别急着点按钮把生成背后那条链路走一遍理解了这个黑盒后面报什么错你都不慌。点一次生成黑盒里到底发生了什么拆成两段看建模型是一次性的出片是每次的。建模型。你输入一段10秒说话视频注意必须带清晰人声。黑盒里客户端先用ffmpeg把视频转成H.264、抽出WAV音频丢给TTS服务TTS服务再调ASR服务把这段音频转成文字最后返回两个字段——reference_audio_url规整后的音频和reference_audio_text转写文本。这两个字段就是你的声音身份证之后每次合成都靠它调出你的音色。输出一个登记进我的数字人的形象档案。顺带说明这里的训练其实是特征提取加登记不是动辄几小时的模型训练。想深挖的话转码、抽音、登记这一整条链路都在 src/main/service/model.js。出片。你输入选一个数字人 一段文案或上传一段音频。黑盒里走三步TTS接口18180的/v1/invoke用你的克隆音色把文案读成wav——temperature、topP这些参数都是写死的固定值不用调把音频和形象原视频POST给视频合成服务8383的/easy/submit拿到一个任务code客户端每2秒轮询一次/easy/query状态1是生成中带进度2是完成3是失败你得到成片落在数据目录Windows是D:\duix_avatar_data\face2faceUbuntu是~/duix_avatar_data客户端我的作品里直接播放和导出。轮询、排队、状态机这些细节想看源码就去 src/main/service/video.js。搞懂链路后挑几个最典型的用法口播短视频量产一上午写好一天的文案全部丢进队列排队下午成片就能发内部培训录屏让部门负责人对着镜头说10秒自我介绍之后的制度通知、流程讲解都不用再进录音棚产品演示多语言版同一段演示稿切中英文各出一版八种语言都支持链路最顺的时候当然好但真上手总会踩上一两个坑下面这几个是社区里问得最多的。六个常见坑以及怎么修1.docker-compose up -d报request canceled/context canceledDocker Hub官方源不稳定。打开Docker Desktop → Settings → Docker Engine在右侧JSON里加registry-mirrors配置国内镜像源保存后Apply restart。镜像源会随时间失效搜一下最新的再用。图Docker Desktop里配置镜像加速的位置在Docker Engine的JSON中填入registry-mirrors数组2. 新建模特报错日志里是file not exists上传的视频必须有声音、且是人在说话。无声视频或纯BGM视频不行因为程序正是拿这段声音去做声音克隆的。3. 定制模特报Connection refusedASR服务启动慢。三个服务都Running之后再等三五分钟去建模特。另外16GB内存的机器可能直接起不来这属于硬件不够不是配置问题。4. 5090这类50系列显卡起不来用专门的compose文件基于torch预览版cd deploy然后docker-compose -f docker-compose-5090.yml up -d。30、40系列且CUDA 12.8的也可以用它。5. C盘被镜像占爆了100G级别的镜像默认落在C盘。装完Docker后在Docker Desktop设置里把镜像存储位置改到别的盘位置见上一节截图再拉镜像。6. 能不能商用开源版本全球免费商用但用户量超过10万、或年营收超1000万美元的企业需要签署商业许可协议仓库根目录的LICENSE里有完整条款。如果你不想被客户端界面限制想接自己的脚本其实更简单——三个服务本身就是HTTP接口。二次开发两个本地接口就够服务跑起来后通过http://127.0.0.1就能直接调。只挑最常用的两个① 视频合成POST http://127.0.0.1:8383/easy/submit{ audio_url: D:/duix_avatar_data/face2face/temp/xxxx.wav, // TTS生成的或你自己上传的音频 video_url: D:/duix_avatar_data/face2face/temp/xxxx.mp4, // 数字人模型的原视频 code: 自己生成一个唯一的uuid, // 查进度用 chaofen: 0, // 固定值 watermark_switch: 0, // 固定值0表示不加水印 pn: 1 // 固定值 }提交后轮询GET http://127.0.0.1:8383/easy/query?code上面的codedata.status为1是生成中带progress2是成功返回result路径3是失败。② 语音合成POST http://127.0.0.1:18180/v1/invoke。真正要填的只有三个字段text要合成的文案、reference_audio和reference_text建模特时那两个返回字段就是声音身份证其余都是固定传参直接抄 src/main/service/voice.js 里的现成值。两个接口串起来你甚至可以写个小工具Excel里存一天的文案脚本自动批量出片。下一步建议先跑nvidia-smi确认显卡被识别再去拉三个服务——这是最省排查时间的顺序服务起来后先用一段10秒说话视频建模特生成一句两句的测试片确认口型再排真正的文案用熟之后把8383的submit接口接进自己的脚本让成片自己跑出来【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/9/11 15:18:40
CMSIS-FreeRTOS源码静态审计:架构、调度器与内存管理深度解析
2026/9/11 15:18:40
MuJoCo相机系统实战:3种机位模式+关键调参,拍出专业仿真画面
2026/9/11 15:18:40
储能系统三大核:电池PACK、BMS与EMS/PCS协同的关键选型逻辑
2026/9/11 16:03:55
darwin-vm:用QEMU模拟苹果芯片,搭建XNU内核调试实验床
2026/9/11 16:03:55
苹果成熟度AI检测:YOLO多版本选型与农业场景工程落地
2026/9/11 16:03:55
问卷设计:为什么你问了30道题,导师却说“这数据没法用”?——毕夏AI官网的方法论拆解
2026/9/11 16:03:55
StatefulSet Pod域名访问原理与实战:从headless Service到外部负载均衡
2026/9/11 16:03:55
课程论文的“第一口呼吸”:毕夏AI官网如何把“写不出来”变成“改得动”
2026/9/11 15:58:49
用JavaScript和HTML5打造Web组态软件:渲染、数据驱动与工程实践
2026/9/11 0:02:03
数据容灾核心指标与实战方案解析
2026/9/11 0:02:03
Huly 平台 ClickUp 任务导入实战指南:从 CSV 导出到一键迁移全流程解析
2026/9/11 0:02:03
PyTorch 构建与代码生成工具链深度解析:从 tools 目录看懂构建流程、autograd/JIT 代码生成与 HIPify 移植
2026/9/11 5:40:15
超人会飞不算本事:系统稳定依赖清晰规则与边界设计
2026/9/11 8:29:24
超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论
2026/9/11 9:11:20
基于CNN的调制信号识别:MATLAB实现时频图分类实战