10秒视频克隆数字人:免费完整本地部署Duix.Avatar数字人视频生成
发布时间:2026/9/11 16:52:49 作者:尧图编辑部 阅读量:1,286

10秒视频克隆数字人免费完整本地部署Duix.Avatar数字人视频生成【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar你想让自己的脸和声音出镜讲视频但外包 3D 建模又贵又慢网上服务又担心素材隐私。Duix.Avatar 是免费开源、全离线运行的 AI 数字人工具包上传约 10 秒视频即可克隆外貌与声音输入文案自动生成口型同步的口播视频。全程只需 3 个 Docker 服务镜像下载约 70GB支持 8 种语言。它凭什么值得用先看传统 3D 数字人制作与本项目本地部署的差距表中数字全部来自项目官方文档维度传统 3D 数字人Duix.Avatar制作成本数十万美元量级约 1,000 美元官方英文 README 原话从数十万美元降到 $1,000建模素材专业团队建模周期以周计一段 10 秒真人视频联网要求多为云服务全离线数据不出本机语言支持依赖配音/翻译中、英、日、韩、法、德、阿拉伯、西语共 8 种商用授权付费全球免费商用用户量超 10 万或年营收超 1,000 万美元的企业需签署商业许可协议对个人和中小团队最实在的变化是不用采购 GPU 服务器不用养 3D 团队一台装了英伟达显卡的 Docker 机器就能跑。原理速览Duix.Avatar 本质是三个模块串联看明白数据怎么流转你就看懂了这个项目。1. 声音克隆从 10 秒音频到无限同音色输入你 10 秒视频里提取的人声客户端自动把视频分离成静音视频音频音频放入D:\duix_avatar_data\voice\data。 处理fun-asr 服务ASR自动语音识别把语音转成文字先把这段音频转写成文本fish-speech 服务再基于音频文本训练出参考音频 reference_audio 与参考文本 reference_text。 输出之后任意文案送进合成接口http://127.0.0.1:18180/v1/invoke就得到同音色的 wav 音频。调用细节见 src/main/service/voice.js。2. 口型视频合成从音频到口播视频输入上一步的 wav 你的数字人视频。 处理duix.avatar 容器本地 8383 端口根据音频的节奏与语调驱动口型与表情。 输出http://127.0.0.1:8383/easy/submit提交任务/easy/query?code...轮询进度最终拿到口型对齐的视频。实现参考 src/main/service/video.js。3. 全本地编排deploy/docker-compose.yml 定义三个容器duix-avatar-tts18180、duix-avatar-asr10095、duix-avatar-gen-video8383全部跑在本地英伟达显卡上。客户端是 Electron Vue 应用依赖 Node.js 18模特与作品数据全部落在D:\duix_avatar_data没有任何数据外发。上手实测以下流程以 Windows 为例Ubuntu 22.04 用户只需替换服务端启动命令。第 1 步拉取代码并检查硬件git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar你会看到当前目录多出一个Duix-Avatar文件夹内含deploy/、src/子目录。动手前确认Windows 10 19042.1526 或 Ubuntu 22.04官方已验证内核 6.8.0-52-generic装好 Node.js 18执行nvidia-smi能看到显卡没有英伟达显卡和驱动三个服务起不来C 盘留 100GB 给镜像、D 盘留 30GB。看到request canceled while waiting for connection报错 → 通常是 Docker Hub 官方源连接不稳 → 按 doc/常见问题.md 的指引在 Docker 的 daemon.json 里加 registry-mirrors 镜像源并重启。图在 Docker Desktop 的 Settings → Docker Engine 中配置国内镜像源解决拉镜像超时第 2 步启动三个服务端cd deploy docker-compose up -dUbuntu 用户改为执行docker-compose -f docker-compose-linux.yml up -d50 系显卡用docker-compose -f docker-compose-5090.yml up -d官方 5090 测试通过30/40 系 CUDA 12.8 也可用。你会看到约半小时后70GB 下载建议连 WiFiDocker 中出现 duix-avatar-tts / duix-avatar-asr / duix-avatar-gen-video 三个服务且全部 Running。只需要视频合成服务时可用 lite 版只起一个 duix-avatar-gen-video。定制模特时看到[Errno 111] Connection refused→ 通常是 ASR 服务启动慢 → 服务端起来后等几分钟再试若机器内存偏小16G可能根本起不来来源doc/常见问题.md。第 3 步安装客户端进入主界面双击Duix.Avatar-x.x.x-setup.exe安装到项目 release 页下载对应系统安装包Ubuntu 直接双击 AppImage 运行无需安装root 用户需加--no-sandbox参数启动。你会看到主界面顶部是 Create Video 与 Create Avatar 两个大入口下方是 My Works / My Avatars 列表。图客户端主界面左侧管理作品与数字人模特顶部进入视频创建与形象克隆客户端一直报连不上服务端 → 通常是三个服务未全部 Running 或 18180/8383 端口未放行 → 回到/deploy目录重新执行docker-compose up -d。第 4 步克隆数字人产出第一条视频点击 Create Avatar 上传 10 秒视频等训练完成再点 Create Video选形象、输入文案或上传自己的音频点击生成。你会看到My Avatars 出现形象卡片合成完成后 My Works 里可以下载口播视频。新增模特时报错 → 通常是视频没有声音或不是人在说话程序要用这段声音做声音克隆→ 重新录一段有人声、单人出镜的清晰视频来源doc/常见问题.md。真实场景场景一企业内训 / 合规宣导视频需求批量产出标准化口播视频且培训素材与内部口径不能流到任何云服务。 关键配置按 deploy/docker-compose.yml 完整部署三个容器模特与作品数据统一放D:\duix_avatar_data官方推荐配置为 i5-13400F 32G 内存 RTX 4070。 效果数据每个模特只需 10 秒视频素材文案支持 8 种语言全程离线、无按次收费。场景二自媒体口播量产需求用数字人替身批量产出口播内容声音稳定不翻车。 关键配置小量用客户端点选即可要搭流水线就直连两个 API——http://127.0.0.1:18180/v1/invoke合成音频、http://127.0.0.1:8383/easy/submit合成视频参数示例都在 README 的开放 API一节。 效果数据商用免费用户量超 10 万或年营收超 1,000 万美元需签商业许可不限量次、不收月费。进阶与求助二次开发入口模特训练逻辑src/main/service/model.js视频合成逻辑src/main/service/video.js界面组件Vuesrc/renderer/src/views性能调优参数deploy/docker-compose.yml中视频合成服务的shm_size: 8g控制共享内存大小环境变量PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:512控制显存分配策略按你的内存与显存余量调整。排查顺序① 确认三个服务是否全部 Running②nvidia-smi检查显卡驱动③ 客户端右上角设置菜单 → Open Log 取客户端日志④ 点开对应 Docker 容器复制关键报错堆栈对照 doc/常见问题.md或直接提交到项目 issue 页面。图客户端右上角设置菜单里点 Open Log即可拿到客户端日志图Docker Desktop 中点开容器查看 TTS 服务日志把关键报错堆栈复制到 issueDuix.Avatar 目前能基于 10 秒视频全离线克隆外貌与声音并生成 8 种语言、口型同步的口播视频。下一步在deploy目录跑一次docker-compose up -d然后上传你第一段 10 秒视频。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考