ComfyUI-WanVideoWrapper 上手指南:5 步跑通文生视频到口型动画
发布时间:2026/9/24 15:55:01 作者:尧图编辑部 阅读量:1,286

ComfyUI-WanVideoWrapper 上手指南5 步跑通文生视频到口型动画【免费下载链接】ComfyUI-WanVideoWrapper项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper想给电商团队交一条 5 秒的产品宣传视频拖入现成工作流却总在第一步报错模型找不到、显存不够。你要的其实是一套拖进来就能用的现成方案ComfyUI-WanVideoWrapper 就是这套东西。它是把 WanVideo 系列视频模型搬进 ComfyUI 的一体化成节点扩展文生视频、图生视频、音频驱动口型动画都在一个仓库里。5 步装好 ComfyUI-WanVideoWrapper 并跑通第一条视频打开终端把仓库克隆进 ComfyUI 的 custom_nodes 目录并装好依赖cd ComfyUI/custom_nodes git clone https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper pip install -r ComfyUI-WanVideoWrapper/requirements.txt重启 ComfyUI左侧节点面板多出 WanVideoWrapper 分类就说明装好了。下载 fp8 量化版模型readme 里的个人推荐版本显存占用更低文本编码器放ComfyUI/models/text_encoders视觉编码器放clip_vision主模型放diffusion_modelsVAE 放vae。把 文生视频示例工作流 拖进画布在正面提示词里写一句画面描述。点执行输出区出现第一支视频就算跑通了。文生视频一句话描述场景直接成片 说白了文生视频就是你把画面用一段话写出来模型逐帧把它画成视频全程不需要任何参考图。拖入文生视频示例工作流节点已连好。在正面提示词里写带镜头感的描述比如傍晚竹林小径古石塔静立光影缓慢移动。测试轮把分辨率设为 832×480、帧数 33、步数 20先确认画面方向对。确认后升到 1280×720、81 帧、30 步跑正式出片。参数测试值出片值作用分辨率832×4801280×720清晰度越高越吃显存帧数3381视频时长帧多更流畅步数2030步数越多细节越足CFG5.07.5提示词服从度过高会过曝⚠️ 第一次就上 720p 加 81 帧很容易显存溢出。先用小参数验证提示词再升档出片。图生视频让一张静态产品图自己动起来 ️说白了图生视频是拿你现成的照片当第一帧AI 负责把后面每一帧的运动补出来。拖入图生视频示例工作流。在 Load Image 节点加载产品图素材可取 example_inputs 目录里现成的。提示词写一句小动作泰迪熊轻轻眨眼睛怀里的玫瑰微微摆动。用测试参数先出短预览方向对了再拉长帧数。素材类型适合的动作提示词写法环境场景风吹、光影、云移微风掠过光影缓慢移动产品静物眨眼、轻摆、光带扫过产品缓缓转动高光流过表面人物肖像口型、注视、微笑人物开口说话表情自然⚠️ 静态图上写大幅动作跳跃、转身容易把画面撕裂。先用风吹、眨眼这类小动作验证。音频驱动口型让照片里的人跟着语音开口 说白了就是给一张正脸肖像加一段录音让照片里的人嘴型跟着声音对上做虚拟主播和课程讲解最实用。拖入 HuMo 示例工作流它内置了 Whisper 语音编码链路。图片节点载入正脸肖像音频节点载入一段干净的人声录音。audio_scale音频条件强度保持默认 1.0先验证口型对齐。觉得动作幅度不够再调audio_cfg_scale大于 1.0 会多跑一遍模型、渲染变慢。参数默认值调整方向num_frames81语音更长就同步加帧数width / height832×480分辨率越高显存占用越大audio_scale1.0太小口型会发闷可升到 1.2audio_cfg_scale1.0大于 1.0 允许更多动作更慢audio_start_percent0.0想让说话从视频中途开始就调大⚠️ 正脸、光线均匀的肖像效果最好。侧脸和大逆光的照片口型容易对不上。运动控制让主体沿着你画的路径走 说白了运动控制是给主体一条运动轨道AI 不再原地晃而是沿你指定的路线走位、转身。把 WanMove 节点 接到图生视频链路上输入驱动轨迹。用项目自带的example_tracks.npy示例轨迹文件先跑通一遍。主体会沿着轨迹生成位移提示词里补充速度感和视角描述。想直接复刻一段参考视频的动作改用 MTV 节点它吃参考动作视频。节点擅长的事参考工作流WanMove按轨迹走位WanMove I2V 示例MTV复刻参考视频动作MTV 示例SCAIL / SteadyDancer姿态控制适合舞蹈动作见 SCAIL 与 SteadyDancer 目录⚠️ 轨迹摆幅给太大主体容易漂移变形。先用 33 帧小范围轨迹验证再扩到 81 帧。常见问题与调优FP8、Block Swap、TeaCache 参数速查如果你加载 14B 模型直接显存溢出换 fp8 量化版模型再接 WanVideoSetBlockSwap 节点blocks_to_swap从 20 起步14B 共 40 个块1.3B 和 5B 是 30 个块上限 48。还是爆就每次加 2 到 4 个块显存管理逻辑在 diffsynth/vram_management 目录。如果你嫌每帧渲染太慢挂一个 TeaCache 节点rel_l1_thresh对 1.3B 模型取 0.05 到 0.08其他模型取 0.15 到 0.30。值越大越快但超过 0.3 开始出现画面瑕疵。如果口型动画的动作太小、人看起来像假人audio_scale从 1.0 提到 1.2想要动作更放开把audio_cfg_scale从 1.0 提到 1.2代价是推理多跑一遍、时间变长。如果你用 torch.compile 且换个新分辨率后第一次运行显存异常飙高这是 Triton 缓存问题清掉缓存目录Windows 下是C:\Users\用户名\.triton再重跑一次第二次就恢复正常。如果运动控制里主体跟着轨迹走但动作僵硬把帧数从 81 降到 33 验证轨迹本身轨迹没问题再调大提示词里的速度描述。下一步现在打开终端就能做拖入 HuMo 示例工作流找一张正脸照加一段 10 秒录音让照片里的人真的开口说话。第一支会动的视频比你想象的来得快 【免费下载链接】ComfyUI-WanVideoWrapper项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考