RTX 5070 Ti笔记本部署ComfyUI:12GB显存下的文生图与视频实战
发布时间:2026/10/4 9:56:19 作者:尧图编辑部 阅读量:1,286

RTX 5070 Ti 笔记本到手后我做的第一件事不是跑 3DMark而是装 ComfyUI。本地部署 ComfyUI 这件事在 4090 台式机上已经被聊烂了但换到 5070 Ti 笔记本这个场景情况完全不一样显存只有 12GB功耗墙也被厂家压着稍不留神就是爆显存、降频、OOM 三连。这篇就把我在这个配置上从零装好环境、跑通文生图、再到文生视频的完整过程记录下来包括那些踩过之后才知道的坑。适合刚入手 5070 Ti 或其他 12GB 显存笔记本、想本地玩 AI 出图的读者。文生图没那么玄文生视频也不是不能碰关键是搞清楚自己手里这张卡的边界。1. 先算清楚显存这笔账再决定怎么部署1.1 显存才是笔记本部署的命门很多人拿到笔记本先看 GPU 算力其实对 ComfyUI 来说显存大小才是决定体验的第一因素。出图时模型权重、VAE、CLIP 文本编码器、以及扩散过程中的中间 Latent 张量全部要驻留在显存里。一个简单类比算力是厨师的手速显存是厨房的台面。台面太小厨师再快也得频繁往柜子里存取食材整体速度反而被拖垮。RTX 5070 Ti 笔记本版最尴尬的地方在于它和桌面版的显存规格不一样12GB GDDR7 属于中等台面。这个容量跑 SD 1.5 绰绰有余跑 SDXL 也基本够用但碰到动辄十几 B 参数的视频生成大模型就必须精打细算。部署前先认清这一点后面就不会经常被六个屏幕上同时弹出的 CUDA OOM 吓到。1.2 5070 Ti 笔记本版能跑什么、不能跑什么我直接给一张按实际体验整理的边界表省得你一个个试任务类型典型模型12GB 显存下的实际表现文生图SD 1.5 系随便跑512 到 768 分辨率很稳文生图SDXL 系能跑1024 分辨率没问题叠加多个 ControlNet/LoRA 后会紧张文生图SDXL Turbo/Lightning 类很合适低步数出图快显存占用还低文生视频LTX Video2B原生可跑短片段很流畅文生视频Wan 2.1 1.3B可跑建议 FP8 量化分辨率别贪文生视频Wan 2.1 14B / 混元视频 13B必须 GGUF 量化低分辨率出片慢能跑但要有耐心这条表是我反复开关任务管理器、盯着 nvidia-smi 的显存占用总结出来的。结论很简单5070 Ti 笔记本不是不能做文生视频而是需要按头定做——模型选对、量化到位、分辨率降低它就能干如果什么都不管直接加载 14B 全量模型第一秒就会爆。1.3 Blackwell 新架构带来的工具链要求Blackwell 架构带来了一个新的东西FP4 精度支持。这个特性在 ComfyUI 里目前主要体现在部分新模型和量化方案上日常使用不必刻意追求但需要知道在 12GB 显存上FP8 量化是性价比最高的中间路线既保留画质又明显降低显存占用。VT 上实际体验下来FP8 的 Wan 2.1 1.3B 比 FP16 版本能多吃不少帧数画质损失在预览片段上基本看不出来。同时工具链版本不再是随便装个最新的就行。5070 Ti 需要的显卡驱动建议直接装 NVIDIA 官网的新版 Game Ready 或 Studio 驱动5xx 系列CUDA 版本对应 12.4 以上。PyTorch 也要选带 cu124 或更新版本的 wheel。这些都是部署时最容易踩的隐性地雷后面会再展开。2. 环境准备整合包和手动部署我建议按需求走2.1 秋叶整合包新手保底方案如果你之前完全没碰过 Python也不打算长期研究插件之间的依赖关系我建议第一套环境直接用秋叶整合包。这不是什么丢人的事整合包的本质是别人帮你把 Python、PyTorch、ComfyUI 主程序、常用插件、模型目录结构全部装好你只需要解压、启动、下模型。对大部分只想出图的人来说这是最短路径省下的一两个小时拿去学工作流更值。整合包有几个默认配置是笔记本用户可以留意的启动器里通常会提供低显存模式选项显存不足时能自动加--lowvram参数管理界面里也整合了模型下载功能。不过整合包的缺点也很明显它内置的 Python 是独立的和系统隔离这既是优点也是缺点——优点是卸载方便缺点是你以后想装某些需要手动编译的节点比如 Sage Attention时会多一道找到它用的 Python 解释器的功夫。这个我在第五节再讲。2.2 手动部署venv 环境从头搭想长期搞 ComfyUI、愿意和插件坑搏斗的人我更推荐手动部署。手动部署的最大优势是透明度每个组件装在哪个目录、版本是多少、报错时能直接定位到具体包。下面是完整命令序列Windows 和 Linux 通用Windows 下激活 venv 命令略有差异git clone https://github.com/comfyanonymous/ComfyUI.git cd ComfyUI python -m venv venv # Windows 下一步 venv\Scripts\activate # Linux/macOS 下一步 # source venv/bin/activate pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu124 pip install -r requirements.txt python main.py跑起来后浏览器打开http://127.0.0.1:8188就能看到默认工作流。这里有个细节pip install torch ... --index-url指定的是 PyTorch 官方 CUDA 12.4 的 wheel 源这一步是整条链路最关键的。如果你直接执行pip install torch装到的是 CPU 版或默认 CUDA 版本ComfyUI 能启动但所有运算都跑在 CPU 上速度慢到怀疑人生。2.3 Python 与 PyTorch 版本最容易翻车的一环版本选择上我吃过亏。一开始我图新鲜装了 Python 3.13结果一堆视频生成相关节点直接报编译错误后来换回 3.11 才顺利。ComfyUI 官方目前对 3.10 到 3.12 支持最稳其中 3.11 是社区里出问题最少的。记住这不是越新越好的地方而是生态兼容性说了算的地方。PyTorch 同样别乱追新。我的建议是装 2.3 到 2.5 之间的稳定版配合 cu124 或 cu126 的 wheel。装完务必做一次快速验证在命令行里跑import torch print(torch.__version__) print(torch.cuda.is_available()) print(torch.cuda.get_device_name(0))如果torch.cuda.is_available()返回True并且设备名正确显示 RTX 5070 Ti环境这一步就算过了。很多人在 ComfyUI 启动后遇到CUDA not available的报错基本都是前两步没做对PyTorch 装成 CPU 版或者驱动太老系统里同时存在多个 CUDA runtime 时把 PyTorch 带偏了。3. 模型下载与目录规划别把所有东西都塞进 checkpoints3.1 ComfyUI models 目录到底该怎么用新手最常见的混乱来源是把所有文件一股脑丢进models/checkpoints然后在加载节点里找不到东西。ComfyUI 的目录设计其实很清晰每个文件夹负责一类组件我实际用的目录结构是这样的目录存放内容对应节点models/checkpoints文生图底模SD/SDXL 的 .safetensorsCheckpointLoaderSimplemodels/vae独立 VAE 文件VAELoadermodels/lorasLoRA 微调模型LoraLoadermodels/controlnetControlNet 模型ControlNetLoadermodels/diffusion_models视频大模型/DiT 权重Wan、混元等UNETLoader / DiffusionModelLoadermodels/text_encodersCLIP、T5 等文本编码器CLIPLoadermodels/embeddings用于负面词或风格的 embedding嵌入到文本编码流程特别提醒新版 ComfyUI 里视频大模型默认放models/diffusion_models旧教程总让你放models/unet两者在新版中都能识别但为了少出岔子我建议跟随当前版本的默认路径下载完模型后如果节点下拉列表里看不到先刷新页面还看不到就去确认文件扩展名是否以.safetensors结尾.bin文件有时候也能用但兼容性差一些。3.2 文生图模型怎么选SDXL 还是蒸馏加速模型文生图底模的选择取决于你想要质量还是速度。SDXL 系模型在 1024 分辨率下的细节和构图明显比 SD 1.5 好一大截代价是权重文件大约 6-7GB采样步数通常在 20 到 30 步。如果你就是想快速迭代 prompt、比如做人像摄影构图练习我建议留一个 SD 1.5 模型约 2GB做草稿定稿再用 SDXL。2025 年之后社区里出现了一批蒸馏加速模型比如名字里带 turbo、lightning、或者类似 z-image-turbo 风格的工作流它们的本质是用少步数蒸馏技术把常规 20-30 步的采样过程压缩到 4-8 步同时对 CFG 的要求也变了通常只要 1 到 2。这类模型在 5070 Ti 笔记本上非常舒服因为步数少意味着出图峰值显存占用时间短整体功耗和发热也降下来了。我现在的日常流程是SDXL 模型打底出正式图快速迭代时切 Turbo 类模型两边互补。3.3 文生视频模型的选型从 LTX 到 Wan 再到混元如果你和我一样第一次接触文生视频千万别一上来就挑战最大的模型。12GB 显存的现实是参数越多的模型推理时中间张量也越大全量推理基本都会被显存卡死。我按推荐顺序排一下吧。LTX Video约 2B 参数是最适合入门的选择。它生成的视频分辨率可以到 480p 左右、支持文生视频和图生视频在 5070 Ti 上跑一段 3 秒的片段需要的时间相对可控画质虽然不如大模型细腻但足以让你理解视频工作流的完整链路。Wan 2.1 1.3B是第二梯队纹理和运动逻辑明显更好建议直接下 FP8 量化版能在 12GB 显存里留出更多余量。Wan 2.1 14B 和混元视频Hunyuan Video属于进阶选项必须搭配 GGUF 量化比如 Q4_K_M 或 Q5_K_M才能进 12GB 显存生成速度会掉到一个很休闲的水平分辨率通常要压到 384 短边甚至更低。这里有个容易漏掉的关键点视频模型通常需要额外的文本编码器T5/CLIP和 VAE不像文生图 checkpoint 那样一个文件包含全部组件。从 Hugging Face 下载视频模型时页面里通常有diffusion_model、text_encoder、vae多个文件要分别放到对应目录少一个都会在工作流里报错。3.4 被忽略的 VAE 和文本编码器文生图出黑图、颜色发灰发紫八成是 VAE 问题。很多 SDXL 底模在发布时把 VAE 内置了用起来没问题但换到某些社区模型或视频模型时内置 VAE 可能缺失或质量一般。遇到这种情况单独下载一个官方的sdxl_vae对 SDXL或兼容的 fp16 VAE 文件放到models/vae然后工作流里加一个 VAELoader 节点连接到模型的 VAE 输出上问题立刻解决。文本编码器同理。SD 1.5 和 SDXL 一般用 CLIP-L 就够视频模型往往需要 T5-XXL 或大 CLIP动辄 4-7GB。有的新人下载模型时只盯住扩散模型主体结果加载节点一直找不到对应的 text encoder 文件以为是模型坏了实际上是没把配套文件放进去。模型主页的介绍文件都会写清楚你还需要什么花两分钟看一眼能省一小时排错。4. 文生图工作流跑通节点怎么连、参数怎么调4.1 第一张图的工作流拆解ComfyUI 默认打开就是一个空白编辑器但第一节后你会看到历史内置了一个最基础的工作流名字大概叫 Basic workflow。它的节点链路是Load Checkpoint→CLIP Text Encode正向提示词→CLIP Text Encode负向提示词→Empty Latent Image→KSampler→VAE Decode→Save Image。逐个说人话Load Checkpoint加载底模同时把模型里的 CLIP负责把文字变成条件向量和 VAE负责把潜空间图像解码成像素带出来。CLIP Text Encode是提示词编码器正向写成你想要的内容负向写你不想出现的内容。负向提示词不是网上流传的万能咒语它只是给采样过程一个避开方向对 SDXL 来说负向写得太多反而限制构图。Empty Latent Image设置画布尺寸也就是分辨率。分辨率影响的不只是清晰度还有显存占用SDXL 的推荐区域是 1024x1024 附近。KSampler是扩散采样的核心参数见下节。VAE Decode把隐空间张量解码成正常图像。Save Image保存并预览。第一次跑图别急着改任何节点结构先用默认 20 步跑一张验证链路没断再逐步加深。4.2 KSampler 参数背后的逻辑KSampler 里的参数看着多真正影响结果的其实就四组steps步数、cfg提示词引导系数、sampler/scheduler采样器和调度器、seed随机种子。steps采样步数越多理论上越接近模型学到的分布但收益递减。SDXL 常规 25-30 步SD 1.5 常规 20 步Turbo 类模型 4-8 步。别盲目加步数超过 40 步之后大部分模型不会变好只会变慢。cfg控制提示词对结果的约束力。SD 1.5 常用 7-10SDXL 常用 6-8。cfg 太高会让图像过饱和、塑料感强太低则内容发散提示词里的要素容易丢。Turbo 蒸馏模型特别敏感一般 1 到 2。sampler/scheduler不同的采样器对显存峰值几乎没有影响但对画面风格有一定影响。在 5070 Ti 上我更推荐euler/euler_ancestralnormal这类经典组合出图稳定和大多数社区模型兼容性最好。dpmpp_2mkarras也不错细节锐利一些。seed换个种子等于换个初始噪声想复刻同一张图记下 seed想微调构图固定 seed 改提示词比如把清晨的光改成黄昏的光对比效果时能排除随机性干扰。4.3 速度与质量的平衡Turbo 类模型的实际用法把采样步数从 25 压到 6出图速度能提升四倍以上这就是蒸馏模型的核心价值。在使用 Turbo 类模型时有一个必须调整的点把 KSampler 的cfg降到 1 到 2同时把默认采样器换成与模型匹配的那个模型主页会写。有人直接把 Turbo 模型套进普通工作流结果图糊成一团十有八九是 cfg 还在 7。另一个实用技巧用 Turbo 模型出草稿速度快但细节精致度通常略逊于完整 SDXL。我的习惯是两阶段配合先用 Turbo 模型快速确定构图和 prompt 方向再用 SDXL 底模加 LoRA 以较高步数出成品。对笔记本来说这样还能避免长时间满载导致的温度墙问题。4.4 首跑必遇的四个问题这段时间混社区发现新手首跑遇到的坑非常集中。列出来省得你一个个搜黑图或灰图检查 VAE。在 Load Checkpoint 节点旁边加一个 VAELoader或者换一个内置 VAE 质量好的 checkpoint。直接报 CUDA OOM显存不够。优先降 Empty Latent Image 分辨率从 1024 降到 768 或 512再不行换 SD 1.5 模型或给 ComfyUI 启动参数加--lowvram。NaN 错误或者画面出现彩色噪点通常发生在某些 FP8 量化模型搭配老采样器时换用 Euler 采样器、或改用 FP16 权重可解决。加载模型时报key not found模型文件和版本不匹配比如把 SDXL 的 VAE 文件直接当 checkpoint 加载。检查文件类型是否和节点匹配。遇到 OOM 后最实用的做法是直接重启 ComfyUI 进程因为显存碎片不会因为一次报错自动清干净硬撑着继续跑往往会连续 OOM。这个问题的根源是显存分配策略而不是某个设置项后面第五节再细聊。5. 文生视频12GB 显存不是禁区但要会做取舍5.1 12GB 能碰哪些视频模型文生视频在 12GB 显存上是一个需要明确定位的话题。先给结论可以玩但别期望它在 5070 Ti 笔记本上和桌面 4090 一样跑 1080p 长视频。视频模型推理时除了模型权重还要为每一帧的噪声和中间特征图分配显存这就导致同样的参数量视频比静态图吃显存得多。我实测后给出的优先级LTX Video 2B首选真正适合 12GB 的模型。短片段3 到 5 秒能原生推理速度快适合摸清视频工作流。Wan 2.1 1.3B FP8画质比 LTX 好一个档次VRAM 占用约 6-7GB还有余量处理文本编码器和 VAE。12GB 用户最平衡之选。Wan 2.1 14B GGUF Q4能跑但 VRAM 占用会靠近 10GB 甚至更高分辨率必须压到 384/480 级别出片等待时间以分钟计。混元视频 13B GGUF同样是能跑但费劲档位适合喜欢折腾量化参数的玩家。下载视频模型时认准模型来源页的推荐搭配文件名里通常带fp8、gguf字样。千万别看到 14B 全量 fp16 文件就下12GB 显存加载它第一步就死了。5.2 视频工作流实例Wan 2.1 1.3B 跑通以 Wan 2.1 1.3B 为例工作流的搭建顺序如下。先确认你已经把三类文件分别放好diffusion_models里的 FP8 主模型、text_encoders里的 T5 编码器、vae里的 Wan VAE。然后在 ComfyUI 中新建一个流程也可以从 ComfyUI 官方示例工作流里下载现成的 Wan 模板再改路径用UNETLoader加载 Wan 主模型loader_type选unet。用CLIPLoader加载 T5 文本编码器。用VAELoader加载 Wan VAE。正向提示词只写画面内容比如一只橘猫从窗台跳下来背景是傍晚的城市镜头缓慢推进。设置视频参数帧数建议从 17 帧起步分辨率从 480x480 或 512 短边起步。采样器沿用 KSampler步数 20 左右cfg 按模型说明设为 3-4。最后接入VAEDecode和Save Video节点。第一次跑通时我开的是 17 帧、512x512、FP8 模型显存峰值在 8GB 上下系统内存占用在 8GB 左右整体能顺利完成。如果你想加长到 33 帧建议先把分辨率降到 384不然很容易在采样中段顶到显存上限。5.3 Sage Attention 加速与 Windows 的 triton 坑文生视频比文生图慢一个数量级所以社区里大家都会装加速节点最常见的加速手段是Sage Attention。它把标准 Attention 计算替换成灰度感知的近似算法对视频这种高分辨率序列推理提升明显在我这台机器上部分片段渲染提速了约 20% 到 30%同时显存峰值有一定下降。安装步骤不复杂但有一个非常折磨人的坑通过 ComfyUI Manager 搜索并安装 Sage Attention 节点时它对 Windows 的支持情况一般因为你还需要先让 Python 环境里有triton库而官方 triton 在 Windows 上长期是半残状态。如果你用的是手动部署的 venv 环境我建议直接用pip install triton-windows社区维护版本然后再给 SageAttention 编译依赖。整合包用户则优先走 ComfyUI Manager 的自动安装失败时再检查内置 Python 路径。如果你在这上面折腾太久我建议先放弃加速用--disable-sage-attention或直接回归普通 Attention 跑通流程这并不影响画质只是慢。加速是锦上添花不是必需项。5.4 爆内存真实排查链路社区里关于视频生成最常见的求助就是爆内存生成到一半内存占用飙升系统卡死甚至直接蓝屏。我一开始以为纯粹是显存不够后来仔细排查发现这事要分几步看。首先明确一个机制Windows 在显存不足时会把 GPU 的共享内存Shared GPU Memory作为兜底而共享内存就是从你的系统内存条里划出去的。所以当你看到任务管理器里内存涨到 90% 以上未必是 ComfyUI 在乱吃内存而是显存爆了之后开始借用系统内存。这种情况的根源是显存不足直接解决方式是降低模型精度、分辨率或帧数让显存占用降下来。其次是真正的系统内存不足。ComfyUI 加载多个模型、处理视频帧序列时确实会占用大量 CPU 内存。我的排查链路固定是这一套按顺序做开着nvidia-smi -l 1盯显存占用同时看任务管理器内存曲线先判断是显存溢出还是内存溢出。若显存占用曲线撞到 12GB 后内存才开始暴涨判定为显存不足。优先换 FP8/GGUF 模型或把分辨率降一档。若显存没满但内存先爆检查 Windows 虚拟内存页面文件。视频生成时系统内存很容易到 16GB 以上页面文件过小会被强制回收或崩溃。我给自己的建议是 C 盘剩 30GB 以上页面文件至少设置 32GB。在 ComfyUI 启动参数里加--cpu-threads 8限制 CPU 线程避免和 GPU 数据传输抢资源。如果多个模型轮换加载时容易内存激增加--disable-async-unload关掉异步卸载减少模型同时驻留。这条链路帮我定位了大部分 OOM 和卡死问题。视频生成比出图更考验整机内存如果笔记本本身只有 16GB 内存做视频前最好先关掉浏览器的一堆标签页因为 Chrome 和 ComfyUI 抢内存是真实会发生的。6. 笔记本特有状况混合显卡、功耗墙和长时间生成6.1 独显没被启用怎么处理笔记本普遍是核显独显的混合输出架构ComfyUI 是基于 CUDA 的理论上会优先选择 NVIDIA 独显但如果你发现风扇不转、GPU 利用率低、速度慢得离谱大概率是系统把计算指派给了核显或者 ComfyUI 没被识别为高性能应用。处理方法打开 NVIDIA 控制面板 → 管理 3D 设置 → 程序设置 → 添加python.exeComfyUI venv 里的那个→ 首选图形处理器设为高性能 NVIDIA 处理器。如果你用的是整合包同样把它的启动器 exe 加进去。改完重启 ComfyUI再用nvidia-smi确认进程是否真的挂在 GPU 上。一个小提示Windows 的电源模式也要切到最佳性能否则笔记本在电池或节能策略下会主动压低 GPU 功耗出图速度直接腰斩。6.2 功耗墙与温度墙的应对5070 Ti 笔记本版出厂会有一个功耗墙TGP范围不同品牌调校差异很大。长时间跑视频生成时GPU 温度一旦冲到 85-90 度驱动就会自动降频这时候显存占用看着没变但出图速度会越来越慢这就是很多人说的越跑越慢。我的经验有三条第一物理散热优先把笔记本垫高或者用支架保证底部进风通畅。第二用 MSI Afterburner 这类工具给 GPU 设定一个温度目标比如 83 度让它在撞温度墙之前主动微降频率整体速度反而比反复撞墙降频稳。第三如果你只是短时间出图不用过度焦虑跑完一张图后让 GPU 自然降温别连续满负荷轰炸视频生成这种长任务建议在晚上的凉爽环境跑。6.3 长时间生成时的稳定措施连续生成 20 段视频中途最怕两件事系统自动休眠和驱动超时重启。我吃过一次亏挂机生成 10 分钟回来后发现屏幕黑了唤醒后任务竟然失败。后来学乖了插电运行Windows 电源选项里把睡眠设为从不。用管理员运行powercfg /change standby-timeout-ac 0直接禁止插电待机。视频生成时不要同时开大型游戏或视频剪辑软件内存竞争是卡死主因。后台挂着 ComfyUI 时把浏览器切到轻量页面Chrome 的内存占用比你想象的恐怖。还有一个容易被忽略的点尽量让 ComfyUI 保持前台或至少不在最小化状态下被系统判定为低优先级。虽说现代 Windows 不会因为最小化就砍掉 GPU 任务但桌面窗口合成器的调度有时会干扰事件循环终归前台更稳。这些折腾完之后这台 5070 Ti 笔记本对我来说就是一台可以背着走的 AI 出图工作台。从第一次跑黑图的挫败到最终稳定产出短视频片段最值钱的体会是本地部署 ComfyUI 从来不是性能问题而是显存规划问题。入门时别再纠结能不能跑先问自己打算跑多大的模型、用多高的分辨率答案自然就出来了。最后再分享一个小技巧每次装完重要节点或模型记得用 ComfyUI Manager 做一次配置快照后面环境乱的时候能少哭十分钟这个习惯救过我两次。