GPT Image 2.5发布之后我朋友圈和几个AI绘画群里几乎每天都在刷屏不过大多数人晒的还是单张图。单张确实惊艳文字渲染准了细节丰富了光影也正常了。但作为一个常年做条漫分镜和角色设定的人我真正关心的点始终只有一个它能不能让同一个角色在连续画面里不“换脸”。测试了两天结论是能前提是得把双参考图用对。这篇文章就把我跑通一个连续四格故事的完整流程、提示词写法、以及翻车排查记录都整理出来给想用它做连续叙事的朋友一份可以直接抄作业的参考。先说明我的使用环境。我是在ChatGPT对话框里直接调用图像生成能力的模型版本身份识别为GPT Image 2.5也就是大家常说的Image 2.5。我全程使用双参考图模式一张角色设定图一张风格参考图配合详细的分镜提示词逐格生成一个四格故事。故事内容我特意选了一个非常简单的日常片段女孩早上在阳台收衣服发现一件T恤被风吹到楼下树枝上下楼去够最后用晾衣杆挑回来。情节越简单越能单独检验角色一致性和画面连续性这两件事。如果你也想做连续多格漫画、故事板或者角色漫游场景这篇的思路可以直接平移过去。1. 双参考图的价值为什么它能解决“连续感”这个老大难1.1 一致性问题的根源单张参考图的信息瓶颈在Image 2.5之前我用过好几代图像生成模型做漫画分镜最崩溃的问题永远是“角色漂移”。第一格的女孩是圆脸短发第二格脸突然窄了第三格头发长度变了第四格连衣服花纹都不对。问题的根源不是模型笨而是单张参考图的信息密度不够。一张参考图能传递给模型的信息主要包括角色长相、发型、服装、画风、光照这几个维度。当你只丢一张图进去模型需要从这张图里同时提取“这个角色长什么样”和“这个画面是什么风格”这两个任务会互相争抢注意力资源。尤其是角色画面占比小、背景复杂的情况下模型更容易抓错重点导致生成时角色特征模糊每跑一次就飘一次。双参考图的方式把这两个任务拆开了一张专门承担“角色是谁”一张专门承担“画面长什么样”。模型在处理时有了明确的分工角色特征被锁定在一张干净的设定图上风格信息由另一张图持续供应。这个思路在绘画行业里其实很常见——原画师画角色设定图背景师画气氛图最后合成时两边各取所需。Image 2.5只是把这个工作流搬进了模型里。1.2 双参考图的数据结构角色与风格分离实际测试中我发现双参考图的权重分配并不是对半开的。角色设定图对生成结果的影响明显更强尤其是在角色的五官、发色、服装颜色这些硬特征上风格参考图的影响则集中在线条粗细、色彩倾向、光影渲染方式这些“质感”层面。这跟模型内部对参考图的编码方式有关。模型会把每张参考图分别编码成一个视觉特征向量再在生成时把这些特征“注入”到扩散过程的对应层里。角色特征更多作用在物体层级决定“画的是什么”风格特征更多作用在纹理和色彩层决定“怎么画”。所以在实际使用中如果你希望角色形象有绝对优先权就把角色图放在参考图的第一位风格图放第二位提示词里也按照“角色动作场景风格”的顺序写效果最稳定。1.3 适用范围什么样的项目最适合双参考图不是所有生成任务都需要双参考图。如果你只是想要一张氛围感很强的单图或者风景、建筑、静物这类没有固定角色的题材单图参考甚至纯文字提示词就够了强行上双参考图反而可能让画面变得拘谨。双参考图真正发挥威力的场景是这几种多格漫画、条漫、故事板需要同一角色跨多格保持外观一致系列插画、绘本同一人物出现在不同场景需要有统一的画风和角色特征角色IP二创官方角色图配合风格参考图生成符合特定风格的同人作品电商商品图变体一张商品标准图加一张场景风格图快速生成不同陈列环境下的展示图我做四格故事属于第一种也是测试下来效果最明显的一种。因为四格故事对角色一致性的要求高但对单格画面的精细度要求没那么苛刻正好在Image 2.5的能力边界之内。2. 开工前必做的准备参考图的质量决定上限2.1 角色参考图一张“标准像”该具备哪些条件很多人以为随便找一张角色的全身图当参考图就行其实这里面的要求挺细。我踩过几次坑之后总结出三个硬标准第一人物必须完整出现在画面里最好是半身像或全身像。如果参考图里人物被裁掉半边脸、脚被截出画面模型会倾向于复制这种“残缺感”生成的每一格都像被剪刀剪过一样。第二背景必须干净纯色人物与背景对比清晰。如果背景里有一堆杂物模型无法判断哪些信息属于角色、哪些属于背景容易出现衣服上凭空多出背景里的花纹这种诡异情况。第三面部要正对镜头光线均匀。侧面照、逆光照、大顶光都会让模型误解角色的五官结构生成后换个角度就变样。我用的角色参考图长这样一个二十多岁的短发女生穿着浅蓝色格子衬衫搭配白色T恤米色休闲裤站在一块纯灰色背景布前。光线是均匀的正面柔光整个人占画面六成以上。这样一张图喂进去模型提炼到的角色信息就非常干净。2.2 风格参考图别拿画面太复杂的图当风格参考风格参考图的选择和角色图完全相反越简单越吃亏但也不能太复杂。理想的风格参考图应该满足两个条件风格特征极其鲜明画面构成尽量简单。比如你想要日系清爽风就找一张天空占大面积的插画想要美式漫画风就找一张线条粗犷、配色浓烈的人物半身像。我在四格故事里用的风格图是一张清凉夏日系的小场景插画蓝天白云下的开阔街道整体色调偏青蓝线条细而流畅有种清爽的空气感。这张图最大的优点是色彩倾向非常明确模型一看到就能抓住“低饱和、高亮度、干净通透”这三个关键词。这里有一个关键提示不要把一张包含人脸的复杂插画当风格参考图尤其是风格图里的人物和角色图里的人物长得还不太一样。这个操作会让模型陷入纠结最后生成出来的人物既不像角色图也不像风格图两边都没讨好。我试过一次用带人物半身的赛博朋克插画当风格参考结果四张图里出现了四个不同版本的“赛博女孩”角色一致性直接崩盘。风格图最好是纯粹的风景、静物或者无人物的室内场景让模型只提取风格特征。2.3 提示词的四段式写法角色、动作、场景、镜头参考图负责提供“视觉锚点”提示词负责提供“叙事指令”。我测试下来一个稳定可复现的提示词模板包括四段角色段直接说明“参考图1中的女生”然后补充动作描述动作段核心肢体动作和表情比如“她踮起脚尖伸手去够树枝上的T恤”场景段每个格子的具体地点和关键道具比如“小区楼下地面有落叶旁边是绿化带”镜头段景别和机位比如“近景平视视角”或“全景略微俯拍”四段顺序尽量不要乱。模型对提示词前部的语义权重更高所以必须把最关键的“角色身份”放在最前面否则模型容易把场景和动作当成首要目标角色反而变成陪衬。我在第一格和第二格的测试中发现只要角色段放在提示词前两句角色相似度能稳定在“一眼能认出是同一人”的水平一旦角色段排在中间或后面相似度就会明显下降。3. 四格故事实操全流程从分镜到成图3.1 写分镜脚本四格不是四张图是一件事的起承转合四格漫画的核心是叙事效率每一格都要承担明确的推进任务。我在动笔生成之前先花十分钟把四格的内容写在纸上第一格起因女孩在阳台发现T恤被吹下楼表情惊讶第二格发展她跑下楼看到T恤挂在树枝上第三格高潮她踮脚伸手去够差一点够到表情紧张第四格结局她用晾衣杆挑下T恤脸上露出如释重负的笑容分镜脚本越具体提示词越好写参考图的“锚定”效果也越强。别跳过这一步直接去生成否则每一格提示词都会写得很笼统出来的画面连你自己都不知道角色在干嘛。3.2 第一格生成建立全故事的视觉基准第一格是整个故事里最重要的一张图它承担双重任务叙事上交代场景和角色技术上为后续三格提供视觉基准。所以第一格要用全景或中景把环境交代清楚让角色完整出现在画面里。我第一格的提示词是这样写的参考图1中的女生站在阳台上低头看着楼下表情惊讶左手扶在阳台栏杆上。她穿着浅蓝色格子衬衫和米色休闲裤。阳台上有晾衣架一件白色T恤被风吹落挂在楼下的树枝上。全景平视视角。画面风格参考图2清爽的夏日光线低饱和色调。这个提示词包含了角色、动作、场景、镜头、风格五个要素并且把“风格参考图2”这句话明写进了提示词里引导模型把参考图2作为风格来源。生成结果第一眼就能看出效果角色的发型、衬衫颜色、面部特征基本和参考图对上了画面的青蓝色调和通透感也明显带着风格参考图的影子。最重要的是第一格生成的栏杆高度、阳台朝向、楼下的树木位置为后面几格的场景连续性提供了参照物。3.3 第二、三格生成连续动作的关键技巧第二格和第三格是动作连续性的重点也是最容易出问题的环节。问题主要出在“前一格的动作结束了下一格的动作得接上”这个逻辑上。模型本身不理解故事因果它只知道当前格子的提示词所以提示词里必须写清楚动作的前置状态。第二格我写的是参考图1中的女生出现在小区楼下正缓步走向那棵挂着白色T恤的树。她看着树上的T恤表情有些急切。中景略微俯拍。画面风格参考图2保持青蓝调和通透光线。第三格写的是参考图1中的女生站在树前踮起脚尖右手高高抬起指尖刚好差几厘米够到挂在树枝上的白色T恤。她的表情专注紧张。近景平视视角。画面风格参考图2。第二格和第三格之间我特意加了“缓步走向”和“站在树前”这样的衔接词让模型在生成第三格时知道人物已经到达了目标位置。实际跑下来第二格和第三格的角色一致性保持得很好T恤在树枝上的位置也基本一致没有出现“第二格在左边树枝、第三格跑到右边树枝”这样的穿帮。这里提一个细节跨格场景一致性除了靠提示词还可以让角色参考图和风格参考图保持固定不变这样至少角色外观和画面风格不会突然漂移。场景中关键道具的位置一致性则需要在提示词里反复描述同一种状态。比如我每一格都提到“白色T恤挂在树枝上”模型就会倾向于复用上一格已经建立的空间关系。3.4 第四格生成文字气泡和收束画面的处理第四格是故事的收尾画面信息量通常最小但情绪浓度最高。我第四格用了一个小动作——用晾衣杆挑下T恤配合角色放松的表情来收束。参考图1中的女生右手握着晾衣杆已经把树枝上的白色T恤挑了下来T恤在她肩膀上方展开。她脸上带着如释重负的笑容。近景平视视角。画面风格参考图2。Image 2.5这一代最让我满意的部分是文字渲染对话框里的字基本不会乱码了。我在第四格加了一个小的漫画对话气泡提示词里直接写“气泡里写着‘终于拿到了’”生成结果是准确的五个字排列在气泡中央字体大小和位置都很自然。这在之前的模型上几乎不可能做到前一代模型生成中文文字基本是鬼画符。不过文字渲染虽然强了也不要一次性在提示词里塞太长的句子超过十个字还是容易出错。我建议每个气泡文案控制在六个字以内短句、口语化既符合漫画表达习惯也能给模型减少出错概率。3.5 生成后的检查清单四格全部生成之后我会按这个清单逐项过一遍检查项标准不合格的处理方式角色一致性发型、脸型、服装颜色与参考图一致微调角色段提示词强调“参考图1中的人物就是这名女生”场景连续性关键道具位置、建筑朝向不穿帮在提示词中重复描述道具状态风格统一四格色调、线条质感接近检查风格参考图是否被正确引用文字正确气泡内文字无误拆短文案重新生成叙事流畅动作因果能连贯理解重写分镜脚本调整动作衔接词这套检查清单看起来基础但每一次都能抓到问题。我最常碰到的是场景连续性不合格比如第一格的树在角色左侧第二格树跑到右侧去了。这种情况只能靠重新写提示词来纠正因为你没法在对话框里直接拖拽布局。4. 翻车实录我踩过的坑和排查方法4.1 角色突然“换脸”权重纠偏的三个办法第一轮测试时我的第二格生成结果和第一格的脸型明显不一样第一格是圆脸第二格变成了尖下巴。排查之后定位到原因第二格的提示词里角色段写得太短只写了“参考图1中的女生”没有补充面部特征的文字锚点模型在生成时把注意力分配给了动作描述。解决办法有三个在角色段里重复关键面部特征“参考图1中的圆脸短发女生”把角色段调整到提示词开头且不少于两句如果还是不相似就换一张更清晰的角色参考图确保脸部像素足够大实测下来办法1和办法2的组合效果最好角色相似度能从“勉强看得出是一个人”提升到“一眼就能认出是同一个人”。办法3是最后手段因为重新处理参考图成本较高但遇到参考图本身分辨率过低的情况也只能换图。4.2 文字气泡乱码短句、少字、单独生成Image 2.5的中文渲染能力已经很强但在某些复杂画面里还是会出错。我遇到过一次场景光线很强、气泡又小的组合气泡里的“终于拿到了”四个字变成了“终于拿列了”。这类问题排查起来很简单就是降低画面复杂度。我的处理方式是把有气泡的那一格单独重新生成提示词里把场景描述简化去掉多余的背景道具确保气泡区域获得足够的生成带宽。另外文案尽量控制在六个字以内四个字最佳。如果画面里必须出现多个气泡就减少单气泡字数分两次生成再后期拼合。4.3 风格断层风格词固化与滤镜兜底四格生成到第四格的时候我发现色调有点飘整体比前三格偏黄。后来分析可能是第四格提示词里我加了“笑容”和“晾衣杆”两个新的关键要素占用了风格相关的生成权重。解决办法是在每一格的提示词末尾都写一段“风格固定句”——把风格参考图的主要特征用文字明确下来比如“低饱和青蓝色调高亮度空气感线条干净”。这样即使格子里的元素复杂文字风格锚点依然在提示模型保持风格统一。我四格全部做完之后还会把四张图丢进后期工具里做一次统一的色彩校正确保在显示器上看起来是一个系列。4.4 一次彻底失败的复盘双参考图也不是万能钥匙我也遇到过一次怎么调都救不回来的情况。当时我想做一个夜间场景的四格故事角色参考图仍然是白天拍的风格参考图也是白天亮色调。结果四格生成出来全部是“白天感”的画面无论我怎么在提示词里强调“夜晚”、“路灯”、“霓虹”模型都只是把天空调暗了一点室内发出暖黄色灯光的逻辑完全不对。复盘下来核心问题是参考图与目标场景之间存在无法调和的冲突。角色图是白天光线风格图是白天色调模型得到的所有视觉证据都指向白天提示词里的“夜晚”属于文字指令权重再高也压不过视觉参考的惯性。这个案例说明双参考图有它的适用范围参考图提供的视觉环境和目标画面不能出现根本性冲突。想生成夜晚场景就应该换一张夜景风格参考图哪怕角色参考图不变也行。后来我把风格参考图换成一张夜街插画同样的提示词逻辑就顺利跑通了。这个教训我一直记着不要试图用文字对抗参考图要顺着参考图去改文字。5. 关于工具选型和后续扩展的一点想法5.1 为什么不用本地部署模型做这件事有朋友问我为什么不用本地部署的开源模型来做四格漫画。说实话本地模型的优势是隐私和可控性但在多角色一致性、文字渲染、提示词遵循度这三个维度上目前和GPT Image 2.5的差距还是比较明显。尤其是中文气泡文字开源模型几乎全军覆没没有实际可用性。如果你做的是英文场景部分开源模型倒是可以一战但国内日常创作场景还是中文为主选型上我会更推荐直接使用ChatGPT内置的图像生成。5.2 从四格到更多连续叙事的扩展方向四格跑通之后我接着试了六格和八格的短篇结论是流程完全一样只是后续格子的提示词要更加注意动作衔接分镜脚本的要求也更高。我还尝试过把第一格生成的图片作为第二格的参考图之一用“上一格图角色图”的方式滚动推进效果比单纯依赖文字指令更好场景连续性大幅度提升。这就是“双参考图”变体玩法里的滚动参考适合篇幅更长的叙事。但要注意连续生成超过八格后角色特征还是会缓慢漂移这是模型本身的特性。我的处理方式是把第一格的图保留下来每三格重新对照一次角色特征必要时回到第一格提取的关键特征重新锚定。写在最后测试Image 2.5这两天我最深的感受是图像生成模型的进步正在从“单张画得多精致”转向“连续表达多可靠”。双参考图不是什么复杂技术它就是给模型指了两条清晰的路一条通向角色一条通向风格。你只需要把这两条路铺平剩下的故事它替你讲。我个人在实际操作中的体会是别一上来就挑战高难度的复杂剧情先从最简单的四格开始跑通流程、摸清提示词的脾气再逐步加高叙事难度。这个顺序能让你的挫败感降到最低也能让你更清楚Image 2.5的能力边界到底在哪里。如果这篇对你有帮助你也可以试试用双参考图跑一组属于你的四格故事回来告诉我结果怎么样。