大多数用 AI 生成图片的人,其实已经默默放弃了一件事:让同一个人出现两次。你生成了一个很满意的角色,下一次生成却换来一个发型相似的陌生人。于是你妥协,只用一张图,或者裁得很紧,或者索性改用图库。
这个限制在过去一年已经被解决,而解决方法不是更好的提示词,而是一套参考图工作流程。以下是 2026 年角色一致性的实际运作方式、值得你投入时间的两种方法,以及把一张脸锁定在整个系列中的具体步骤。
AI 图像生成中的「角色一致性」究竟指什么
角色一致性,是指把同一个可辨识的主体,包括面容、体态与服装,放进新的场景、姿势与光线之中,而身份不会走样。这是一个参考图问题,而非提示词问题。纯文本无法足够精确地描述一张脸,因此一致性来自于每次生成时都向模型提供该主体的图像。
这件事之所以重要,是因为它改变了 AI 图像的用途。单一张主视觉只是装饰;一个一致的角色却是资产。你可以围绕同一个可辨识的人物,创建六页轮播、产品说明、培训演示文稿,或者一个月的社交贴文。这就是「用 AI 做图」与「用 AI 做企划」之间的分别。
为什么你的角色会在生成之间走样
走样的原因在于,图像模型每次运行都会重新采样随机杂讯。你的提示词缩窄了可能的面容范围,但「三十多岁女性,及肩深色头发」这样的文本描述,依然容许数以百万计的不同面容。缺乏视觉锚点时,每次生成都会独立挑选其中一个。
实务上有三件事会令走样更严重。
只靠文本描述身份。不断增加形容词感觉应该有帮助,范围确实会稍微收窄,但边际效益消失得极快。用二十个字描述一张脸,锁定身份的效果远不及一张参考图。
中途更换模型。每个图像模型都有自己的「风格底色」。同一张参考图配同一条提示词,在 Midjourney、Nano Banana 与 Flux 上的呈现都会不同。一个角色只用一个模型,并且坚持下去。
让场景压过主体。冗长密集的场景描述,会与身份争夺模型的注意力。如果你的提示词用四十个字描写黄昏时中环的雨后街道,只用六个字描述角色,那么街道必然胜出。
方法一:Nano Banana Pro 多重参考,最快而可靠的路径
Google 的 Nano Banana Pro 能在单次请求中接受多张参考图,并据此重建主体身份。实际做法是上载同一个人不同角度的三至五张图像,然后只描述新场景。它在单一画面中最多可处理五个不同的参考主体,并可通过 Google AI Studio 免费使用。
如果你从未做过基于参考图的生成,这是应该优先尝试的方法,原因有三。它不需要学习任何参数;它能容忍不完美的参考图,手机拍摄的照片同样可用;而且因为它可同时接受多个主体,你能把两个一致的角色放进同一个镜头,而这正是大多数单一参考工具崩溃的地方。
角度的分布是最多人忽略的环节。三张同样正面拍摄的图像,只提供了一个面容视角,却没有交代其结构。正面、四分之三侧面与全侧面,才会提供几何信息,而几何信息才是姿势改变后仍能保留下来的东西。
方法二:Midjourney Omni Reference 与权重旋钮
Midjourney 通过 Omni Reference 处理身份,以 --oref 参数指向参考图网址,再以 --ow 设置模型对该参考图的依附强度。权重就是这门技艺的全部:数值偏低会让场景与风格主导,数值偏高则保留面容,但同时压缩你对风格的控制。
实务上,中等权重是合理的默认值。当面容本身就是重点时把它调高,例如人像、讲者缩略图、换装后的正面照。当你希望角色以强烈插画风格呈现时把它调低,因为过高的权重会把输出拉回参考图的摄影质感,并与你要求的风格互相对抗。
当美学比面容的像素级准确度更重要时,Midjourney 依然是较好的选择。而在需要可控编辑、多图工作流程,以及同一个人必须在二十份素材中都清楚可辨的量产工作上,Nano Banana 更为适合。这是诚实的分工,也意味着「该用哪一个」的答案通常是「两个都用,各司其职」。
把两种方法串起来的「基准图」工作流程
无论你用哪个工具,纪律都是相同的:指定一张基准图,并在每一次生成时都把它喂回去。切勿用生成结果去生成下一张。如果你用第四张输出作为第五张的参考,微小误差会不断累积,到第十二张时你面对的已是另一个人。
以下是能在真实企划中站得住脚的流程。
第一步。生成或拍摄一份角色设置表:单一主体、中性光线、素色背景、三个角度、中性表情。中性是刻意的,强烈的表情会被烘进其后每一张图像。
第二步。挑出最佳的一张正面画格,命名为基准图。其余角度存为辅助参考。
第三步。撰写场景提示词时,身份从简,场景从详。参考图负责面容,文本负责世界。
第四步。小批量生成,每次四张,一发现走样立即弃用,而不是尝试在后续编辑中修补。
第五步。用一个纯文本档记录确切的提示词、模型、参数与参考图文件名。六星期后客户要求多做一份素材时,这个文件是唯一能让你对得上整个系列的东西。
角色一致性目前仍会失效的地方
基于参考图的生成如今已相当可靠,但并非万能。在你向客户承诺一整个系列之前,有四种失效情况值得先知道:手部与细致饰物仍会走样、极端镜位会流失身份、衣物上的文本会变成乱码,而儿童面容的稳定度明显低于成人。
服装不等于身份。参考图对面容的锁定远强于对服装的锁定。如果某件外套或制服很关键,就要在每次生成时以文本明确描述,并预期需要弃用一部分输出。
极端角度。正上方俯拍或下巴以下的仰拍,几乎没有提供可供比对的面部几何,一致性会急剧下降。设计拍摄清单时,应围绕平视至四分之三侧面的角度。
群像。通过多重参考,把两个一致的角色放进同一画面是可行的;四个则无法稳定达成。可行的话应把群像拆成多次生成,否则就要接受背景人物不会保持身份。
风格转换叠加身份。一边要求高度风格化的呈现,例如水彩、动画、七十年代菲林颗粒,一边又要求精确的面容,是这个领域中最困难的要求。总有一方要退让。请事先决定哪一方更重要,并据此设置参考权重。
如何测试你的参考图是否真的管用
在你以某个角色为基础创建整个企划之前,先花五分钟验证参考图。测试很简单:在四种刻意差异化的条件下生成同一主体,然后检查陌生人是否会认出他们是同一个人。四项之中有三项通过,你的参考图就达到可量产水准。
请按次序运行以下四项检查。第一,光线不变而改变姿势,这能分辨模型掌握的是面部几何,还是只记住了一张照片。第二,姿势不变而改变光线,由室内暖光转为阴天室外,这能揭露那些依赖特定色调的参考图。第三,改变距离,由特写人像转为中景,因为部分参考图只在原本的取景范围内有效。第四,改变服装,这一项最容易失败,也最值得及早知道。
诚实评分,并把结果写在参考图文件名旁边。四项中通过三项的参考图值得保留;只通过两项的,在弃用生成上耗掉的时间会多于它省下的时间。重新生成一份角色设置表成本很低,但在第十七份素材时才发现问题,代价并不低。
立即试用:角色设置表提示词
把以下内容拷贝到你惯用的图像工具,用来生成一份可重复使用的角色设置表。方括号内的描述只需替换一次,此后就不要再为这个角色改动它。
提示词:
Character reference sheet, three views of the same person side by side on a plain light grey seamless background: front view, three-quarter view, and full profile view. Subject: [a Hong Kong Chinese woman in her early thirties, shoulder-length straight black hair parted slightly off-centre, minimal makeup, wearing a plain charcoal crew-neck top]. Neutral relaxed expression, mouth closed, eyes open and looking at camera in the front view. Even soft studio lighting, no harsh shadows, no colour cast. Sharp focus on facial features. Consistent identical facial structure across all three views. Photographic, natural skin texture, no retouching. 16:9 wide composition.
此后每一张场景图像,都使用以下范本,并附上基准画格作为参考:
场景提示词范本:
[Reference: canon.jpg] The same woman from the reference image, now [seated at a cafe table in Sheung Wan reviewing a printed report, mid-morning daylight through a window to her left, shallow depth of field, warm neutral colour grade, candid documentary photography style]. Keep facial identity exactly matching the reference. Natural pose, no eye contact with camera.
把这一组运行一次,你在四次生成之内就会看到分别。若你想了解为何简短的身份描述反而胜过冗长描述,我们关于取代「扮演专家」提示法的做法一文,在文本工作上阐述了相同原理。
内核结论
角色一致性已经不再是提示词技巧,而是文件管理技巧。2026 年能产出连贯 AI 图像系列的人,并不是写出了更聪明的描述。他们保有一张基准图、一个模型、一组参数,以及一个记录了三者的文本档。这听起来毫不吸引,却正是全部诀窍所在。
今天下午就从一份角色设置表开始。三个角度、中性光线、单一主体。本文其余一切都创建在这一个文件存在的前提上,而制作它只需二十分钟。这个领域的工具更迭极快,但参考图纪律已经比三代图像模型活得更久,也会比下一代活得更久。
懂AI,更懂你 UD相伴,AI不冷
本文由 UD AI 团队审阅。
把一项技术变成可运作的产线
参考图工作流程只是最容易的部分。要让它在整个市场团队中稳定运作,包括共用素材、已审批角色与可重复的演示文稿格式,才是大多数团队卡住的地方。UD 团队手把手带你完成每一步,由工具选型、参考图库创建,到流程设计与实际部署。