
如何用 AI 为博客创建角色一致的系列插画
一套经过实测的五步工作流,帮助同一个 AI 角色在多张博客插画中保持可识别,并包含提示词、结果、成本和修订过程。
生成一张好看的 AI 图片并不难。真正困难的是:让同一个人物出现在不同时间、不同场景和不同镜头中,读者仍然能一眼认出他。
这次测试中,我们用同一个角色身份,为一篇关于“如何在创作日中重新找回专注”的短文配图。故事从早晨的书桌开始,中午走到户外,晚上再回到书桌。我们先生成了三张插画,只对构图较弱的一张进行了修订,另外两张保持不变。
整套结果共使用 105 NarraTwin credits:三个认知锚点 5 credits,首次生成三张插画 75 credits,单张定向修订 25 credits。最终图片不会像复制粘贴一样完全相同,但人物身份在整个视觉故事中保持了清晰的可识别性。

什么才是真正的角色一致性
角色一致不等于每张图都使用相同的脸、姿势和背景。好的系列插画需要变化:镜头、环境、光线、表情和肢体动作应该随叙事改变。
不应该变化的是人物身份。
在这次测试中,我们重点检查五个信号:
- 可识别的面部结构是否一致。
- 黑色短发是否一致。
- 矩形眼镜是否一致。
- 服装、年龄感和整体气质是否协调。
- 整个系列的插画风格是否连贯。
如果只追求完全相同的脸,画面会显得重复;如果只追求每张图单独好看,人物又可能在不同场景中“换了一个人”。
五步工作流概览
我们的流程是:
- 先固定一个可复用的人物身份。
- 根据完整文章规划所有场景。
- 把插画作为一个连续系列生成。
- 分别检查人物身份和场景准确性。
- 只修订不符合要求的单张图片。
这也是 NarraTwin AI 博客配图工具背后的核心思路:文章提供叙事上下文,已保存的 Visual Twin 提供稳定的人物身份。
第一步:先锁定身份,再写场景提示词
我们使用了已有的 Visual Twin:KYLE · V1。它最明显的稳定特征是黑色短发、矩形眼镜,以及干净的编辑插画风格。
这种方式比每次都用文字重新描述一个人更可靠。“一个黑头发、戴眼镜的男人”描述的是一类人,而不是某一个具体的人。每次独立生成时,模型都可能把这类人解释成不同的长相。
稳定的身份参考让每个场景拥有相同起点。之后的提示词只需关注变化的部分:地点、动作、构图、氛围和光线。
第二步:生成前先规划整个系列
原文共 1,983 个字符,分为三个部分。我们先把每个部分转化为一个“认知锚点”,也就是在生成图片前明确这一幕的叙事作用。
三个场景分别是:
- 早晨: Kyle 坐在木质书桌前,桌上有笔记本电脑、纸质笔记本、笔和咖啡,画面使用温暖的晨光。
- 中午: 他带着同一本笔记本,在人行天桥上散步。
- 夜晚: 他回到书桌,把散步时获得的想法继续整理出来。
先规划整组图片,可以避免一个常见问题:每张图都单独优化,却彼此没有关系。比如笔记本不仅是道具,也建立了室内与户外场景之间的连续性。
本次测试生成三个认知锚点花费 5 credits,用时约 25 秒。
第三步:生成连贯的系列图片
我们为三个认知锚点选择了同一个 Visual Twin,并各生成一张插画。首次生成花费 75 credits,大约两分半钟全部完成。
第一版已经保留了主要身份特征:三张图片中的人物都有相同的黑色短发、矩形眼镜、面部结构和编辑插画质感。到了户外场景,服装有轻微变化,但这种变化符合情境,并不会让人物显得不一致。


第四步:把身份一致和场景准确分开检查
第一轮结果通过了身份检查,但早晨场景没有完全符合构图要求。我们希望镜头明显从上方俯拍,第一版虽然好看,却更接近较高的四分之三视角。
这说明:人物一致,并不代表构图一定正确。
我们用两个问题分别审查每一张图:
- 身份: 读者能否立即认出这是同一个人?
- 场景: 图片是否准确表达这一幕的动作、环境、道具和镜头方向?
拆开检查后,修改目标就很清楚。第一张图不需要更换人物,也不需要更换画风,只需要更明确的镜头指令。
第五步:只修订较弱的一张,不要重做整个系列
我们只对早晨场景使用了下面这条修订指令:
使用更明显的俯拍构图,同时保持相同的人物身份、黑色短发、矩形眼镜、白色 T 恤、木质书桌、笔记本电脑、纸质笔记本、笔、咖啡杯和温暖晨光。
修订花费 25 credits,约 30 秒完成。V2 抬高了镜头,同时保留了人物面部、眼镜、发型、服装、道具和光线。
修订前:人物一致,但镜头角度较弱

修订后:在不改变人物的前提下加强俯拍构图

最有效率的做法不是全部重生成。保留已经成功的两张图,可以避免破坏原本一致的部分,也让改进成本更加可控。
实测结果与仍需人工检查的部分
最终系列在博客配图最重要的几个方面达到了目标:
- 三个场景中的人物都可以被认作同一个人。
- 发型、眼镜、面部特征和插画风格保持连贯。
- 每张图都推动文章叙事,而不是重复同一张肖像。
- 一次定向修订改善了最弱的画面,同时没有影响其他图片。
它也存在真实限制。
第一,图片模型对镜头指令的理解可能比较宽松,第一次的“俯拍”并没有达到预期。第二,AI 图片中的小段文字不应被当作准确排版直接使用。第三,一致性不能代替编辑判断,仍然需要有人决定某个场景是否真正帮助读者理解文章。
目标不是无人参与的绝对完美,而是让模型把人物身份稳定到足够可靠,使编辑可以把时间花在改进故事上。
可复用的角色一致性检查表
生成前:
- 选择一个稳定的人物身份参考。
- 列出每个场景都必须保留的可见特征。
- 规划完整图片序列,并明确反复出现的道具。
- 重点描述每个场景的变化,不要反复重新定义人物。
生成后:
- 横向比较面部、发型、眼镜、年龄感和绘制风格。
- 单独检查动作、环境、道具、光线和镜头。
- 保留成功的图片。
- 用明确的“需要改变”和“必须保留”指令修订最小单元。
- 发布前人工检查图片中的所有文字。
常见问题
如何让 AI 角色在多张图片中保持一致?
每个场景都使用同一个稳定身份参考,在生成前规划完整序列,只重复必须稳定的人物特征。生成后,再把身份一致和场景符合度作为两个独立标准进行检查。
每张图片应该使用同一个提示词吗?
不应该。重复完全相同的提示词通常只会带来重复画面。应该稳定人物身份,同时根据故事改变动作、地点、镜头、氛围和光线。
一张参考图足够吗?
对于简单系列可能足够,但最终仍需根据结果判断。如果人物在不同姿势或角度中出现明显漂移,就需要加强身份参考,或者使用能在多个场景中持续复用已保存角色的系统。
其中一张不合格,需要把整套图重新生成吗?
通常不需要。如果人物身份和风格已经连贯,只修订失败的单张图片,并明确写出哪些细节必须保持不变。
你可以在 NarraTwin 中按同样流程开始一个新故事:添加文章、选择 Visual Twin、检查认知锚点,再把它们生成为一组有联系的图片,而不是一堆彼此无关的画面。