
大家好,我是奈月。
我以前的文章配图,不管是封面图还是段落图,要么是让codex自由发挥画的,要么是一直用一张背景图然后添加文字。
比如这样的:

或者这样的:

最近实在是觉得有点简陋,越来越看不下去了,因此决定重新做一个包含我的oc人设的作图工作流,由两个skill组成,分别用于生成封面图和段落图,项目链接先放到这里:
https://github.com/tlzmw001/naiyue-cover-generator
新skill的产物展示放到这里,大家可以看下效果:


那么接下来我会全面复盘是怎么一步步做出来的,踩了哪些坑,借鉴了哪些优秀实践。相比这两个skill,我更希望大家能够从我的复盘中得到属于自己的感悟,开发自己的生图工作流。
一、差强人意的第一版
最开始我的思路是,准备好我的个人IP图和蓝色背景图,之后提供文章给codex总结,然后拼在一张图里,具体的拼接交给codex。
得到的图是这样的:

标题是对的,文章结构也放进去了,个人 IP 也出现在了右侧。但整个画面很像一个自动生成的 PPT:首页使用大面积蓝色渐变背景,中间堆着几个流程框,标题用了白色和黄色,人物则像贴纸一样被放在右边。
简单的说,太丑了,毫无设计。
但是偏偏我又是没什么审美细胞的人,于是我只能退而求其次,我开始寻找其他大佬的经验进行借鉴。
二、借鉴优秀思路:从拼图改为拼提示词
这里非常感谢@kaitoxhacker,基德老师的文章和项目给了我新的灵感,我的项目实际上是站在您的肩膀上,这里也分享下大佬的项目:
https://github.com/kuangjiajia/codex-ip-image-generator/tree/main
我先用我的skill-auditor调研分析了基德老师的skill,skill-auditor是我做的审阅skill,专门用来审阅其他的skill,我常常用它来分析别的skill,用来给我提供参考和灵感,大家可以参考这个文章进行了解:
审查开始后,我们先阅读项目的 README、SKILL.md、提示词模板、视觉配置、平台配置和脚本,把对外宣称的能力拆成了 13 条原子声称。
这些声称包括:
- 能否识别 Markdown 中指定的 replace 图块。
- 能否把每个 ASCII 图块转换成图片。
- 能否保留原图中的实体、箭头、顺序和关系。
- 能否把生成结果准确写回 Markdown。
- 能否根据文章生成封面。
- 能否遵守微信和 X 的安全区。
- 能否生成架构图、流程图、关系图和白板解释图。
- 能否替换个人 IP 和视觉配置。
- 能否保持个人 IP 的核心识别特征。
- 能否正确处理品牌图标。
- 是否只依赖 Codex 内置的图片生成能力。
- 面对未见过的新内容时,是否仍能稳定生成高质量图片。
确认声称清单之后,我们没有只读代码,而是把我的真实文章和个人 IP 交给它,让它实际生成图片。同时,我们还构造了 Markdown 边界、平台裁切、重复生成、自定义视觉配置、多种图形类型等测试场景。
整个审查一共运行了两轮、九个场景。
审查过程中,它确实用我的文章和个人 IP 生成了一张很好看的白板图:

确定这就是我想要的后,我继续让skill-auditor拆解老师的skill,想了解为什么基德老师的skill的效果这么好。
这个项目的示例图为什么好看,是可以解释的。
它把视觉规则拆成了多个独立资源:
- visual profile 负责定义个人 IP 和整体风格。
- prompt template 负责不同生图模式的提示词结构。
- platform preset 负责平台比例和安全区。
- assets/ip/ 保存实际的个人 IP 图片。
- Python 脚本只处理 Markdown 扫描、上下文提取和结果写回。
- 真正的图片仍然由 Codex 内置 image_gen 生成。
它不是发明了一个新的图片模型,而是给现有图片模型建立了一套更有组织的输入契约。
我的理解就是,我应该从拼图改为拼提示词,然后让codex直接生成完整的成图。
默认视觉配置没有只写“生成一张好看的图”,而是明确规定:
- 使用白板涂鸦风。
- 线条可以略微不完美。
- 背景使用白色或米白色。
- 颜色以黑色为主,只使用少量强调色。
- 文字使用短标签,不放密集段落。
- 避免真实人物、赛博朋克、光滑 3D、复杂背景和企业库存插画。
- 每张图都要加入个人 IP。
- 哪些个人 IP 特征必须保留。
- 哪些变化是允许的。
- 哪些变化是不允许的。
这些规则共同构成了它的视觉边界。
但是我有一些独特的需求,这些是老师的skill没办法满足的。
我同时在bilibili、微信公众号和X三个平台做内容,国内平台的封面可能涉及裁切,因此需要针对安全区做专门的适配。另外我也希望图片的风格可以更好的自定义,然后能更好的适配奈月的人设图。
这两个主要原因让我决定吸收老师的精华,同时作出一些修改。
三、优化封面图skill
我把优化拆解为了四部分:
- 确定风格
- 锚定人物特征
- 总结文章内容
- 适配安全区

3.1 确定风格
首先要确定我喜欢的风格,这样才方便以后进行批量生图。
但是我是描述不清我喜欢什么的,所以我直接让codex先基于我的文章,生成几种风格我来选。
第一轮生成四个受控方向:
- A:白板手绘。
- B:日系编辑排版。
- C:可爱科技。
- D:极简概念。

我最喜欢 A。
我喜欢它像涂鸦一样的标题和线条,也喜欢下面由简单图标和箭头组成的流程。相比复杂的 AI 科技插画,它更像作者自己整理出来的一张知识图,因此 AI 味没有那么重。
有了第一轮结果之后,我们又围绕 A 生成了四个更接近的变体:
- A1:保留原始白板手绘风,只做收敛。
- A2:加入更规整的编辑网格。
- A3:改成石油绿和橙棕色的成熟配色。
- A4:加入少量克制的科技线条。

第二轮我发现,自己其实很难分辨 A1、A2 和 A4 的差异。我主要还是根据配色进行排名:A1 最喜欢,A2 和 A4 都可以,A3 的颜色明确不喜欢。
这个反馈反而帮助我找到了真正重要的变量。
我对细微的网格、装饰和图标圆润程度并不敏感;真正影响我判断的是:
- 暖米白背景。
- 黑色马克笔文字。
- 珊瑚粉强调色。
- 少量青色。
- 粗糙、不完全规则的线条。
- 简单图标和箭头。
- 中等信息密度。
到这里停下来进行总结,我给自己的视觉方向下了一个明确的定义:
手绘知识白板风。
这也就成了我的风格提示词。
3.2 锚定人物特征
这部分相对简单,我把我的人设图发给codex,让它为我总结提示词。
然后我不停的用提示词让它生成不同姿势的奈月酱,直到确定基于提示词和参考图可以稳定得到不同姿势的人设图为止。
这样确定下来的提示词就可以作为人物特征来使用了。
3.3 总结文章内容
基德老师的skill是基于ASCII结构草稿来描述图片内容的,但是我是一个懒狗,所以我的流程把文章内容总结也交给AI了,我只像皇帝一样负责审批奏折。
naiyue-cover 负责文章封面。
它先从文章中生成一张结构化内容卡,里面包含:
- 1~2 行标题;
- 需要强调的标题片段;
- 一个核心视觉隐喻;
- 3~4 个流程步骤;
- 固定的图标 ID;
- 奈月的姿势和动作意图;
- 用户要求的精确输出尺寸;
- 主动省略的内容。
内容卡通过后,才会生成正式 spec 和生图 prompt。
3.4 适配安全区
我用了一种简单但是有效的方式规避裁切。
用户提供整个图的大小和裁切范围,之后codex会把内容画到不被裁切的区域内,外围只补暖米白纸张的背景。最终图片尺寸还是跟用户提供的大小一致,平台裁切后也不会丢失核心内容。
生成的图就是这样的:

边缘的部分用来被裁切。
完整链路可以放一张图来展示:

四、做段落图skill
文章正文中的长段落也需要图片,但段落图和封面不是同一种东西。
封面要让人在信息流里停下来,因此标题更大、人物更明显、核心概念更集中。段落图出现在正文中,读者已经知道文章在讲什么,它更需要解释关系。
所以没有把所有功能塞进同一个 Skill,而是新增了 naiyue-paragraph-graph:
- 操作步骤和推进关系使用 flow;
- 年份、阶段和前后变化使用 timeline;
- 多个候选并且有作者推荐时使用 decision-map;
- 多个候选但主要是客观比较时使用 comparison;
- 原理、组成和工作机制使用 concept-diagram。
相比封面图skill,段落图skill删去了不需要的步骤,增加了一个判断内容结构的步骤。
AI 读取段落后判断主要关系,再生成一张 Visual Card,让人确认图型、题头、元素、推荐关系、图标、奈月姿势和主动省略的内容。
五、两个 Skill 背后的项目哲学
AI、代码和人的职责不同。 AI 负责理解文章、选择关系、构思画面、重画姿势和检查语义;代码负责 schema、路径、hash、精确尺寸、等比缩放、artifact 登记和验证报告;人负责决定内容方向、视觉接受和最终交付。
人工 Review 是工作流的一部分。 内容卡、完整图片和最终尺寸输出分别有一道门禁。只有在我觉得可以才会进行下一步。我是非常喜欢加入review环节的,这是我最喜欢的协作模式。
六、结语
那么接下来我会用新的工作流来作图,本篇文章就是使用了新skill,不知道大家觉得效果如何。很期待大家在评论区提出建议,也再次感谢基德老师@kaitoxhacker
本文是对公开笔记的知识化整理;原帖中的收入、流量、效果等数据属于原帖陈述,未作独立验证。