跳到正文
远在天边,好东西在眼前.
返回

我是如何用 Codex 做自己的个人IP生图工作流的

文章封面

大家好,我是奈月。

我以前的文章配图,不管是封面图还是段落图,要么是让codex自由发挥画的,要么是一直用一张背景图然后添加文字。

比如这样的:

原文配图

或者这样的:

原文配图

最近实在是觉得有点简陋,越来越看不下去了,因此决定重新做一个包含我的oc人设的作图工作流,由两个skill组成,分别用于生成封面图和段落图,项目链接先放到这里:

https://github.com/tlzmw001/naiyue-cover-generator

新skill的产物展示放到这里,大家可以看下效果:

原文配图

原文配图

那么接下来我会全面复盘是怎么一步步做出来的,踩了哪些坑,借鉴了哪些优秀实践。相比这两个skill,我更希望大家能够从我的复盘中得到属于自己的感悟,开发自己的生图工作流。

一、差强人意的第一版

最开始我的思路是,准备好我的个人IP图和蓝色背景图,之后提供文章给codex总结,然后拼在一张图里,具体的拼接交给codex。

得到的图是这样的:

原文配图

标题是对的,文章结构也放进去了,个人 IP 也出现在了右侧。但整个画面很像一个自动生成的 PPT:首页使用大面积蓝色渐变背景,中间堆着几个流程框,标题用了白色和黄色,人物则像贴纸一样被放在右边。

简单的说,太丑了,毫无设计。

但是偏偏我又是没什么审美细胞的人,于是我只能退而求其次,我开始寻找其他大佬的经验进行借鉴。

二、借鉴优秀思路:从拼图改为拼提示词

这里非常感谢@kaitoxhacker,基德老师的文章和项目给了我新的灵感,我的项目实际上是站在您的肩膀上,这里也分享下大佬的项目:

https://github.com/kuangjiajia/codex-ip-image-generator/tree/main

我先用我的skill-auditor调研分析了基德老师的skill,skill-auditor是我做的审阅skill,专门用来审阅其他的skill,我常常用它来分析别的skill,用来给我提供参考和灵感,大家可以参考这个文章进行了解:

审查开始后,我们先阅读项目的 README、SKILL.md、提示词模板、视觉配置、平台配置和脚本,把对外宣称的能力拆成了 13 条原子声称。

这些声称包括:

确认声称清单之后,我们没有只读代码,而是把我的真实文章和个人 IP 交给它,让它实际生成图片。同时,我们还构造了 Markdown 边界、平台裁切、重复生成、自定义视觉配置、多种图形类型等测试场景。

整个审查一共运行了两轮、九个场景。

审查过程中,它确实用我的文章和个人 IP 生成了一张很好看的白板图:

原文配图

确定这就是我想要的后,我继续让skill-auditor拆解老师的skill,想了解为什么基德老师的skill的效果这么好。

这个项目的示例图为什么好看,是可以解释的。

它把视觉规则拆成了多个独立资源:

它不是发明了一个新的图片模型,而是给现有图片模型建立了一套更有组织的输入契约。

我的理解就是,我应该从拼图改为拼提示词,然后让codex直接生成完整的成图。

默认视觉配置没有只写“生成一张好看的图”,而是明确规定:

这些规则共同构成了它的视觉边界。

但是我有一些独特的需求,这些是老师的skill没办法满足的。

我同时在bilibili、微信公众号和X三个平台做内容,国内平台的封面可能涉及裁切,因此需要针对安全区做专门的适配。另外我也希望图片的风格可以更好的自定义,然后能更好的适配奈月的人设图。

这两个主要原因让我决定吸收老师的精华,同时作出一些修改。

三、优化封面图skill

我把优化拆解为了四部分:

原文配图

3.1 确定风格

首先要确定我喜欢的风格,这样才方便以后进行批量生图。

但是我是描述不清我喜欢什么的,所以我直接让codex先基于我的文章,生成几种风格我来选。

第一轮生成四个受控方向:

原文配图

我最喜欢 A。

我喜欢它像涂鸦一样的标题和线条,也喜欢下面由简单图标和箭头组成的流程。相比复杂的 AI 科技插画,它更像作者自己整理出来的一张知识图,因此 AI 味没有那么重。

有了第一轮结果之后,我们又围绕 A 生成了四个更接近的变体:

原文配图

第二轮我发现,自己其实很难分辨 A1、A2 和 A4 的差异。我主要还是根据配色进行排名:A1 最喜欢,A2 和 A4 都可以,A3 的颜色明确不喜欢。

这个反馈反而帮助我找到了真正重要的变量。

我对细微的网格、装饰和图标圆润程度并不敏感;真正影响我判断的是:

到这里停下来进行总结,我给自己的视觉方向下了一个明确的定义:

手绘知识白板风。

这也就成了我的风格提示词。

3.2 锚定人物特征

这部分相对简单,我把我的人设图发给codex,让它为我总结提示词。

然后我不停的用提示词让它生成不同姿势的奈月酱,直到确定基于提示词和参考图可以稳定得到不同姿势的人设图为止。

这样确定下来的提示词就可以作为人物特征来使用了。

3.3 总结文章内容

基德老师的skill是基于ASCII结构草稿来描述图片内容的,但是我是一个懒狗,所以我的流程把文章内容总结也交给AI了,我只像皇帝一样负责审批奏折。

naiyue-cover 负责文章封面。

它先从文章中生成一张结构化内容卡,里面包含:

内容卡通过后,才会生成正式 spec 和生图 prompt。

3.4 适配安全区

我用了一种简单但是有效的方式规避裁切。

用户提供整个图的大小和裁切范围,之后codex会把内容画到不被裁切的区域内,外围只补暖米白纸张的背景。最终图片尺寸还是跟用户提供的大小一致,平台裁切后也不会丢失核心内容。

生成的图就是这样的:

原文配图

边缘的部分用来被裁切。

完整链路可以放一张图来展示:

原文配图

四、做段落图skill

文章正文中的长段落也需要图片,但段落图和封面不是同一种东西。

封面要让人在信息流里停下来,因此标题更大、人物更明显、核心概念更集中。段落图出现在正文中,读者已经知道文章在讲什么,它更需要解释关系。

所以没有把所有功能塞进同一个 Skill,而是新增了 naiyue-paragraph-graph:

相比封面图skill,段落图skill删去了不需要的步骤,增加了一个判断内容结构的步骤。

AI 读取段落后判断主要关系,再生成一张 Visual Card,让人确认图型、题头、元素、推荐关系、图标、奈月姿势和主动省略的内容。

五、两个 Skill 背后的项目哲学

AI、代码和人的职责不同。 AI 负责理解文章、选择关系、构思画面、重画姿势和检查语义;代码负责 schema、路径、hash、精确尺寸、等比缩放、artifact 登记和验证报告;人负责决定内容方向、视觉接受和最终交付。

人工 Review 是工作流的一部分。 内容卡、完整图片和最终尺寸输出分别有一道门禁。只有在我觉得可以才会进行下一步。我是非常喜欢加入review环节的,这是我最喜欢的协作模式。

六、结语

那么接下来我会用新的工作流来作图,本篇文章就是使用了新skill,不知道大家觉得效果如何。很期待大家在评论区提出建议,也再次感谢基德老师@kaitoxhacker

本文是对公开笔记的知识化整理;原帖中的收入、流量、效果等数据属于原帖陈述,未作独立验证。

来源:https://x.com/naiyue777/status/2081034514734665930


分享文章:

上一篇
搬运博主最怕的不是被骂搬运
下一篇
兄弟们,别只拿 Vox 做普通视频。