
从选题、脚本、画面、配音、字幕,到横竖版成片、封面和平台文案:这是我把个人 AI 视频工作流改造成一套生产系统的过程。
我做 AI 视频之后,遇到的最大问题一直不是“不会做”。
真正的问题是:每做一期,都像第一次做。
选题时重新查资料,写稿时重新搭结构,文案定了才开始想画面。横版做完,还要重新处理竖版;配音分段生成后,可能每一段语速都不一样;临到发布,又发现字幕、封面、简介和标签还没有准备。
单看每一步都不难。但当这些步骤全靠人脑记忆、临场判断和手工衔接时,“做一条视频”就会变成十几个互相等待的小项目。
我慢慢意识到:我缺的不是一个更快的剪辑工具,也不是一条更厉害的提示词。
我缺的是一条生产线。
于是,我把自己正在使用的 AI 视频工作流整理成了 TudouFlow。
它现在有了一个独立的网站:tudouflow.anotherbug.com。但在介绍它之前,我更想先讲清楚:为什么我会把一套个人工作流做成产品,以及这套系统真正解决的是什么。 链接:https://tudouflow.anotherbug.com/

视频最消耗人的,不是制作,而是反复做决定
以前我会把视频制作理解成几个连续动作:写稿、配音、剪辑、发布。
真正做多了以后,我才发现它更像一张决策网:
- 这个选题属于哪条内容线?
- 观众已经知道什么,这一期只讲什么?
- Hook 要打破哪个误解?
- 哪段应该用类比,哪段应该用流程图?
- 屏幕上应该出现多少字?
- 横屏能成立的构图,到了竖屏还成立吗?
- 配音、字幕和场景,谁才是时间轴的真源?
- 不同平台到底该拿哪张封面、哪一版视频、哪套文案?
如果这些问题每一期都重新回答,创作者当然会累。更糟的是,上一期踩过的坑并不会自动成为下一期的资产。
所以 TudouFlow 的核心思路不是“替你生成一条视频”,而是:把重复出现的判断沉淀下来,让系统复用上一次的成果。

第一个变化:不再从单条视频出发,而是从内容路线出发
一条视频能不能做,和它现在应不应该做,是两回事。
我现在会先把主题放进系列路线里,回答五个问题:它属于哪个栏目?目标观众已经知道什么?这一期只解决哪个问题?它承接哪一期?下一期自然通向哪里?
这一步看起来比“马上写稿”更慢,但它解决了一个长期问题:做完一条以后,不会重新面对空白。
目前这套工程里有三套栏目语言:
- AI 课堂:暖色卡通,用来解释概念。
- AI 前沿:极简科技,用来拆解趋势和新技术。
- 工具使用:暗色界面,用来做软件与操作演示。
它们不是同一套模板换三个颜色。栏目名称、标题格式、片头片尾、字体、卡片、封面和画面气质都属于各自的设计系统。
因为我不希望所有 AI 内容最后都长成一种“AI 味”。

第二个变化:内容属于数据,组件只负责表达
这是整套系统最重要的一条工程原则。
每一期的标题、旁白、场景时长、Hook、类比、重点、视觉素材和音轨,都写在一个 Episode 配置中。场景组件不保存某一期的整段文案,只负责把“定义”“流程”“对比”“类比”“总结”这些关系表达清楚。
这样做的价值,不只是代码更整齐。
它意味着改一句旁白时,我知道应该去哪里;做下一期时,可以复用成熟场景;Agent 进入项目后,也能先读取明确的结构与规则,而不是在一堆时间线和散落文本里猜我的意图。
写脚本时,我也会刻意把“声音”和“屏幕文字”分开:
- 旁白要像人说话;
- 屏幕文字要像路标;
- 每一段旁白只承担一种主要视觉任务。
如果一段话既要定义概念、解释原理、举例子,又要给结论,通常不是画面不够炫,而是脚本还没有拆清楚。
第三个变化:横版和竖版不是裁切关系
我一开始也会想,先做好 16:9,再裁成 9:16 不就行了吗?
实际结果通常是:字幕挤住角色,流程图看不清,横向并列的卡片到了手机屏幕上只剩小字。
TudouFlow 的横版是 1920×1080,竖版是 1080×1920。两者读取同一份 Episode 数据,但通过方向上下文分别布局。字幕、角色、卡片和视觉层级会按画布重新分配,而不是把横版缩小后塞进竖屏。
这会增加组件设计时的工作量,却把每一期发布前的重复劳动拿掉了。对持续更新来说,这笔账是划算的。

第四个变化:先把声音当作时间,再让画面跟上
视频里最容易产生“差一点”的地方,是声音、字幕和画面之间的关系。
我的配音流程是分段生成,再拼接、统一速度、转写和同步场景时间轴。这里有一条看似琐碎、实际非常重要的规则:同一期所有 mini batch,必须使用完全相同的参考音频、speed、temperature、atempo 和 enhance 参数。
只要其中一项不同,就可能出现某一段忽快、某一段能量突然变化,最后听起来像几个人轮流说话。
字幕也不是把自动转写结果原样贴上去。我把真实成片声音当作“时间真源”,把审定脚本当作“内容真源”。Whisper 可以帮助对齐时间,但最终文字仍然要回到脚本和人工审校。
而且,“视频里有 audio stream”不代表它有正常声音。Release 后还要用 「ffprobe」 检查音频流,再用 「volumedetect」 确认不是静音。
这类细节不性感,却决定了一个系统能不能稳定交付。

一期视频最后不是一个 MP4,而是一份 Release
我过去经常把“视频导出来了”当作制作完成。现在我会把完成定义为:平台真正需要的东西都已经准备好,而且能被检查。
TudouFlow 的单期 Release 默认输出:
- 1920×1080 横版 MP4;
- 1080×1920 竖版 MP4;
- SRT 字幕;
- 抖音竖封面与横封面;
- 小红书封面;
- YouTube 横封面与 Shorts 封面;
- 小红书、抖音、YouTube 的标题、简介和标签文本。
这些产物通过一条 Release 命令串行生成。之所以强调串行,是因为当前流程共享临时目录,并行跑多期会互相干扰。这也是产品化时很重要的一件事:不仅记录“怎么成功”,也记录“哪些做法会失败”。

为什么还要把它打包成 TudouFlow?
因为一套只存在于我电脑里、只有我知道怎么运行的东西,还不能叫系统。
当我开始准备让别人使用时,很多隐含知识才暴露出来:环境怎么检查?第一次应该先改品牌,还是先跑样例?封面为什么会出现 「Unknown episode」?为什么竖版看起来像缩小的横版?为什么有音频流却听不到声音?哪些资产可以交付,哪些涉及个人声音、账号凭据和 IP 授权,必须留在交付包之外?
所以 TudouFlow 不只是源码。现在的产品资料包含:
- 系统总览与五层架构;
- 安装与首条样片;
- 选题、单集 Brief 和脚本工作流;
- Episode、场景、横竖版制作 SOP;
- 配音、字幕和时间轴 SOP;
- Release 与平台发布 SOP;
- 品牌定制、排错、质量检查;
- Brief、平台文案、发布状态与质检模板;
- 授权协议和交付检查清单。
买家第一天的正确动作不是先把它改成自己的样子,而是:先选一个现有 Episode,原样跑通预览和 Release。 确认环境、字体、声音与渲染都正常后,再替换角色、参考声音、栏目名称和选题路线。
先跑通,再改造;先固定参数,再批量生成;先验证 Release,再进入平台发布。

目前,它真实跑到了哪里?
截至我写下这篇文章时,工程中的校验覆盖 46 期内容、92 个横竖版渲染目标,跨越 AI 课堂、AI 前沿、工具使用等不同内容结构。
这两个数字代表的是本地工程事实,不代表流量,不代表平台推荐,也不代表购买后就能自动获得播放量。
它证明的是另一件事:这套结构不是为了演示临时拼出来的概念图,而是从持续生产中长出来、又回到持续生产里被验证的系统。
我对它的期待也不是“按一个按钮,AI 替你当创作者”。创作里仍然有很多不能外包的判断:你为什么讲这个主题,你真正相信什么,类比是否准确,事实是否可靠,哪句话值得观众记住。
TudouFlow 更擅长接住这些判断之后的工作:组织它们、复用它们、检查它们,把它们稳定地变成不同平台需要的资产。

它适合谁,也不适合谁
如果你是个人创作者、一人团队或小型内容工作室,已经决定长期做某类知识视频,也愿意用 Codex、Claude Code 这类能读取本地工程的 Agent 协作,那么这套方法会比较合适。
尤其是当你已经感受到这些问题:内容更新靠意志力,品牌视觉不稳定,横竖版重复做,配音字幕经常返工,发布前总在临时补文件。
但如果你只想偶尔做一条视频,不打算建立栏目;如果你期待输入一句话就自动得到无需审稿的爆款;或者你完全不想接触本地工程、Node.js、TTS/ASR 与第三方服务,那么 TudouFlow 可能并不适合你。
系统能降低重复劳动,不能替代选题判断;能固化质量检查,不能保证流量;能提供配音与字幕管线,但不会附带我的个人参考声音、账号 Cookie、API Key 或未授权资产。
把这些边界说清楚,比把它包装成“全自动赚钱机器”更重要。
最后
做内容时,我们很容易把注意力全部放在下一条视频上。
但真正决定一个人能不能长期更新的,往往不是下一条,而是:做完这一条以后,有什么被留下来了?
留下一个可复用的场景,一套更清楚的脚本结构,一条经过验证的声音流程,一份不会漏文件的 Release 规范——这些东西单独看都很小,积累起来才会让创作从手艺变成系统。
TudouFlow 就是我把这些“小资产”整理到一起的结果。
如果你也想把 AI 视频从一次次临时项目,变成一条属于自己的生产线,可以到 tudouflow.anotherbug.com 看完整结构。 链接:https://tudouflow.anotherbug.com/
如果你更想先聊聊自己的内容类型是否适合这套方式,也可以加微信 tudou_peak,备注“视频系统”。
我不会承诺它替你创作。但它可以让你每做完一期,都不再回到原点。

本文是对公开笔记的知识化整理;原帖中的收入、流量、效果等数据属于原帖陈述,未作独立验证。