跳到正文
远在天边,好东西在眼前.
返回

我不想再“剪下一条视频”了,所以做了 TudouFlow

文章封面

从选题、脚本、画面、配音、字幕,到横竖版成片、封面和平台文案:这是我把个人 AI 视频工作流改造成一套生产系统的过程。

我做 AI 视频之后,遇到的最大问题一直不是“不会做”。

真正的问题是:每做一期,都像第一次做。

选题时重新查资料,写稿时重新搭结构,文案定了才开始想画面。横版做完,还要重新处理竖版;配音分段生成后,可能每一段语速都不一样;临到发布,又发现字幕、封面、简介和标签还没有准备。

单看每一步都不难。但当这些步骤全靠人脑记忆、临场判断和手工衔接时,“做一条视频”就会变成十几个互相等待的小项目。

我慢慢意识到:我缺的不是一个更快的剪辑工具,也不是一条更厉害的提示词。

我缺的是一条生产线。

于是,我把自己正在使用的 AI 视频工作流整理成了 TudouFlow。

它现在有了一个独立的网站:tudouflow.anotherbug.com。但在介绍它之前,我更想先讲清楚:为什么我会把一套个人工作流做成产品,以及这套系统真正解决的是什么。 链接:https://tudouflow.anotherbug.com/

原文配图

视频最消耗人的,不是制作,而是反复做决定

以前我会把视频制作理解成几个连续动作:写稿、配音、剪辑、发布。

真正做多了以后,我才发现它更像一张决策网:

如果这些问题每一期都重新回答,创作者当然会累。更糟的是,上一期踩过的坑并不会自动成为下一期的资产。

所以 TudouFlow 的核心思路不是“替你生成一条视频”,而是:把重复出现的判断沉淀下来,让系统复用上一次的成果。

原文配图

第一个变化:不再从单条视频出发,而是从内容路线出发

一条视频能不能做,和它现在应不应该做,是两回事。

我现在会先把主题放进系列路线里,回答五个问题:它属于哪个栏目?目标观众已经知道什么?这一期只解决哪个问题?它承接哪一期?下一期自然通向哪里?

这一步看起来比“马上写稿”更慢,但它解决了一个长期问题:做完一条以后,不会重新面对空白。

目前这套工程里有三套栏目语言:

  1. AI 课堂:暖色卡通,用来解释概念。
  2. AI 前沿:极简科技,用来拆解趋势和新技术。
  3. 工具使用:暗色界面,用来做软件与操作演示。

它们不是同一套模板换三个颜色。栏目名称、标题格式、片头片尾、字体、卡片、封面和画面气质都属于各自的设计系统。

因为我不希望所有 AI 内容最后都长成一种“AI 味”。

原文配图

第二个变化:内容属于数据,组件只负责表达

这是整套系统最重要的一条工程原则。

每一期的标题、旁白、场景时长、Hook、类比、重点、视觉素材和音轨,都写在一个 Episode 配置中。场景组件不保存某一期的整段文案,只负责把“定义”“流程”“对比”“类比”“总结”这些关系表达清楚。

这样做的价值,不只是代码更整齐。

它意味着改一句旁白时,我知道应该去哪里;做下一期时,可以复用成熟场景;Agent 进入项目后,也能先读取明确的结构与规则,而不是在一堆时间线和散落文本里猜我的意图。

写脚本时,我也会刻意把“声音”和“屏幕文字”分开:

如果一段话既要定义概念、解释原理、举例子,又要给结论,通常不是画面不够炫,而是脚本还没有拆清楚。

第三个变化:横版和竖版不是裁切关系

我一开始也会想,先做好 16:9,再裁成 9:16 不就行了吗?

实际结果通常是:字幕挤住角色,流程图看不清,横向并列的卡片到了手机屏幕上只剩小字。

TudouFlow 的横版是 1920×1080,竖版是 1080×1920。两者读取同一份 Episode 数据,但通过方向上下文分别布局。字幕、角色、卡片和视觉层级会按画布重新分配,而不是把横版缩小后塞进竖屏。

这会增加组件设计时的工作量,却把每一期发布前的重复劳动拿掉了。对持续更新来说,这笔账是划算的。

原文配图

第四个变化:先把声音当作时间,再让画面跟上

视频里最容易产生“差一点”的地方,是声音、字幕和画面之间的关系。

我的配音流程是分段生成,再拼接、统一速度、转写和同步场景时间轴。这里有一条看似琐碎、实际非常重要的规则:同一期所有 mini batch,必须使用完全相同的参考音频、speed、temperature、atempo 和 enhance 参数。

只要其中一项不同,就可能出现某一段忽快、某一段能量突然变化,最后听起来像几个人轮流说话。

字幕也不是把自动转写结果原样贴上去。我把真实成片声音当作“时间真源”,把审定脚本当作“内容真源”。Whisper 可以帮助对齐时间,但最终文字仍然要回到脚本和人工审校。

而且,“视频里有 audio stream”不代表它有正常声音。Release 后还要用 「ffprobe」 检查音频流,再用 「volumedetect」 确认不是静音。

这类细节不性感,却决定了一个系统能不能稳定交付。

原文配图

一期视频最后不是一个 MP4,而是一份 Release

我过去经常把“视频导出来了”当作制作完成。现在我会把完成定义为:平台真正需要的东西都已经准备好,而且能被检查。

TudouFlow 的单期 Release 默认输出:

这些产物通过一条 Release 命令串行生成。之所以强调串行,是因为当前流程共享临时目录,并行跑多期会互相干扰。这也是产品化时很重要的一件事:不仅记录“怎么成功”,也记录“哪些做法会失败”。

原文配图

为什么还要把它打包成 TudouFlow?

因为一套只存在于我电脑里、只有我知道怎么运行的东西,还不能叫系统。

当我开始准备让别人使用时,很多隐含知识才暴露出来:环境怎么检查?第一次应该先改品牌,还是先跑样例?封面为什么会出现 「Unknown episode」?为什么竖版看起来像缩小的横版?为什么有音频流却听不到声音?哪些资产可以交付,哪些涉及个人声音、账号凭据和 IP 授权,必须留在交付包之外?

所以 TudouFlow 不只是源码。现在的产品资料包含:

买家第一天的正确动作不是先把它改成自己的样子,而是:先选一个现有 Episode,原样跑通预览和 Release。 确认环境、字体、声音与渲染都正常后,再替换角色、参考声音、栏目名称和选题路线。

先跑通,再改造;先固定参数,再批量生成;先验证 Release,再进入平台发布。

原文配图

目前,它真实跑到了哪里?

截至我写下这篇文章时,工程中的校验覆盖 46 期内容、92 个横竖版渲染目标,跨越 AI 课堂、AI 前沿、工具使用等不同内容结构。

这两个数字代表的是本地工程事实,不代表流量,不代表平台推荐,也不代表购买后就能自动获得播放量。

它证明的是另一件事:这套结构不是为了演示临时拼出来的概念图,而是从持续生产中长出来、又回到持续生产里被验证的系统。

我对它的期待也不是“按一个按钮,AI 替你当创作者”。创作里仍然有很多不能外包的判断:你为什么讲这个主题,你真正相信什么,类比是否准确,事实是否可靠,哪句话值得观众记住。

TudouFlow 更擅长接住这些判断之后的工作:组织它们、复用它们、检查它们,把它们稳定地变成不同平台需要的资产。

原文配图

它适合谁,也不适合谁

如果你是个人创作者、一人团队或小型内容工作室,已经决定长期做某类知识视频,也愿意用 Codex、Claude Code 这类能读取本地工程的 Agent 协作,那么这套方法会比较合适。

尤其是当你已经感受到这些问题:内容更新靠意志力,品牌视觉不稳定,横竖版重复做,配音字幕经常返工,发布前总在临时补文件。

但如果你只想偶尔做一条视频,不打算建立栏目;如果你期待输入一句话就自动得到无需审稿的爆款;或者你完全不想接触本地工程、Node.js、TTS/ASR 与第三方服务,那么 TudouFlow 可能并不适合你。

系统能降低重复劳动,不能替代选题判断;能固化质量检查,不能保证流量;能提供配音与字幕管线,但不会附带我的个人参考声音、账号 Cookie、API Key 或未授权资产。

把这些边界说清楚,比把它包装成“全自动赚钱机器”更重要。

最后

做内容时,我们很容易把注意力全部放在下一条视频上。

但真正决定一个人能不能长期更新的,往往不是下一条,而是:做完这一条以后,有什么被留下来了?

留下一个可复用的场景,一套更清楚的脚本结构,一条经过验证的声音流程,一份不会漏文件的 Release 规范——这些东西单独看都很小,积累起来才会让创作从手艺变成系统。

TudouFlow 就是我把这些“小资产”整理到一起的结果。

如果你也想把 AI 视频从一次次临时项目,变成一条属于自己的生产线,可以到 tudouflow.anotherbug.com 看完整结构。 链接:https://tudouflow.anotherbug.com/

如果你更想先聊聊自己的内容类型是否适合这套方式,也可以加微信 tudou_peak,备注“视频系统”。

我不会承诺它替你创作。但它可以让你每做完一期,都不再回到原点。

原文配图

本文是对公开笔记的知识化整理;原帖中的收入、流量、效果等数据属于原帖陈述,未作独立验证。

来源:https://x.com/iluciddreaming/status/2083436138581434750


分享文章:

上一篇
尽快构建自己的系统
下一篇
给研究AI视频的人的一盏明灯!