跳到正文
远在天边,好东西在眼前.
返回

99% 的人没看出来的数字人口播实战攻略

文章封面

昨天发了一条数字人讲 FDE 的口播视频,很多人的第一反应不是问我用了哪个工具,不相信这是数字人。我把整条数字人口播流程做成了一个可以复用的 Codex Skill。

GitHub 仓库:https://github.com/Jingyi-Wu-Richael/rachel-digital-human-production

我的最终工作流是:

素材检查 → MiniMax 生成配音 → HeyGen 15 秒样片 → 人工确认 → HeyGen 完整版 → 下载验片 → 状态归档

这套方案适合知识口播、短视频批量生产、课程讲解、产品介绍、多语言内容和固定 IP 数字人账号。

原文配图

原文配图

一、整条链路怎么分工

这套方案的核心,是把声音和画面拆开。

完整链路是:

  1. 准备真人录音,用 MiniMax 海外版克隆声音。

  2. 把文案交给 MiniMax TTS,生成克隆音色的 MP3。

  3. 准备一张清晰正面人像。

  4. 把人像和 MiniMax 生成的 MP3 上传到 HeyGen。

  5. 先生成 15 秒样片,确认后再生成完整视频。

这里最容易犯的错是:声音已经由 MiniMax 克隆完成,却又让 HeyGen 重新配音。

如果目标是保留 MiniMax 的克隆音色,就应该把 MiniMax 生成的音频上传到 HeyGen,用这个音频驱动画面。不要切回 HeyGen 的 script + voice_id 方案,否则声音相似度会被覆盖。

二、HeyGen和 Minimax 模式怎么选

第一次操作,建议直接用 Image-to-Video,调用api key即可,一次2min的视频大约消耗2刀。

它比较轻:不用一开始就训练 Avatar,只要上传一张人像和一段音频,就能快速看到口型、表情、脸部稳定性和构图是否可用。

我的建议:

再说 MiniMax,我的建议:

原文配图

原文配图

原文配图

三、素材准备:不用复杂,但必须干净

声音克隆效果不好,很多时候不是模型不行,而是样本不干净。

MiniMax 当前官方要求里,声音样本需要满足:

实操里我更建议录 30 到 90 秒:单人、无背景音乐、无明显混响和电流声,音量稳定,语速接近日常口播,不要用过度降噪、变速或压缩严重的二手音频。

原文配图

人像也一样,要干净:

嘴部越清晰,口型越稳定;声音越干净,克隆越像本人。

原文配图

四、怎么放进 Codex 执行

我会把每个数字人项目都按同一个目录结构放:

```markdown
project/
├── inputs/
│   ├── portrait.jpg
│   ├── voice-source.mp3
│   └── script.md
├── work/
│   ├── voiceover-full.mp3
│   ├── preview-15s.mp3
│   └── job-state.json
└── outputs/
    ├── preview-15s.mp4
    └── final-1080p.mp4

```

然后对 Codex 说:


请用 MiniMax 海外版声音克隆和 HeyGen API 制作数字人口播。

输入:

- 文案:inputs/script.md

- 人像:inputs/portrait.jpg

- 声音样本:inputs/voice-source.mp3

- MiniMax 密钥来自环境变量 MINIMAX_API_KEY

- HeyGen 密钥来自环境变量 HEYGEN_API_KEY

流程:

1. 先检查素材。

2. 先生成 15 秒样片。

3. 样片确认后再生成完整版。

4. 所有任务 ID 写入 work/job-state.json。

5. 不要在日志、脚本或文档中显示完整密钥。

这一步的重点是标准化。

你不需要相信自己每次都记得所有细节。你只需要把正确流程写进 Skill,让 Codex 每次按流程执行。

## 五. 这个 Skill 固定了什么

仓库地址:

<https://github.com/Jingyi-Wu-Richael/rachel-digital-human-production>

调用方式:

```text

用 $rachel-digital-human-production 做这条视频,先只做 15 秒样片。

它固定了:

- 固定目录结构。

- 先检查文案、人像和声音样本。

- MiniMax 负责声音,HeyGen 负责画面。

- 永远先生成 15 秒样片。

- 样片没有明确确认,不生成完整版。

- 每一步记录 `voice_id`、`asset_id`、`video_id` 和状态。

- 失败不盲目重试,避免重复扣费。

- 最终 MP4 必须完整检查。

- 不把 API Key、授权 header、临时下载链接写进日志或状态文件。

## 六、小tips

数字人视频最容易踩坑的地方,是成片不自然。

常见问题包括:声音不像本人、中文口型跟不上、脸部轻微变形、嘴角和下巴运动奇怪、眨眼和肩部动作不自然、构图不适合短视频平台。

所以我把“15 秒样片”写成强制步骤。先用 15 秒确认声音、口型、画面和构图。确认没问题,再跑完整视频。

相关链接:

- GitHub 仓库:<https://github.com/Jingyi-Wu-Richael/rachel-digital-human-production>

- MiniMax Voice Clone 官方文档:<https://platform.minimax.io/docs/guides/speech-voice-clone>

- HeyGen Image to Video 官方文档:<https://developers.heygen.com/image-to-video>

- HeyGen Assets 官方文档:<https://developers.heygen.com/assets>

> 本文是对公开笔记的知识化整理;原帖中的收入、流量、效果等数据属于原帖陈述,未作独立验证。

来源:<https://x.com/Zesee/status/2077723280534851786>

分享文章:

上一篇
damn!狗哥 这条视频也太炸了!竟然还是商单!
下一篇
这里提醒一下国内的翻墙的网友,使用一台“无手机卡、无SIM卡”的手机进行翻墙,而且这部手机只用于翻墙,这部手机不要有…