白板火柴人拆书短视频工作流:脚本、分镜、配音、BGM、字幕与 HyperFrames 本地渲染
概览
白板火柴人拆书短视频工作流 Skill —— 把一本书做成 60-90 秒竖屏(9:16)白板手绘信息图风格的拆书口播短视频。最终视频由 HyperFrames 在本地渲染,渲染环节无平台水印,不消耗云端视频生成额度。 本 Skill 已在《纳瓦尔宝典》《认知觉醒》两本书的完整生产流程中实战迭代打磨。 - :拆书脚本与分镜表 → 白板火柴人信息图分镜图 → 口播配音(可选男声/女声)→ 背景音乐(可选活泼/沉稳/其他风格)→ 动效渲染 + 字幕卡点 + 音乐混音 → 成片交付 - :每个阶段产出后停下来与用户确认,再进入下一阶段,改稿成本低 - :慢版(6-8 画面,6-9s/画面)与高密版(16-20 画面,4-5s/画面),开跑前由用户选择,可自定义 - :成片用 HyperFrames 本地 HTML→视频渲染,不用云端视频生成模型;上游图像与音频生成服务可能仍有独立的费用或额度 - :每镜"逐步画出"揭示动效从已画出约 55% 的画面切入,避免空白断裂;开场白板空白起笔 - :基于 faster-whisper 词级 ASR 时间戳,白板便签风样式,无标点、单行小字号 - :侧链压缩混音,口播时自动压低、停顿处恢复,人声清晰有节奏 - :白板信息图分镜图(AI 生图能力) - :口播配音与 BGM(TTS / T2A 音频生成能力;所需账号、费用或额度由对应服务决定) - :faster-whisper(small 模型,本地词级转写,独立 venv) - :HyperFrames(npx [email protected]),需要 Node.js 22+ 与 FFmpeg - :make_subtitles.py(Python 3,仅标准库) 1. 把本 Skill 目录放入环境的 .user_skills/(或对应 Skill 根目录)。 2. 对 Agent 说:。 3. 依次确认:节奏模式 → 脚本 → 分镜图 → 配音 → BGM → 渲染装配,最终得到无水印竖屏成片。
README
whiteboard-book-video
白板火柴人拆书短视频工作流 Skill —— 把一本书做成 60-90 秒竖屏(9:16)白板手绘信息图风格的拆书口播短视频。最终视频由 HyperFrames 在本地渲染,渲染环节无平台水印,不消耗云端视频生成额度。
本 Skill 已在《纳瓦尔宝典》《认知觉醒》两本书的完整生产流程中实战迭代打磨。
特性
- 全流程覆盖:拆书脚本与分镜表 → 白板火柴人信息图分镜图 → 口播配音(可选男声/女声)→ 背景音乐(可选活泼/沉稳/其他风格)→ 动效渲染 + 字幕卡点 + 音乐混音 → 成片交付
- 每阶段确认:每个阶段产出后停下来与用户确认,再进入下一阶段,改稿成本低
- 两种节奏模式:慢版(6-8 画面,6-9s/画面)与高密版(16-20 画面,4-5s/画面),开跑前由用户选择,可自定义
- 本地渲染无水印:成片用 HyperFrames 本地 HTML→视频渲染,不用云端视频生成模型;上游图像与音频生成服务可能仍有独立的费用或额度
- 连贯手绘动效:每镜"逐步画出"揭示动效从已画出约 55% 的画面切入,避免空白断裂;开场白板空白起笔
- 词级字幕卡点:基于 faster-whisper 词级 ASR 时间戳,白板便签风样式,无标点、单行小字号
- 沉稳/活泼 BGM:侧链压缩混音,口播时自动压低、停顿处恢复,人声清晰有节奏
工作流(6 阶段)
| 阶段 | 产出 | 确认点 |
|---|---|---|
| 0. 选节奏模式 | 慢版 / 高密版(用户选择) | 开跑前 |
| 1. 调研与脚本 | 调研报告 + 拍摄脚本(分镜表 + 口播逐字稿 + 生图提示词) | 脚本确认 |
| 2. 分镜图 | 白板火柴人信息图(竖屏) | 风格/图确认 |
| 3. 口播配音 | 配音音频(男/女声) | 试听确认 |
| 4. 背景音乐 | BGM(活泼/沉稳/其他) | 确认 |
| 5. 渲染装配 | HyperFrames 动效 + 字幕 + 混音成片 | — |
| 6. 交付 | 成片交付 + 系列化建议 | — |
目录结构
whiteboard-book-video-skill/
├── SKILL.md # 主流程(总览 + 节奏模式 + 关键默认 + 纪律)
├── references/
│ ├── script-writing.md # 脚本与分镜表规范
│ ├── image-prompt.md # 白板火柴人信息图生图提示词规范
│ ├── audio-voice.md # 口播配音规范(男/女声模板 + ASR 字幕)
│ ├── audio-music.md # BGM 生成与侧链混音规范
│ └── render-and-assemble.md # HyperFrames 渲染 + 字幕 + 装配规范
└── scripts/
└── make_subtitles.py # 词级卡点字幕 HTML/JS 生成器
环境依赖
本 Skill 面向支持 Agent Skill 机制 + 以下工具的环境:
- 图片生成:白板信息图分镜图(AI 生图能力)
- 音频生成:口播配音与 BGM(TTS / T2A 音频生成能力;所需账号、费用或额度由对应服务决定)
- 字幕 ASR:
faster-whisper(small 模型,本地词级转写,独立 venv) - 渲染:HyperFrames(
npx [email protected]),需要 Node.js 22+ 与 FFmpeg - 校验:
make_subtitles.py(Python 3,仅标准库)
使用方法
- 把本 Skill 目录放入环境的
.user_skills/(或对应 Skill 根目录)。 - 对 Agent 说:“用白板火柴人拆书工作流,把《书名》做成拆书视频”。
- 依次确认:节奏模式 → 脚本 → 分镜图 → 配音 → BGM → 渲染装配,最终得到无水印竖屏成片。
已验证的坑(避免重复踩)
- 云端视频生成模型可能附带平台水印 → 用 HyperFrames 本地渲染最终成片
hyperframes transcribe对中文无词级时间戳 → 用本地 faster-whisper- 短 BGM(约 7s)循环拼接有接缝断点 → 优先生成 90s 长段再裁剪
- 揭示动效从镜头切入时才从 0% 画起会导致"开头空白 + 瞬间刷出" → 从 55% 切入
- 同一
内叠多张图,后图的起始值可能提前应用导致重叠 → 每图独立
License
MIT License — 详见 LICENSE。
推荐工具
换一个关键词,或者移除筛选条件。
安装
npx skillfish add nutllwhy/whiteboard-book-video-skill