NW

nutllwhy/whiteboard-book-video-skill

Data science & ML
58 stars 品質 70 トレンド 70

白板火柴人拆书短视频工作流:脚本、分镜、配音、BGM、字幕与 HyperFrames 本地渲染

概要

白板火柴人拆书短视频工作流 Skill —— 把一本书做成 60-90 秒竖屏(9:16)白板手绘信息图风格的拆书口播短视频。最终视频由 HyperFrames 在本地渲染,渲染环节无平台水印,不消耗云端视频生成额度。 本 Skill 已在《纳瓦尔宝典》《认知觉醒》两本书的完整生产流程中实战迭代打磨。 - :拆书脚本与分镜表 → 白板火柴人信息图分镜图 → 口播配音(可选男声/女声)→ 背景音乐(可选活泼/沉稳/其他风格)→ 动效渲染 + 字幕卡点 + 音乐混音 → 成片交付 - :每个阶段产出后停下来与用户确认,再进入下一阶段,改稿成本低 - :慢版(6-8 画面,6-9s/画面)与高密版(16-20 画面,4-5s/画面),开跑前由用户选择,可自定义 - :成片用 HyperFrames 本地 HTML→视频渲染,不用云端视频生成模型;上游图像与音频生成服务可能仍有独立的费用或额度 - :每镜"逐步画出"揭示动效从已画出约 55% 的画面切入,避免空白断裂;开场白板空白起笔 - :基于 faster-whisper 词级 ASR 时间戳,白板便签风样式,无标点、单行小字号 - :侧链压缩混音,口播时自动压低、停顿处恢复,人声清晰有节奏 - :白板信息图分镜图(AI 生图能力) - :口播配音与 BGM(TTS / T2A 音频生成能力;所需账号、费用或额度由对应服务决定) - :faster-whisper(small 模型,本地词级转写,独立 venv) - :HyperFrames(npx [email protected]),需要 Node.js 22+ 与 FFmpeg - :make_subtitles.py(Python 3,仅标准库) 1. 把本 Skill 目录放入环境的 .user_skills/(或对应 Skill 根目录)。 2. 对 Agent 说:。 3. 依次确认:节奏模式 → 脚本 → 分镜图 → 配音 → BGM → 渲染装配,最终得到无水印竖屏成片。

README

whiteboard-book-video

白板火柴人拆书短视频工作流 Skill —— 把一本书做成 60-90 秒竖屏(9:16)白板手绘信息图风格的拆书口播短视频。最终视频由 HyperFrames 在本地渲染,渲染环节无平台水印,不消耗云端视频生成额度。

本 Skill 已在《纳瓦尔宝典》《认知觉醒》两本书的完整生产流程中实战迭代打磨。

特性

  • 全流程覆盖:拆书脚本与分镜表 → 白板火柴人信息图分镜图 → 口播配音(可选男声/女声)→ 背景音乐(可选活泼/沉稳/其他风格)→ 动效渲染 + 字幕卡点 + 音乐混音 → 成片交付
  • 每阶段确认:每个阶段产出后停下来与用户确认,再进入下一阶段,改稿成本低
  • 两种节奏模式:慢版(6-8 画面,6-9s/画面)与高密版(16-20 画面,4-5s/画面),开跑前由用户选择,可自定义
  • 本地渲染无水印:成片用 HyperFrames 本地 HTML→视频渲染,不用云端视频生成模型;上游图像与音频生成服务可能仍有独立的费用或额度
  • 连贯手绘动效:每镜"逐步画出"揭示动效从已画出约 55% 的画面切入,避免空白断裂;开场白板空白起笔
  • 词级字幕卡点:基于 faster-whisper 词级 ASR 时间戳,白板便签风样式,无标点、单行小字号
  • 沉稳/活泼 BGM:侧链压缩混音,口播时自动压低、停顿处恢复,人声清晰有节奏

工作流(6 阶段)

阶段 产出 确认点
0. 选节奏模式 慢版 / 高密版(用户选择) 开跑前
1. 调研与脚本 调研报告 + 拍摄脚本(分镜表 + 口播逐字稿 + 生图提示词) 脚本确认
2. 分镜图 白板火柴人信息图(竖屏) 风格/图确认
3. 口播配音 配音音频(男/女声) 试听确认
4. 背景音乐 BGM(活泼/沉稳/其他) 确认
5. 渲染装配 HyperFrames 动效 + 字幕 + 混音成片 —
6. 交付 成片交付 + 系列化建议 —

目录结构

whiteboard-book-video-skill/
├── SKILL.md                        # 主流程(总览 + 节奏模式 + 关键默认 + 纪律)
├── references/
│   ├── script-writing.md           # 脚本与分镜表规范
│   ├── image-prompt.md             # 白板火柴人信息图生图提示词规范
│   ├── audio-voice.md              # 口播配音规范(男/女声模板 + ASR 字幕)
│   ├── audio-music.md              # BGM 生成与侧链混音规范
│   └── render-and-assemble.md      # HyperFrames 渲染 + 字幕 + 装配规范
└── scripts/
    └── make_subtitles.py           # 词级卡点字幕 HTML/JS 生成器

环境依赖

本 Skill 面向支持 Agent Skill 机制 + 以下工具的环境:

  • 图片生成:白板信息图分镜图(AI 生图能力)
  • 音频生成:口播配音与 BGM(TTS / T2A 音频生成能力;所需账号、费用或额度由对应服务决定)
  • 字幕 ASR:faster-whisper(small 模型,本地词级转写,独立 venv)
  • 渲染:HyperFrames(npx [email protected]),需要 Node.js 22+ 与 FFmpeg
  • 校验:make_subtitles.py(Python 3,仅标准库)

使用方法

  1. 把本 Skill 目录放入环境的 .user_skills/(或对应 Skill 根目录)。
  2. 对 Agent 说:“用白板火柴人拆书工作流,把《书名》做成拆书视频”。
  3. 依次确认:节奏模式 → 脚本 → 分镜图 → 配音 → BGM → 渲染装配,最终得到无水印竖屏成片。

已验证的坑(避免重复踩)

  • 云端视频生成模型可能附带平台水印 → 用 HyperFrames 本地渲染最终成片
  • hyperframes transcribe 对中文无词级时间戳 → 用本地 faster-whisper
  • 短 BGM(约 7s)循环拼接有接缝断点 → 优先生成 90s 长段再裁剪
  • 揭示动效从镜头切入时才从 0% 画起会导致"开头空白 + 瞬间刷出" → 从 55% 切入
  • 同一 内叠多张图,后图的起始值可能提前应用导致重叠 → 每图独立

License

MIT License — 详见 LICENSE。

View this README on GitHub

推奨ツール

別のキーワードを試すか、フィルタを外してください。

インストール

npx skillfish add nutllwhy/whiteboard-book-video-skill