口播成片

原名:talk-video

把一长段口播稿做成「本人音色配音 + 画面」的竖屏视频(观点类 / 知识类 / 口播类,通常 3-6 分钟)。两种画面模式:① 文字排版动效(默认,无素材时);② AI 配图 + 字幕(用 ian-xiaohei-illustrations 风格,需用户确认生图积分消耗)。当用户给一段文字稿要"做成视频""配我的声音""做口播视频""文字视频""观点视频""念稿视频""配图视频"时使用。流程:自动分幕 → stepfun 复刻本人音色 → 分幕带情绪配音 → 语速归一 → 排版/配图 → Playwright 逐帧渲染。有产品截图 / 要做品牌宣传片时用 promo-video;只排查配音或画面 BUG 时用 promo-video-pitfalls。

分类
内容创作
版本
v1.1.0
作者
弈韬(@ra1nzzz)
下载
0
收藏
0
发布
2026-09-07
更新
2026-09-10
TRACE 评分
4.4 / 5

内容概览

把一整段口播稿变成成片。 没有产品素材 是这类任务的典型特征:画面全靠文字排版 + 动效撑, 声音是本人复刻音色,节奏靠分幕控制。 场景 用谁 --- --- 一整段观点稿 / 口播稿 → 视频,无素材 本技能 有产品截图、要 BGM/音效、品牌宣传片(30-45s) promo-video 只排查配音"(AI"没读出 / 内容错 / 语速不受控)或画面 BUG promo-video-pitfalls 只要配音不要画面 本技能第 1-5 步即可,跳过渲染 在项目根目录执行(所有脚本都以 cwd 为 ROOT)。 scenes.json 与 scenes.js 靠 id 对应 ,两者条数必须一致,否则时长对不上。 四种幕型,按内容挑:text 通用、big 巨字金句、pair 左右对照、list 三连排比。 字段 适用 说明 --- --- --- id 全部 与 scenes.json 对应 t 全部 text / big / pair / list txt text/list 主文案,按标点断句 kw text/big 需要朱红强调 + 下划线的关键词数组 pg text 幕内分页 ,如 [[0,5],[5,11]] 表示按句切成两页 lead text 顶部小标签(如栏目名) bz / sub big 巨字主词 / 副标题 a/a2/b/b2 pair 左右两侧的标题与说明 items list 三连排比的词条数组 SCENE TITLE 全局 角标标题(写在 scenes.js 顶部) 配音 1. instruction 只写 表演方向 (嘲讽 / 叹息 / 爆发 / 释然), 绝不写"缓慢、舒缓" —— 快慢措辞会盖过 speed 参数,整片节奏全乱。语速靠生成后 atempo 归一。 2. 判定"命中错误缓存"要看 字节数 + MD5 都相同 。只比字节数会误报(CBR 编码撞字节数)。 3. 文案避开已知触发词("群聊"等),详见 promo-video/references/stepfun-tts.md。 画面 4. 长文案幕 必然撑爆容器 :先 mea…

查看 SKILL 详情