用 AI 写短视频脚本和字幕:分镜模板、口播稿与自动字幕校对(2026)
摘要:AI 能帮你写口播稿、拆分镜、出自动字幕,但成品能不能发,取决于人工校对。本文给出可直接改的分镜/口播模板,对照剪映官网场景能力、Adobe Premiere Speech to Text 与 OpenAI Whisper 官方用法,整理自动字幕的校对清单,并说明国内发布生成合成内容时的标识要求。
短视频最容易卡住的三步是:写什么、怎么拍、字幕对不对。AI 适合把「空白页」变成「可改的初稿」,不适合直接当终稿——专有名词听错、分镜顺序乱、口播承诺过度,都会在发布后翻车。
下面按「分镜模板 → 口播稿 → 自动字幕 → 人工校对 → 标识与隐私」走一遍。工具以剪映(CapCut 国内版)官网公开介绍、Adobe Premiere Speech to Text、OpenAI Whisper 为例;入口和可用性以你账号、版本和地区为准。云/AI 类联盟链接尚未配置,正文只放官网普通链接(affiliate_later)。

一、先选工具:脚本、字幕各走哪条路
| 环节 | 可用工具(官方公开能力) | 适合 | 注意 |
|---|---|---|---|
| 写分镜 / 口播稿 | 通用大模型 + 本文模板;剪映官网场景里「自媒体口播」等写明支持智能剪口播、智能文案等 | 先定结构再进剪辑软件 | 不要让模型编数据、编优惠承诺 |
| 成片内自动字幕 | 剪映/CapCut 自动识别字幕(官方帮助说明 Web/桌面/移动端均支持 Recognise / Auto Captions,箱内帮助页会跳转剪映营销站,步骤以帮助中心原文为准);Premiere Speech to Text;本地 Whisper 导出 SRT | 口播清晰、单人主轨 | 必须人工校对 |
| 高可控转写 | OpenAI Whisper CLI(可指定语言、导出多种格式) | 要本地处理、要 .srt | 算力与模型选择以后台/本机为准 |
剪映官网在「全能易用 服务各类创作场景」里,把自媒体口播写成:美颜美体、智能剪口播、人声美化、智能抠像;营销推广侧则提到数字人、营销成片、智能文案等——适合当「场景能力对照」,不要当成你本机菜单的逐字路径。

通用提示词写法(角色、任务、约束、格式)可对照本站提示词四段框架;成片前事实核对见大模型幻觉核查清单。
二、分镜模板:先写「镜头表」,再让 AI 扩写
很多「AI 脚本乱七八糟」,是因为提示词只有一个题目。CapCut 官方帮助对 AI Video Maker 脚本顺序混乱的说明也指向同一点:提示词太模糊、缺少结构化信息时,场景和对白容易跳跃;应给出更清晰的分步提示,或生成后手动调整顺序(查询日期 2026-10-09,来源见文末)。
可以直接改这张分镜表(时长按你平台习惯,竖版口播常见 30–90 秒):
标题:____(一句话说清看点)
受众:____(例如:第一次用某工具的上班族)
目标:看完后观众能____(例如:按 3 步完成设置)
总时长:约 __ 秒 / 竖版 9:16
禁止:编造价格、编造测评数据、承诺收益
镜号 | 画面(给拍摄/素材) | 口播要点 | 字幕关键词 | 秒数
1 | 痛点画面/产品特写 | 钩子:谁会遇到什么问题 | 3 个字以内 | 3–5
2 | 步骤 1 实操 | 第一步做什么、点哪里 | 动词+对象 | 8–12
3 | 步骤 2 实操 | 第二步 + 常见翻车 | 注意点 | 8–12
4 | 结果对照 | 做成什么样算成功 | 结果词 | 5–8
5 | 结尾 | 复盘一句 + 引导评论 | CTA 短句 | 3–5
把填好的表丢给 AI 时,约束写死两行:
- 只扩写「口播要点」列,不要改镜号顺序;
- 缺信息写「待补」,不要编数字。
做 PPT 时「先大纲再成稿」的同一思路,见本站用 AI 做 PPT 的 6 步流程。
三、口播稿:口语化、可一口气读完
口播稿不是文章朗读。写作时用下面骨架(可整段贴进提示词):
【开场钩子 1 句】点出观众正在做的事 + 卡点
【正文 3 步】每步:动作 → 你会看到什么 → 做错会怎样
【收尾 1 句】今天只记住:____
【禁区】不报未核实价格;不写「稳赚」「包过」;不点名攻击竞品
语速:约每秒 3–4 个汉字;专有名词后空半拍
录音建议:尽量单人清晰干声;背景音乐先静音再跑自动字幕(CapCut 官方校对文也写了:干净音轨、慢讲、避免多人抢话,识别更稳)。会议类长音频转写与摘要是另一条线,见AI 整理会议录音。
四、自动字幕:三条官方路径怎么用
1)剪映 / CapCut 自动字幕
CapCut 帮助中心《How do I recognise subtitles?》(2026-01-30 更新)写明:Auto Caption(Recognise Subtitles)用语音识别生成字幕;Web / Desktop / Mobile 均支持;步骤大致为打开项目 → Captions → Auto Captions / Recognise → 选语言 → Generate,之后再改时间轴与文案。官方强调:生成后务必人工检查并手动修正。(箱内访问 capcut.com/help 会被重定向到剪映营销站,故本文以帮助中心可核验正文为准,不配该帮助页截图。)
校对时可对照另一篇官方说明《How Do I Fix Inaccurate Auto-Captions》:删错轨后用干净人声轨重识别;在字幕面板逐条改字;播完全片确认时间轴对齐。
2)Adobe Premiere:Speech to Text
Adobe 帮助《Auto transcribe video using Speech to Text》(页面标注 last updated 2026-06-02)给出桌面端路径:

要点:Window > Text → Transcript 里生成静态转写 → 选语言/说话人标注/音轨或入出点范围 → Transcribe。转写结果可继续做成字幕轨;具体菜单名以你安装的 Premiere 版本为准。
3)本地 Whisper:要 SRT 时很有用
OpenAI 开源仓库 openai/whisper 说明:命令行可对音频做转写;默认 turbo 适合英语转写,不做翻译任务;非英语可指定 --language;翻译到英语需用 multilingual 模型(如 medium / large)并加 --task translate。

实务建议:先导出干净干声 → whisper your.wav --language Chinese --output_format srt(参数以 --help 与 README 为准)→ 把 SRT 导入剪辑软件 → 再校对。模型体积与速度差异很大,不在此编造准确率数字。
五、字幕校对清单(发前必过)
- 专有名词:产品名、人名、品牌英文大小写;
- 数字与单位:价格、版本号、日期是否与画面一致;
- 时间轴:字幕是否提前/滞后超过半拍;长句是否该拆行;
- 敏感与合规:医疗/金融承诺、未证实对比;
- 听不清的段落:宁可删字或打「(听不清)」,不要靠模型「脑补」。
六、对外发布:AI 标识与隐私
若口播稿、配音、画面含生成合成内容,并准备发到国内网络平台,注意《人工智能生成合成内容标识办法》(国信办通字〔2025〕2号,2025-09-01 施行)第十条:用户使用网络信息内容传播服务发布生成合成内容,应当主动声明并使用服务提供者提供的标识功能;不得恶意删除、篡改、伪造、隐匿标识。

生图版权与商用标识细节见AI 生图入门。口播稿若含未公开客户名、合同金额、内部链接,不要贴进个人账户的免费对话工具,见AI 工具的数据隐私。国内大模型 App 选型与备案核对见国内大模型 App 怎么选。
相关阅读
- 提示词怎么写:角色、任务、约束、格式四段框架
- 大模型幻觉怎么防:6 类高风险场景和一张核查清单
- 用 AI 做 PPT:从简报、大纲到成稿的 6 步流程
- AI 整理会议录音:转写、摘要与待办提取
- AI 生图入门:提示词结构与版权、商用标识
- 国内大模型 App 怎么选:按场景对比与备案隐私
官方来源(查询日期 2026-10-09,北京时间)
- 剪映官网(CapCut 国内站公开介绍):https://www.capcut.cn/ / https://www.jianying.com/
- CapCut Help:How do I recognise subtitles?;Fix Inaccurate Auto-Captions;AI Video Maker script order
- Adobe Premiere:Auto transcribe video using Speech to Text
- OpenAI Whisper:https://github.com/openai/whisper
- 中国政府网:关于印发《人工智能生成合成内容标识办法》的通知
风险提示:本文不构成投资、法律或合规意见;软件功能、地区可用性与标识要求会变更,请以各产品当前界面与最新法规为准。联盟推广链接待后续配置。
全部评论:1条