这次我们来看一套完整的 AI 短视频制作学习路线。这篇是这个系列的第一节,先把全景图拉出来:AI 短视频到底要学哪些东西、要用哪些工具、按什么顺序上手、要准备什么环境,以及最容易踩的坑在哪。文章不追热点,不堆概念,只讲能落地的事。
AI 短视频这个词听起来很宽,实际拆开就是一条工具链:用大模型写脚本,用图像和视频模型生成画面,用语音模型做配音,最后用剪辑工具拼起来。单点工具解决不了完整问题,只有把每个环节跑通,才能持续产出内容。这也是这个系列存在的理由:把 AI 短视频从“看别人做的”变成“自己也能做”。
这篇文章会先说明系列覆盖的技术范围,再给你一条可执行的学习路线,最后给一个最简实操方案:跑通一条 30 秒样片。看完这篇,你应该知道接下来先学什么、后学什么、怎么验证自己有没有学会。
1. 这个系列在讲什么:AI 短视频技术栈全景
先给整套内容定个位。AI 短视频不是一个工具,而是多个 AI 能力的组合。下面这张表是这个系列的技术边界和学习目标。
| 项目 | 说明 |
|---|---|
| 系列主题 | AI 短视频全流程制作 |
| 覆盖环节 | 选题脚本、分镜设计、画面生成、视频生成、配音配乐、字幕剪辑、批量发布 |
| 关键技术类型 | 大语言模型(LLM)、文生图、图生图、文生视频、图生视频、语音合成(TTS)、自动字幕 |
| 运行形态 | 云端 Web 工具为主、本地开源模型为辅、脚本 API 做批量 |
| 硬件门槛 | 只用 Web 工具时普通电脑即可;本地部署按模型大小需要不同显存 |
| 批量能力 | 可以通过脚本、API、配置文件批量生产 |
| 适合人群 | 短视频创作者、内容运营、独立开发者、想搭 AI 生产流程的技术人员 |
注意一点:这个系列不是单个软件的教程。每次更新会围绕一个生产环节展开,讲清楚“这件事为什么要用 AI 做”“有哪些可用方案”“怎么选型”“怎么验证结果”。你不需要每个工具都精通,但需要知道每个环节的通用流程。
系列内容会尽量兼顾两类人:一类是偏内容的创作者,只想把视频做出来;另一类是偏技术的开发者,想把视频生产流程脚本化、批量化。两种人的学习重点不同,但前面的基础流程是一样的。
2. 为什么 AI 短视频值得现在动手
内容行业一直有一个朴素公式:
有效内容产量 = 可投入时间 / 单条内容制作成本短视频平台的流量分配逻辑决定了,想稳定获得曝光,持续更新往往是必要条件。持续更新的核心瓶颈,不是创意,而是制作成本。一条普通口播视频,从写稿、拍摄、剪辑到发布,熟练的人几个小时,不熟练的人可能要一天。AI 压缩的正是这里面的重复劳动。
具体压缩在四个环节:
- 脚本:原来靠人写,现在用 LLM 生成初稿,再做人工润色。
- 画面:原来要实拍或找素材,现在用文生图、文生视频直接生成。
- 配音:原来要录音,现在用 TTS 合成,甚至用声音克隆技术复刻音色。
- 剪辑:原来要手动切片段,现在自动字幕、AI 剪辑工具可以完成大部分重复操作。
工具侧也到了可以实际使用的阶段。前几年 AI 视频生成不稳定,画面经常崩;现在的文本模型、图像模型、视频模型已经能在限定场景下稳定输出可用素材。虽然距离“完全自动生成一条爆款视频”还很远,但“AI 辅助完成 80% 的初稿生产,人工负责最后 10% 的创意和 10% 的审核”已经是成熟玩法。
同时要提醒一句:AI 短视频的价值在于降本,不在于无中生有。真正决定视频能不能爆的,依然是选题、叙事和审美。这个系列教你的是提高制作效率,不是替代内容判断力。
3. 一条 AI 短视频从 0 到 1 的完整工作流
先看完整链路,再逐步深入。一条用 AI 制作的短视频,通常经历下面 7 个阶段:
| 阶段 | 核心任务 | 输入 | 输出 | 对应 AI 工具类型 |
|---|---|---|---|---|
| 1. 选题策划 | 确定主题、受众、内容目标 | 方向灵感、热点话题 | 选题列表、一句话卖点 | 大语言模型 |
| 2. 脚本撰写 | 写出分镜级脚本 | 选题、目标时长 | 脚本文本、分镜列表 | 大语言模型 |
| 3. 分镜设计 | 把文字拆成画面描述 | 脚本文本 | 分镜表、画面提示词 | 大语言模型 + 图像模型 |
| 4. 画面生成 | 生成图像或视频素材 | 画面提示词 | 图片、视频片段 | 文生图/图生图/文生视频/图生视频 |
| 5. 语音生成 | 生成旁白或口播 | 台词文本 | 配音音频 | TTS 语音合成 |
| 6. 字幕与剪辑 | 合成音画、加字幕 | 画面、音频、字幕 | 成品视频 | 剪辑工具、自动字幕工具 |
| 7. 发布与复盘 | 导出、发布、看数据 | 成品视频 | 发布内容、数据反馈 | 平台工具、数据工具 |
注意这个流程不是线性的。实际做的时候经常要回退:画面生成后不满意,要回改提示词;配音时长和画面不匹配,要回去调整脚本;字幕有错别字,要在剪辑阶段修正。
这个系列每一节对应这个工作流的一个阶段。你知道自己在整个链路里的位置,就不会在某个细节里迷路。
4. 工具链全景与选型原则
AI 短视频工具链大致分成五类。理解分类比记工具名更值钱。
4.1 文本生成类
负责选题、脚本、分镜、标题、评论区回复。核心能力是:根据提示词生成结构化的文字内容。
入门建议:掌握提示词基础结构。
角色 + 任务 + 输入 + 约束 + 输出格式示例:让大模型生成一条 60 秒短视频脚本。
你是一位短视频编导。请根据以下主题,生成一条 60 秒短视频的完整脚本。 主题:新手如何用 AI 做一条短视频 要求: 1. 开头 5 秒要有悬念 2. 分为 5 个分镜,每个分镜写清楚画面内容和旁白 3. 语言口语化,多使用短句 4. 输出格式为表格:分镜序号、画面描述、旁白台词、预估时长 请直接输出脚本,不要解释。这类工具的核心难点不是“会不会打字”,而是“会不会拆任务”。
4.2 图像生成类
负责封面、分镜画面、贴片素材。核心能力是:根据提示词生成或编辑图像。
常用形式包括文生图、图生图、局部重绘、扩图。如果你走本地路线,会涉及 Stable Diffusion 生态或 ComfyUI 工作流;如果走云端路线,直接用在线服务即可。
图像生成的关键不是“生成一张好看的图”,而是“生成能连续表达叙事的一组图”。角色一致性、风格一致性、分镜连贯性,才是短视频场景下的核心技术问题。
4.3 视频生成类
负责把图片或文字变成动态画面。这是整个 AI 短视频工具链中变化最快、门槛最高的环节。
按输入方式分:文生视频、图生视频、首尾帧视频、数字人口播视频。
按运行方式分:云端生成和本地部署。
视频生成类工具最需要关注的参数包括:
- 分辨率与帧率
- 单次生成时长
- 运动幅度与画面稳定性
- 角色一致性
- 是否支持镜头控制
- 是否支持批量生成
这个系列后续会用专门章节讲视频生成。
4.4 语音合成类
负责旁白、口播、角色对话。核心能力:文本转语音、音色控制、情绪控制、多音字处理。
使用时重点测试:
- 长文本是否稳定不吞字
- 停顿和语气是否符合内容节奏
- 是否支持多音字、数字、英文混读
- 是否支持音色保存和复用
- 是否有接口可以批量调用
涉及声音克隆时,必须确认音源授权,不能用他人声音做未授权内容。
4.5 剪辑与字幕类
负责把画面、音频、字幕合成成片。核心能力:时间轴剪辑、自动字幕、自动匹配。
现在的 AI 剪辑工具已经能完成:
- 根据音频自动切分画面
- 自动生成字幕并打轴
- 去除语气词、停顿
- 自动 BGM 卡点
4.6 工具选型原则
给一个判断框架,避免频繁换工具:
- 先选常用工具,不追求“最强最新”。一个能用熟的工具,比三个收藏吃灰的强。
- 先走云端,再决定是否本地部署。云端零配置,适合验证流程;本地部署适合批量和隐私要求高的场景。
- 先把全流程跑通,再优化单点效果。第一次做样片,不需要每个环节都用顶级工具。
5. 硬件与环境门槛
AI 短视频制作的环境要求分两条路线,差别很大。
5.1 纯云端路线
所有生成都通过在线服务完成,本机只需要浏览器和稳定的网络。普通办公电脑即可,不需要独显,不需要配环境。适合内容创作者验证方案。
5.2 本地部署路线
如果你想跑开源模型、批量生成、并且数据不出本机,需要一台带独立显卡的电脑。不同模型对显存的要求不同:
- 文生图类:入门级显卡即可跑小规模生成,生产级需要更高显存
- 视频生成类:对显存要求更高,通常不是入门级显卡能流畅跑的参数
- 语音合成类:相对轻量,CPU 也能跑一部分模型
- 大语言模型类:脚本生成可以用云端 API,本地跑小模型也能做
注意:具体显存占用要以你选择的模型版本和推理参数为准。同一个视频生成模型,分辨率不同、帧数不同、批量数不同,显存占用可能差一倍以上。
5.3 环境检查清单
开始之前先检查本机环境,避免后续踩坑。
Windows 用户先看显卡驱动:
nvidia-smi能显示显卡型号和驱动版本,说明驱动正常。如果提示找不到命令,需要先安装 NVIDIA 驱动,并确认显卡是否支持 CUDA。
检查 Python 环境:
python --version pip --version如果做视频剪辑和格式转换,建议安装 ffmpeg:
ffmpeg -version如果计划本地部署图像或视频模型,通常还会用到 Git、CUDA 工具包、PyTorch、ComfyUI 或 WebUI 等。这些会在后续章节展开,不必一口气装完。
给一个最重要的建议:第一次尝试,先不要配置复杂的本地环境。先用云端工具跑通一条样片,确认自己确实需要批量化和本地化,再回头搭环境。
6. 学习路线总览
下面这条路线是这个系列的主线。按顺序走,目标明确,且每一步都有可验证的产出物。
| 阶段 | 学习目标 | 产出物 | 验证标准 |
|---|---|---|---|
| 阶段 0 | 看整体流程 | 一条 30 秒的粗制样片 | 视频能正常播放,有画面有声音 |
| 阶段 1 | 掌握 AI 脚本生成 | 5 条不同风格脚本 | 脚本结构完整,可直接用于拍摄或生成 |
| 阶段 2 | 掌握 AI 图像生成 | 一组分镜图 | 画面能表达脚本内容,风格一致 |
| 阶段 3 | 掌握 AI 视频生成 | 3 个视频片段 | 画面稳定,运动合理,时长符合预期 |
| 阶段 4 | 掌握 AI 配音 | 3 段配音音频 | 发音准确,节奏自然,情绪匹配 |
| 阶段 5 | 掌握字幕与剪辑 | 2 条成品短视频 | 音画同步,字幕清晰,叙事完整 |
| 阶段 6 | 掌握批量与接口 | 自动化批量脚本 | 一次运行生成多条视频素材并导出结果 |
有几个原则贯穿全程:
先做减法。同一个阶段只用一个核心工具,不要在工具体系里反复横跳。
先粗糙后精细。第一次产出 60 分结果就够了,重点是搞清楚流程;优化质量是第二遍、第三遍的事。
一切以出片为衡量标准。不要用“我学会了提示词怎么写”当作阶段成果,要拿出实际文件。
7. 本系列章节规划
这个系列会按上面的主线推进,每一节聚焦一个生产环节。当前规划如下:
| 章节 | 主题 | 核心内容 |
|---|---|---|
| 第一节 | 系列预告与学习路线总览 | 当前这篇 |
| 第二节 | 选题与脚本生成实战 | LLM 提示词、脚本模板、批量生成选题 |
| 第三节 | 分镜设计 | 文字到画面的拆解方法、分镜表写法 |
| 第四节 | AI 图像生成与一致性控制 | 文生图、图生图、角色一致性工作流 |
| 第五节 | AI 视频生成 | 文生视频、图生视频、首尾帧、镜头控制 |
| 第六节 | 数字人口播 | 数字人视频制作、声音与口型匹配 |
| 第七节 | AI 配音与音色控制 | TTS、多音字、情绪控制、声音授权 |
| 第八节 | 字幕、剪辑与成片 | 自动字幕、音画同步、成品导出 |
| 第九节 | 批量生产工作流 | 目录结构、配置文件、批量任务队列 |
| 第十节 | 本地部署与 API 接入 | 环境搭建、模型部署、接口调用 |
这个规划会在更新过程中动态调整。如果某类工具变化太快,对应章节会优先更新到最新实践。
8. 合规、版权与安全边界
做 AI 短视频,技术只是起点,合规是底线。这一节的内容在后续实操中会反复提醒。
8.1 肖像权与声音权
使用数字人形象、仿声、换脸、声音克隆等能力时,必须获得相关权利人的明确授权。不要用 AI 工具合成他人的脸、声音或身份,也不要制作虚假的公开人物视频。未经授权的内容不仅违反平台规则,还可能涉及法律风险。
8.2 版权素材
AI 生成的图像、视频、音乐,不一定都适合直接商用。不同工具的生成内容版权条款不同,有的允许商用,有的仅限个人学习。使用前查看对应服务条款。输入素材也一样,不要使用未授权的图片、视频、音乐作为基础素材。
8.3 平台审核与标识要求
很多平台要求 AI 生成内容标注“AI 生成”或用特定标识。深度合成类内容更有明确的合规要求。发布 AI 短视频时,先确认目标平台的 AI 内容规则,按要求添加标识。
8.4 内容安全
不要用 AI 生产违法、虚假、低俗、有害或误导性内容。AI 工具加速的是内容生产,不是内容审核。发布前必须人工复核。
9. 第一个实操:跑通一条 30 秒样片
学习路线正式从阶段 0 开始。下面是一套非常简单的实操流程,目标是让你在 1 天内拿到一条能播放的 30 秒 AI 短视频。
9.1 明确目标
样片主题建议选你熟悉的领域,比如“XX 工具的三个技巧”。时长控制在 30 秒左右,画面 5 个分镜,字数控制在 100 字以内的旁白。
9.2 第一步:写脚本
用大模型生成脚本,使用第 4 节给出的提示词模板。生成后手动修改,把内容压缩到 100 字内,语言改得更口语化。
9.3 第二步:生成画面
把脚本拆成 5 个分镜,每个分镜写一个画面提示词。用图像生成工具生成 5 张分镜图。如果你选择的工具支持图生视频,可以用这几张图作为视频生成的起点。
9.4 第三步:生成配音
将台词文本输入 TTS 工具,生成一段旁白音频。建议选择清晰、自然、语速适中的音色。保存为 mp3 或 wav 文件。
9.5 第四步:合成视频
使用剪辑工具,把分镜图或视频片段按顺序放到时间轴,旁白拖动到对应轨道,利用自动字幕功能生成字幕。导出成品。
9.6 建议的批量配置模板
等样片跑通后,想尝试批量生产,可以先用配置文件管理输入输出。一个通用示例:
{ "project_name": "sample_01", "topic": "AI 短视频入门", "script": { "duration_seconds": 30, "word_count": 100, "style": "口语化" }, "scenes": [ { "scene_id": 1, "narration": "今天教你用 AI 做短视频。", "image_prompt": "手拿手机学习 AI 制作的年轻人,明亮色调", "video_prompt": "镜头缓慢推进,人物轻微动作" }, { "scene_id": 2, "narration": "第一步,先让 AI 帮你写脚本。", "image_prompt": "电脑屏幕显示 AI 写作界面,现代工作台", "video_prompt": "屏幕内容放大,画面稳定" } ], "audio": { "voice": "标准普通话女声", "speed": 1.0 }, "output": { "format": "mp4", "resolution": "1080x1920", "fps": 30 } }这个模板不是某个固定工具的参数,而是一种通用结构。实际使用时,要把字段映射到你的工具和脚本里。
9.7 API 调用示例
如果后续要做批量生成,通用接口调用思路如下:
import requests # 假设你有一个本地或云端的 AI 生成服务 # 实际地址、参数名需要按你使用的项目接口调整 url = "http://127.0.0.1:8000/api/generate" payload = { "type": "image", "prompt": "一个视频封面,标题为 AI 短视频教程,现代科技风格", "width": 1080, "height": 1920 } try: response = requests.post(url, json=payload, timeout=120) if response.status_code == 200: result = response.json() print("生成成功:", result.get("output_path")) else: print("请求失败:", response.status_code, response.text) except Exception as e: print("请求异常:", e)写清楚这句:没有实际接口信息时,这个示例只是帮你建立调用思路,不要直接复制到生产环境。
9.8 样片验收标准
样片完成后,用下面 5 项检查:
- 视频能正常播放,画面和声音不卡顿
- 画面内容与旁白内容能对应
- 音频人声清晰,没有明显吞字和杂音
- 字幕文字准确,时间轴与语音基本同步
- 整体时长在 25 到 35 秒之间
如果 5 项全部通过,说明你已经跑通了 AI 短视频的最小闭环。这一步的价值比学任何高级参数都大。
10. 常见问题与入坑排查
刚接触 AI 短视频时,大概率遇到下面这些问题。建议先收藏再实操。
| 问题现象 | 可能原因 | 排查方式 | 解决方案 |
|---|---|---|---|
| 生成的视频画面崩坏 | 提示词描述太模糊或包含冲突元素 | 检查画面描述是否具体 | 简化提示词,拆分主体和场景描述 |
| 角色在不同分镜中长相不一致 | 没有做角色一致性控制 | 对比各分镜人脸特征 | 使用同一角色参考图,或引入角色一致性插件 |
| 配音吞字、语速异常 | TTS 对长文本处理不稳定 | 分段生成并试听 | 拆分长文本,增加标点和停顿标记 |
| 语音时长与画面不匹配 | 旁白比预期长或短 | 查看各分镜时长 | 剪短台词,或延长画面时长 |
| 字幕时间轴对不准 | 自动字幕识别不准或手动轴偏移 | 重听音频并核对关键句 | 手动调整时间轴,或使用更精确的字幕工具 |
| 生成速度很慢 | 云端排队或本地显存不足 | 观察任务队列和 GPU 占用 | 降低分辨率、减少帧数、缩小批量数 |
| 本地部署报显存不足 | 模型过大或参数过高 | 查看日志中的显存占用 | 换小模型,或降低分辨率与批量大小 |
| 视频导出后画质糊 | 导出分辨率低或压缩过度 | 检查导出设置 | 设置原始分辨率和高码率 |
| 视频发布后平台审核不通过 | 触及平台 AI 内容规则或版权问题 | 查看站内信通知 | 按平台要求添加 AI 标识,确认素材授权 |
| 脚本生成的文案内容太生硬 | 提示词没有约束表达风格 | 试听或阅读文案 | 增加“口语化、短句、像真人说话”等约束 |
此外,提示词是 AI 短视频日常排查绕不开的环节。画面崩坏、风格失控、内容不对,60% 的情况是提示词不够具体。排查时问自己三个问题:主体是否明确?风格是否明确?画面中需要哪些元素?都能回答清楚,再生成。
11. 写在最后
这条学习路线的最优起点,不是先买显卡,也不是先学提示词,而是先动手做一条 30 秒的粗样片。让全流程在你面前真实跑一遍,你的所有学习计划都会变得具体。
第一篇能为你解决的事情到这里就结束了。接下来的核心任务是:选一段熟悉的主题,用一个云端工具跑一条带配音和字幕的短视频,感受 AI 短视频制作的完整链路。下一节开始讲脚本与选题,那会是这条生产线的第一道工序。
建议把这篇保留备用。后面每学一个新工具,都可以回来对照这张路线图,确认自己走到了哪一步。