news 2026/9/11 21:54:17

AI短剧六步工作流:一个人从梗概做到成片

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
AI短剧六步工作流:一个人从梗概做到成片

先说点实在的。AI短剧这四个字,今年在内容圈已经不算新鲜了。打开各平台刷到的竖屏小剧场,很多已经不是传统剧组实拍,而是一个人用AI工具从故事梗概一路做到可送审的成片。我自己从去年年底开始折腾这套东西,踩了大大小小无数个坑,中间一度因为角色脸连续崩坏、镜头闪得像鬼片,差点把键盘砸了。但现在这套六步工作流算是稳定跑通了:从一句话梗概到一集能拿去审片的竖屏短剧,单人操作大约三到五天,产出质量能达到短剧平台的中等偏上水平。

这套工作流解决的核心问题只有一个:让一个不懂编剧、不懂传统影视工业流程、也没有剧组资源的人,也能独立完成一部短剧的完整生产。它的输入是一段几百字甚至几句话的故事梗概,输出是可以直接提交给审片方的竖屏成片。适合谁?短视频编导、网文作者想把自己的故事影视化、MCN机构里负责批量内容制作的小团队,以及所有想低成本试水短剧赛道的个人创作者。

我接下来会把整条链路完整拆开,每一步用什么工具、怎么写提示词、参数怎么调、会踩什么坑,都按实操记录的方式写清楚。想直接照抄的,可以复制提示词模板;想弄懂原理的,我也会把每个关键选择的逻辑讲明白。

1. 先看懂这套工作流的全貌

1.1 为什么一个人也能做短剧

放在五年前,做一部短剧需要编剧、导演、摄影、灯光、美术、演员、后期,少说也是十个人的班子。但现在AI把其中绝大多数环节都吞掉了。大模型负责扩写剧本和拆解场次,图像模型负责生成角色定妆照和场景概念图,视频模型负责把静态图变成动态画面,TTS负责配音,剪辑软件负责把素材拼成成片。本质上,你是在用一套工作流替代一个剧组。

但这里有一个容易被忽略的事实:AI只是把每个环节的体力成本降低了,并没有把决策成本抹掉。你依然需要决定故事怎么推进、角色长什么样、镜头怎么组接、节奏怎么控制。换句话说,AI短剧的真正门槛不是工具,而是你有没有一套稳定的流程,把创意到成品之间的每一步都串起来。这就是工作流的价值。

1.2 六步工作流整体架构是什么样的

我跑通的这套链路分为六步,分别是:

  • 第一步:故事梗概到剧本拆解,产出剧本、场次表、角色表
  • 第二步:角色与场景视觉设定,锁定一致性
  • 第三步:分镜设计与提示词工程,把剧本翻译成画面指令
  • 第四步:批量生成视频素材
  • 第五步:配音配乐与剪辑合成
  • 第六步:审片迭代与成片输出

这六步的先后顺序不是随便拍的。前两步在解决"讲什么故事、长什么样"的问题,中间两步在解决"画面怎么来"的问题,最后两步在解决"怎么变成能看的片子"的问题。每前进一步,决策成本都在上升——生成一段视频可能只需要几十秒,但重新设计角色再生成一批视频,可能就是几个小时。所以前期的规划越细,后期的返工越少。

1.3 工具选型:够用就好,别陷入配置陷阱

关于工具,我见过太多人卡在选型这一步。今天听说A工具效果好,明天听说B工具免费,后天又想折腾本地部署,结果一周过去一条素材都没生成。我个人的建议是:视频生成端,优先用国内可以直接访问的即梦、可灵这类工具,效果好、上手快;如果追求更高可控性和批量处理能力,再去接触ComfyUI这类节点式工作流工具。文本端,用ChatGPT、Claude或者国内的豆包、Kimi都行,关键是提示词要写清楚。后期剪辑直接用剪映或CapCut就足够,不需要上专业非编软件。

提示:工具切换的成本远比想象中高。最稳妥的思路是先把一条完整流程跑通,再逐个环节优化工具。

2. 六步工作流第一步:从故事梗概到剧本拆解

2.1 让大模型帮你扩写剧本的提示词底稿

短剧的剧本和传统影视剧本有个明显区别:节奏极其紧凑。传统剧本可以用三集铺垫,短剧前三秒没有冲突,观众就划走了。所以让AI扩写剧本时,你不能只说一句"帮我写个复仇故事",那样产出的是流水账。

我常用的一套提示词底稿是这样的:

你是一位短剧编剧,擅长写每分钟一个反转的快节奏剧本。 请根据以下故事梗概,扩写成【目标集数】集剧本大纲。 每集要求: 1. 开头前3秒必须有冲突或悬念; 2. 每集至少有一个情绪爆点; 3. 每集结尾留钩子; 4. 台词口语化,单句不超过20字; 5. 标注场景名称、内外景、时间、出场人物。 故事梗概:XXXXXX

这套提示词的关键在于"前3秒冲突"和"结尾钩子"这两个约束。前3秒冲突解决的是完播率,结尾钩子解决的是追剧率。实际生成后,你会发现AI给的大纲通常能直接用,但偶尔会有逻辑bug,比如人物动机断裂、时间线错乱,需要人工快速过一遍修复。

2.2 剧本拆解的产物:场次表、角色表、镜头清单

剧本大纲定稿后,下一步是拆解。拆解不是简单把剧本分段,而是要产出三张表:场次表、角色表、镜头清单。

场次表记录每一场戏的场景、内外景、时间、人物、剧情任务。这是后面生成场景图、分镜提示词的基础。角色表记录每个角色的姓名、外貌特征、服装、性格、台词风格、年龄。这段信息后面要浓缩成角色提示词。镜头清单则是在场次表基础上,把每场戏拆成一个个具体的镜头,标明景别、运镜方式、画面内容、时长。

这三张表的价值在于把"不可控"的生成过程变成"可对照执行"的生产任务。我见过很多新手跳过这一步,直接拿着剧本来生成视频,结果生成到第八个镜头时忘了女主角穿的什么衣服,画面完全对不上。拆解这一步看起来枯燥,但它决定了整个项目的上限。

2.3 实操案例:一句梗概扩成三集剧本

举个例子,输入一句梗概:"苏晚晴被丈夫和闺蜜联手害死,重生回五年前,一步步复仇夺回公司。"

我把这句梗概丢给大模型,加上上面的提示词,输出三集大纲大概是这个样子:

第一集:苏晚晴从医院醒来,发现重生回到五年前,正握着手机看到丈夫与闺蜜的暧昧消息。愤怒之下她决定先保住父亲的股份。结尾钩子是闺蜜发来一条合作邀请。

第二集:苏晚晴在董事会上用一份旧账目反击,稳住地位。丈夫开始察觉她的变化,试探她。结尾钩子是神秘人出现,提出要帮她对付丈夫。

第三集:苏晚晴查账发现更大的阴谋,幕后黑手浮出水面。丈夫与闺蜜当面对质,女主忍痛与丈夫摊牌。结尾钩子是遗嘱的秘密。

得到大纲后,我再让AI逐集拆成场次。比如第一集拆五场戏:医院醒来、翻手机、医院走廊打电话、董事会交锋、咖啡厅对峙。然后每场戏写2到3个镜头,这里就够生成用了。

3. 六步工作流第二步:锁定角色和场景的视觉一致性

3.1 角色卡到底要写什么

短剧制作里最让人崩溃的问题,就是角色五官漂移。上一集女主是瓜子脸,下一集变成方脸,审片一看到这种画面直接打回。要解决这个问题,第一步就是把角色卡写到位。

角色卡不是简单写"漂亮、长发"这种形容词。我建议包含以下字段:

字段示例
脸型与五官鹅蛋脸,大眼睛,高鼻梁,薄唇
发型与颜色黑色长直发,刘海
服装风格剪裁利落的深色风衣,内搭白衬衫
身形特征身高168cm,身形偏瘦
年龄感28岁左右
参考描述像都市职场剧中的女高管

注意,这里所有的描述都要为后续AI生成服务。你写"鹅蛋脸、高鼻梁",比写"气质很好"有用得多,因为前者是可被模型理解的视觉语言,后者是模糊的主观判断。同样的方法也用在男主角、女配、男配身上。一部短剧一般不超过五个人物,每个人都建一张卡,项目中期开始你就知道这个工作值多少钱了。

3.2 保持画面一致的三种方法

角色卡做好后,真正让画面保持一致,目前业界有三种主流做法。

第一种是固定参考图:选定一张角色定妆图,后续所有镜头都基于这张图用图生视频或图生图的方式生成。优点是简单快捷,缺点是人物的动作、角度一旦大改,脸部容易崩。

第二种是训练LoRA模型:拿20到30张同一角色的图片训练一个轻量模型,生成任意场景时挂载这个LoRA,就能稳定输出同一个人的脸。优点是一致性最强,缺点是需要电脑有一定性能、需要学习训练流程,而且前期素材准备比较费时间。

第三种是精确提示词加种子值复用:在支持种子参数的生成工具里,锁定随机种子,配合详细的提示词,也能达到一定的一致效果。这个方法适合低成本快速试错。

新手我的建议是从第一种开始,跑通整条流程后再根据痛点决定要不要上LoRA。别一上来就训练模型,那是典型的把时间浪费在工具钻研上。

3.3 场景库和道具库:减少重复生成的痛苦

除了角色,场景也是需要提前锁定的。女主家、办公室、咖啡厅、董事会会议室,每个主要场景都要生成一张干净的"空镜"作为基底。后续生成人物镜头时,把空镜图作为背景参考,或者用图生图的方式把人物放进场景里,会大大降低前景和背景的违和感。

道具库方面,重点锁那些有剧情关键意义的物品,比如一封遗书、一枚婚戒、一份股权文件。这些道具在多个镜头里反复出现,如果每次生成都不一样,观众一眼就能看出假。我的做法是单独为关键道具生成一张特写定妆图,后面涉及道具的镜头都从这张图衍生。

4. 六步工作流第三步:用提示词把剧本翻译成镜头

4.1 分镜脚本的基本单位是"镜头"

到了第三步,你手上已经有剧本、场次表、角色表,接下来要做的就是把每个场次进一步拆成分镜脚本。一个镜头就是一个画面单位,对应AI生成的一段视频。短剧一集大约2到3分钟,按每段素材3到5秒计算,一集大概需要30到50个镜头。

分镜脚本不需要写得像专业导演那样复杂,但你至少要清楚这个镜头里有什么人、在干什么、景别是什么、镜头怎么运动。我见过有人直接拿剧本句子去生成视频,比如"女主愤怒地走出办公室",AI确实能生成,但生成出来的往往是中景固定镜头,既不贴近角色,也没有情绪冲击力。这就是分镜的意义:它把一段文字变成一组具体的视觉指令。

4.2 高复用提示词模板

经过反复测试,我总结出一套短剧分镜提示词的通用结构,分为六个要素:

主体描述 + 动作状态 + 环境场景 + 光线氛围 + 镜头语言 + 画质修饰

举个例子,一个女主角在办公室发现阴谋的分镜,提示词是这样写的:

年轻中国女性,黑色长发,穿深色风衣,站在宽敞的现代办公室落地窗前,低头看着手中的文件,眉头紧锁,表情从震惊转为愤怒,午后的自然光从窗外洒入,逆光轮廓,中景,镜头缓慢推近,电影级画质,细节丰富,浅景深,胶片质感

把这六个要素写全,比单独扔几个形容词靠谱得多。尤其要注意"动作状态"和"镜头语言",很多AI模型对动作描述理解有限,你需要用直白的动词,比如"走出""推门""抬头",而不是"心事重重地走进来"。

4.3 运镜和光影怎么写成提示词

运镜是短剧画面质感的重要来源。AI视频模型目前能理解的运镜方式已经不少,比如推近、拉远、左移、右移、上升、环绕。但在提示词里,我建议一次只写一种运镜,写多了模型往往只执行第一个或直接忽略。比如你想做一个从近景拉到全景的镜头,就写"镜头由近至远拉远",不要同时写"拉远的同时逆时针环绕"。

光影方面,短剧常用的是逆光、侧逆光、冷暖对比光。提示词里可以用"逆光剪影""暖黄色台灯光线""冷蓝色调"这类直观描述。记得不要过度堆砌光影词,否则模型很容易把画面糊成一团黑。

注意:AI生成视频对文字量有一定的"无感冗余"现象,提示词太长时模型会选择性忽略后半段。关键动作尽量放在提示词前半段。

5. 六步工作流第四步:批量生成视频素材

5.1 文生视频和图生视频怎么选

现在主流AI视频工具基本都支持文生视频和图生视频两种模式。短剧生产里,我80%的镜头用的是图生视频。原因是短剧对人物一致性要求高,直接从文字生成视频,角色脸根本控制不住。先有定妆图或场景图,再把图丢进去配上一段运动提示词,生成出来的画面对齐度要高很多。

具体来说,图生视频里又分首帧图和首尾帧图。首帧图只给出起始画面,后续画面由AI自由发挥;首尾帧图同时给出起始和结束画面,AI补中间过程。短剧对话场景我建议用首尾帧,这样可以控制对话两端的情绪状态;动作场景用首帧就行,保留更多运动自由度。

5.2 关键参数怎么调才算对

不同工具参数名称略有差异,但核心参数是相通的:

参数建议值说明
分辨率1080x1920(竖屏)短剧平台强制竖屏
单段时长3到5秒超过5秒动作容易失控
运动幅度低到中幅度大容易变形
帧率24到30fps够用且生成速度快
种子值固定复用需要重生成时保持画面一致

分辨率这一点特别提醒,很多工具默认生成横屏,短剧必须手动改成竖屏。时长方面,短剧的剪辑节奏本来就是快切为主,3到5秒一段完全够用,强行要求AI生成长镜头是大忌。

5.3 素材管理:别等到剪辑时才后悔

批量生成之后,素材管理是新手最容易忽视的一环。三四十个镜头,每个镜头可能要生成5到10条素材才能选出一条满意的,也就是说一集短剧最终可能积压两三百条素材。如果不做命名规范,等到剪辑的时候看着一堆"成片1""成片2"的视频文件,你会直接崩溃。

我的命名规范是:集数_场次_镜头序号_并选取质量标记。比如"E01_S03_L02_v4_选",表示第一集第三场第二个镜头的第4版素材,标记为选用的版本。另外,我还会在剪辑软件里先按场次序号排好素材再动刀,这样找起来快很多。

6. 六步工作流第五步:配音、配乐与剪辑合成

6.1 AI配音不只是选个声音那么简单

短剧的配音,语气比音色更重要。现在AI配音工具基本都能做到高仿真人音色,但我发现很多新手配出来的对白听起来很"平",原因是只选了音色,没有设置情感。我的建议是两步走:先根据角色卡的性格和情绪基线选一个基础音色,再在每一段对白生成时用"激动""低沉""哽咽""冷漠"这类情感标签去约束语气。

另一个容易被忽略的是语速。短剧节奏普遍偏快,日常对话的配音语速建议设置在每分钟220到260字之间,比新闻播报略快。情绪爆发的场景可以更快或更慢,但慢的时候要配合背景音乐的留白,不然观众会觉得拖沓。音画同步问题我单独提一句:有口型的近景镜头要做好人声错位校准,差两帧以内的误差不大,超过三帧观众就会觉得嘴型对不上。

6.2 配乐与音效决定短剧的"质感"

短剧的配乐不需要复杂,但一定要准。常用的配置是铺底情绪音乐加关键音效。情绪音乐可以按场次情绪选择:紧张场景用低频悬疑音色,重逢场景用钢琴或弦乐,对峙场景用鼓点。关键音效则包括脚步声、开门声、玻璃碎裂声、心跳声。这些音效素材在剪映的素材库里有不少,直接搜就行。

音效的起落要和画面动作对齐,比如推门这个动作,画面上手碰到门把那一帧就要出现门锁转动声,而不是等门开了才响。这种细节短期内看不出差距,但整集拼下来,音画同步度高的片子会莫名让人觉得专业,这就是审片时所说的"质感"。

6.3 剪辑合成实操要点

素材导入剪映后,我会按三遍过的方式来剪。第一遍按分镜脚本的顺序做粗排,只做画面拼接,不管节奏;第二遍根据配好的对白重新调节每段素材的入出点,保证口型和动作接上;第三遍加转场、字幕、调色和音量包络。

转场方面,短剧里尽量少用花哨转场。硬切是主流,时间跳跃可以用叠化或闪白,情绪反转可以用瞬间黑场。字幕建议用系统自带的默认样式加描边,字号不要太小,放在画面下方三分之一处,因为平台UI会遮挡底部区域。导出时记得关闭美颜滤镜类设置,AI素材本身已经很干净,再叠滤镜反而容易出塑料感。

小心:AI生成的人物手部经常出现六根手指或手指扭曲。粗剪时碰到这种画面要果断换备用素材,别指望后期能修。目前修手指的插件效果都很有限,换一条重生成的速度更快。

7. 六步工作流第六步:审片迭代与成片输出

7.1 审片到底审什么

如果你自己就是审片人,这个环节看起来有点多余。但短剧通常要交给平台方、合作方或甲方审,所以你得提前建立一个审片检查清单。我自己的清单包含四类:画质类、一致性类、音画类、内容类。

画质类检查有没有马赛克、AI水印、画面撕裂;一致性检查角色脸是否偏移、服装场景是否穿帮;音画类检查台词是否同步、音乐音量是否盖过人声;内容类检查字幕错别字、台词逻辑、节奏是否拖沓。建立一个检查表,每集送审前按表逐项打勾,能省下很多来回修改的时间。

7.2 快速迭代修改的套路

审片意见回来以后,最大的忌讳是直接从中间环节开始改。比如甲方说"第三场情绪不够",你直接跑去重新生成第三场的视频,结果生成出来角色脸变了,又要回头改角色设定,白忙一场。我的做法是:先定位问题层级,再决定改哪一步。

如果问题是剧情逻辑,回到剧本和场次表改,改完重排所有受影响的镜头;如果问题是角色形象,回到角色卡和定妆图改,改完所有该角色的镜头都要重新生成;如果问题只是某条素材的质量,比如画面抖动、表情僵硬,那只需要重新生成这一个镜头的备用素材。这个顺序一旦搞反,效率会断崖式下降。

7.3 输出参数和交付清单

成片输出格式,目前短剧平台基本统一要求竖屏9比16,1080x1920,MP4封装,H.264编码。帧率24到30fps,码率建议不低于8Mbps。时长方面,单集控制在1到3分钟。音频用AAC编码,人声音量尽量控制在-6dB左右,音乐不超过-20dB,这样在手机外放和戴耳机场景下听感都比较稳。

交付时除了成片,我一般还会附带一版无字幕版、一份分集简介和一张封面图。这几个文件在平台上传、过审、推荐阶段都用得上。如果你要提交给甲方,建议再附一份制作说明,写清楚每集使用的AI生成工具和修改记录,方便对方在审片时了解周期。

8. 常见问题与排查技巧实录

8.1 角色脸崩了怎么办

角色脸崩是AI短剧里最普遍的翻车现场。生成出来的画面里人物五官歪斜、左右眼不对称、脸型突变,每次遇到这种问题我都先看严重程度。如果是轻微扭曲,可以试着重新生成同种子,或者在提示词里加一个"面部特写"限制;如果是整体不一致,就要回到参考图,检查参考图本身是不是足够清晰、角度是不是太单一。参考图最好是正面或四分之三侧面、光线均匀、脸部无遮挡。另外,尽可能在同一天、用同一批参数生成同一角色的所有镜头,因为AI模型版本或工具算法一旦变化,脸部特征也会偏移。

8.2 画面闪烁和动作穿帮怎么处理

画面闪烁在AI视频里太常见了,特别是生成时间较长、场景里有大量细节纹理时。闪烁本质上是模型在几帧之间没有形成稳定的时空连续,所以处理思路就是降低生成难度。一是降低运动幅度,把"快跑"改成"快步走";二是固定首帧图,让起始画面稳定;三是适当增加帧数,让同一动作分到更多帧里,减轻突变感。服装穿帮和道具穿帮则只能靠前期的定妆图、道具图去锁死,生成后还要人工检查一遍关键物件,没有捷径。

8.3 ComfyUI等本地工作流报错排查

如果你开始用ComfyUI这类节点式工作流工具,大概率会遇到一个经典报错:"请安装缺失的包以使用此工作流。要安装缺失的节点,请先在你的Python环境中运行安装命令。"这类提示的本质是工作流JSON文件里引用了当前环境没有安装的自定义节点。解决办法就是根据报错提示逐个安装缺失节点,或者直接把工作流中的缺失节点删掉重连替代节点。

报错排查的顺序我总结为三步:先看控制台日志里标红的第一个error,不要被后续一连串warning带偏;然后检查自定义节点是否装到了正确的目录;最后确认Python版本和依赖库版本是否兼容。本地工作流最大的优势是可批处理、可复现,但前提是你的运行环境得稳定,我建议每次大版本更新后先跑一遍旧工作流做回归测试,别等到批量生成时才发现兼容问题。


这套流程跑到今天,我最大的体会是:AI短剧制作本质上不是在考验AI,而是在考验你对自己的项目有没有完整的掌控力。六步工作流里最废时间的往往不是生成素材本身,而是反复修改角色设定和镜头设计。所以我也养成了一个习惯——每次开工前先花30分钟把结局和关键转折想清楚,再让AI去执行。这个习惯帮我省下的返工时间,远比任何提示词技巧都值钱。

最后再分享一个小技巧:每一集成片导出后,我会把当时的剧本、角色卡、关键提示词和参数都归档到一个文件夹里。别小看这个动作,短剧做到第二部、第三部的时候,这套归档就是你的素材库和经验库,新项目直接从里面调模板改,效率能提升好几倍。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 21:53:30

CMSIS-FreeRTOS深度解析:ARM官方封装的工程逻辑与实战陷阱

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/11 21:53:23

2025-2026护眼台灯选购指南:硬指标详解、品牌横测与实测避坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/11 21:52:47

二叉搜索树与KV结构的实现与优化实践

1. 二叉搜索树与KV结构基础解析二叉搜索树(BST)作为数据结构领域的经典之作,本质上是一个维护元素有序性的二叉树结构。每个节点最多拥有两个子节点,且遵循"左小右大"的基本规则——对于任意节点,其左子树所…

作者头像 李华
网站建设 2026/9/11 21:50:47

实验三 抓包协议分析(基于eNSP)

一、实验目的了解TCP/IP协议的协议栈,尤其是数据链路层、网络层和传输层协议的PDU格式。二、实验内容每台电脑的IP地址是不一样的,实验报告请保证原创,谢绝雷同!谢绝雷同!!1、熟悉Wareshark抓包软件的应用。…

作者头像 李华
网站建设 2026/9/11 21:48:17

混频器原理详解:和频差频、转换损耗与镜像抑制

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华