视频生成模型的能力在快速迭代,但真正限制普通用户出片的,往往不是模型本身,而是提示词。MiniMAX H3 是 MiniMax 视频生成模型家族中一个热度很高的版本,它支持参考图驱动、镜头控制和电影级特效生成,但这部分能力强依赖提示词的写法。同样是 H3,有人生成的是稳定运镜的短片,有人生成的是缺乏主体、镜头乱跳的拼接画面。差距通常不在模型参数,而在用户是否使用了一套足够专业、足够结构化的提示词模板。
这篇文章要拆解的就是 MiniMAX H3 的 SKILL 三段式专业提示词模板。这种模板思路常见于一些提示词整理合集中,例如 BSAI 第 58 期就把 H3 的电影级特效生成经验封装成了“场景设定 + 主体动作 + 镜头特效”的三段式结构。核心价值在于:不需要自己写后端 API 调用逻辑,不需要本地跑推理模型,在官方生成入口把模板填好,就能稳定得到接近电影质感的画面。文章会按“模板结构、填写方法、实战流程、常见报错、最佳实践”的顺序展开,末尾会给出一个可直接复用的检查清单。
1. MiniMAX H3 提示词模板的价值:为什么强模型也要强模板
1.1 视频生成模型真正难的是“把描述变成画面”
MiniMAX H3 这类模型已经解决了“能不能生成”的问题。真正难的是“能不能按你的意图生成”。视频生成模型和人不一样,它不会主动追问“你说的主角穿什么衣服”“镜头是从哪个方向拍的”“环境是白天还是夜晚”。模型会把提示词里的所有信息当作一次采样依据,写得越明确,生成结果越能落到目标区间。
如果提示词只有一句话,例如“一个剑客在雨夜战斗”,模型会自行脑补大量细节:剑客可能没有脸、衣服颜色完全随机、镜头角度不稳定、特效强度不可控。这是视频生成模型最常见的失败模式:画面好看,但不是用户想要的那个画面。
H3 对提示词的理解粒度比上一代更细,能识别时间、天气、镜头运动、角色动作、特效类型这些元素。但前提是这些元素确实出现在提示词中。三段式模板的价值,就是把用户脑海里零散的画面描述,强制拆成模型最容易理解的信息块。
1.2 SKILL 模式的本质:可复用的专业指令
SKILL 这个词在 AI 工具链里越来越常见。它不是普通提示词,而是一套可复用的专业指令单元。一个 SKILL 通常包含:触发条件、输入要求、执行步骤、输出格式。在 Claude Code、Codex、Cursor 这类工具中,SKILL 被用来让模型按照固定 SOP 处理任务;在 MiniMAX H3 的提示词场景中,SKILL 则被用来固化“如何写电影级提示词”这个经验。
普通提示词是一次性对话,写完之后下次要用还得再写一遍。SKILL 则像插件一样,可以被反复调用。BSAI 第 58 期整理的这套模板,本质上就是把 H3 出片经验封装成一个三段式 SKILL:不管你这次想生成打斗、科幻、还是古风场景,只要把三段结构填满,模型就能按同一套逻辑工作。
这背后的设计动机是减少随机性。视频生成模型存在天然随机性,提示词可以约束随机性的范围。三段式模板把最容易影响画面结果的信息全部显式化,模型就不需要替用户做太多脑补。
1.3 三段式模板与传统长文本提示词的区别
传统做法是把所有细节写在一段超长文本里,中间用逗号或句号分隔。这种写法有两个问题:一是模型可能只关注到后半段信息,前半段的场景设定权重被稀释;二是用户很难发现哪一部分写错了,排错成本高。
三段式模板把提示词拆成三个明确的语义块:
- 第一段负责定环境,给模型足够的空间背景。
- 第二段负责定主体,告诉模型谁在画面上、正在做什么。
- 第三段负责定镜头和质感,控制运镜、特效和画面风格。
这样做的好处是信息密度高、条理清楚,模型能按段落读取语义。用户排查问题时也能快速定位:画面环境不对就改第一段,主体动作不对就改第二段,电影感不足就改第三段。
2. 三段式专业提示词模板完整拆解
2.1 第一段:场景设定,先把世界观定下来
第一段要回答的问题是:画面发生在什么时间、什么地点、什么天气、什么氛围。
模型生成画面时,最先确定的是环境背景。环境决定了光线方向、色调、物体材质、透视关系。如果没有场景设定,模型会让前景主体直接飘在一个模糊背景上,这是很多生成视频看起来“假”的原因。
场景设定应该包含四个维度。
| 维度 | 说明 | 示例 |
|---|---|---|
| 时间 | 清晨、正午、黄昏、夜晚 | 黄昏 |
| 地点 | 具体场所,越具体越好 | 废弃工业城市高架桥 |
| 天气 | 晴、雨、雪、雾、沙尘 | 暴雨,远处有闪电 |
| 氛围 | 整体情绪和色调倾向 | 潮湿、压抑、冷蓝色调 |
写场景设定时有一个建议:不要只写名词,要写“名词 + 状态”。例如“高架桥”是名词,模型只能确认地点;“桥面潮湿,反射橙色路灯,烟雾弥漫”则包含了材质、光线和空气状态,模型能据此确定画面的光影关系。
2.2 第二段:主体与动作,把故事讲清楚
第二段要回答的问题是:画面里的核心角色是谁、长什么样、正在做什么、动作幅度多大、有没有交互对象。
视频模型和图像模型不一样,图像模型生成一张静态图,主体不动也没关系。视频模型必须知道运动信息,否则画面会很笨重,或者主体会以不合理的方式移动。
主体描述建议按这个顺序写:
- 主体身份和外观:例如“一名身穿黑色风衣的独臂剑客,面部有旧伤疤”。
- 道具和特征:例如“手中握着一柄发着蓝光的断刃”。
- 动作及幅度:例如“从桥面高速跃起,向直升机上的机械士兵挥出横向剑气”。
- 交互对象:例如“剑气碰到机械士兵装甲时产生剧烈爆炸,士兵被击退”。
这一段最容易犯的错误是只写“动态”而不写“动作”。例如“剑客很帅”“画面很燃”这类词,模型无法转换成具体的动作序列。需要把“帅”翻译成画面语言,比如“黑色风衣在狂风中翻飞”就是画面语言。
2.3 第三段:镜头、特效与画质,把电影感拉满
第三段要回答的问题是:摄影机怎么拍、画面有哪些特殊效果、最终成片是什么质感。
这是三段式模板和普通提示词差异最大的一层。普通用户写提示词通常只写到主体和动作就结束了,但电影级特效需要额外信息来约束运镜和渲染风格。
镜头语言部分可以写景别和运镜方式。
| 镜头参数 | 可选值 | 说明 |
|---|---|---|
| 景别 | 远景、全景、中景、近景、特写 | 决定主体在画面中的比例 |
| 运镜 | 推、拉、摇、移、跟、升降 | 决定画面运动方式 |
| 镜头运动强度 | 平稳、轻微晃动、剧烈抖动 | 表现真实感和代入感 |
| 焦点 | 浅景深、深景深、焦点切换 | 决定画面的层次感 |
特效部分要写清楚特效类型、颜色、触发位置。例如“蓝色剑气、火花飞溅、装甲破碎的金属颗粒、雨水被冲击波震开”,这些都是具体可见的特效表现。
画质部分可以使用“电影级质感、细节真实、浅景深、色调整体偏蓝紫、4K”这类描述。注意,质感类描述和特效描述不冲突,前者是整体风格约束,后者是具体现象约束。
2.4 三段式速查表
写模板前先对照这个速查表,确认每一段都有内容。
| 段落 | 必须包含 | 推荐包含 | 容易遗漏 |
|---|---|---|---|
| 场景设定 | 时间、地点 | 天气、氛围、光线来源 | 地面材质、空气状态 |
| 主体动作 | 角色身份、动作 | 外观、道具、交互对象 | 动作幅度、速度感 |
| 镜头特效 | 景别、运镜 | 特效颜色、触发位置 | 画质和色调约束 |
3. 免 API 免推理的实战流程:从模板到直出电影级特效
3.1 在官方界面直接使用模板
MiniMAX H3 的提示词模板可以不写一行代码、不调用任何 API,直接在官方生成界面使用。
典型操作流程如下:
- 打开 MiniMAX 视频生成页面,选择 H3 模型。
- 如果有参考图需求,进入 ref2va 参考模式并上传参考图。
- 将三段式模板粘贴到提示词输入框。
- 根据需要设置画幅比例、生成时长、随机种子等参数。
- 点击生成,等待视频输出。
在这个流程中,三个节点最容易影响结果:模型选择、参考图模式、提示词是否完整。很多用户习惯只看提示词本身,忽略模型选择,导致 H3 的能力没有真正发挥。
如果需要在本地用脚本批量生成提示词,可以用一个简单的 Python 脚本做模板变量替换。
# fill_h3_template.py template = """ [场景设定] 时间:{time} 地点:{location} 天气:{weather} 氛围:{atmosphere} [主体与动作] 主体:{subject} 道具:{props} 动作:{action} 交互:{interaction} [镜头与特效] 景别:{shot} 运镜:{camera} 特效:{effects} 画质:电影级质感,细节真实,浅景深,4K """ filled = template.format( time="黄昏", location="废弃工业城市高架桥", weather="暴雨,远处有闪电", atmosphere="潮湿压抑,冷蓝色调", subject="一名身穿黑色风衣的独臂剑客,面部有旧伤疤", props="手中的断刃发着蓝光", action="从桥面高速跃起,向直升机上的机械士兵挥出横向剑气", interaction="剑气碰到装甲时剧烈爆炸,士兵被击退", shot="中景转近景", camera="正面跟拍,镜头先低后高,带轻微晃动", effects="蓝色剑气,火花飞溅,装甲破碎金属颗粒,雨水被冲击波震开" ) print(filled)这段脚本只负责把变量填入模板,不涉及任何 API 调用。它的价值在于批量制作不同场景提示词时,可以快速产出多个版本。
3.2 战斗打斗场景示例
下面给一个可直接使用的完整示例,主题是“超燃战斗打斗”,适合测试 H3 的特效能力。
[场景设定] 时间:黄昏 地点:废弃工业城市高架桥 天气:暴雨,远处有闪电 氛围:桥面潮湿,反射橙色路灯,烟雾弥漫,整体压抑而紧张 [主体与动作] 主体:一名身穿黑色风衣的独臂剑客,面部有旧伤疤,眼神坚定 道具:手中握着一柄发着蓝光的断刃,剑身有裂纹,能量流动 动作:从桥面高速跃起,身体在空中旋转,向直升机上的机械士兵挥出横向剑气 交互:剑气碰到机械士兵装甲时产生剧烈爆炸,装甲碎片飞溅,士兵被击退数米 [镜头与特效] 景别:中景转近景,跟随主角动作 运镜:正面跟拍,镜头先低后高,带轻微晃动 特效:蓝色剑气划破雨幕,火花飞溅,装甲破碎的金属颗粒四散,雨水被冲击波震开 画质:电影级质感,细节真实,浅景深,色调整体偏蓝紫,4K整个模板约 200 字。它不需要用户额外补充参数,H3 会按三个段落依次解析并生成连贯镜头。
3.3 验证模板是否生效的三种结果
生成完成后,需要判断模板是否真正生效。可以从三个结果维度检查。
第一种,场景表现正确:画面确实出现在高架桥上,确实是黄昏加暴雨,说明第一段被有效解析。
第二种,动作连贯正确:剑客从桥面跃起、挥剑、剑气命中后爆炸,说明第二段的主体和动作被有效解析。
第三种,电影感明显:画面有清晰运镜、浅景深、蓝紫色调,说明第三段的镜头和画质约束生效。
如果三个维度都满足,模板可以复用。只需要在后续生成时替换变量值,就能批量生成不同场景。
4. 从单条模板到 SKILL:沉淀自己的提示词资产
4.1 为什么需要把模板改成 SKILL
单条模板解决的是“这一次生成”。但实际使用场景是重复的:你每周可能要生成多条视频,每条都不一样,但模板结构是稳定的。只要把结构固化下来,就形成了一套自己的提示词工作流。
SKILL 就是这种固化产物。它把“写三段式提示词”的方法封装成一个可复用技能,后续想生成任何场景,只需描述需求,SKILL 会自动拆成三段结构。
在 AI Agent 工具中,SKILL 通常是一个包含描述、输入参数和执行步骤的配置文件。在 MiniMAX H3 的场景中,SKILL 更像一个提示词生成器,负责把用户零散想法扩写成专业模板。
4.2 SKILL 的最小结构
一个最小可用的 H3 提示词 SKILL 可以写成 YAML 结构。
name: h3-three-stage-prompt description: 将用户输入扩写成 MiniMAX H3 三段式电影级提示词 version: 1.0.0 input_required: - scene_time - scene_place - subject_action input_optional: - subject_appearance - weather - camera_move - effects workflow: - 1. 解析用户输入,提取时间、地点、氛围 - 2. 解析主体身份、动作、交互对象 - 3. 补全镜头、特效、画质信息 - 4. 按三段式结构输出完整提示词 output_format: | [场景设定] 时间/地点/天气/氛围 [主体与动作] 主体/道具/动作/交互 [镜头与特效] 景别/运镜/特效/画质这个结构在原理上与很多 Agent SKILL 一致。它不直接生成视频,而是负责提示词生成。真正出片还是交给 MiniMAX H3。
4.3 把模板变量化的改造方法
模板写好后,下一步就是变量化。所谓变量化,就是把模板中的固定词和可替换词分开。
固定词是每段描述中稳定的部分,例如“电影级质感,细节真实,浅景深”这类画质约束。可替换词是每个场景不同的部分,例如时间、地点、角色、动作、特效。
改造方法是把每个段落的描述拆成“槽位 + 默认值”。脚本或 SKILL 中的用户输入填进槽位,未提供的值使用默认值。这样做的好处是:
- 输出结构永远一致,不会因为漏写某段导致画面崩塌。
- 默认值可以沉淀经验,例如“运镜默认正面跟拍”“色调默认偏蓝紫”。
- 后续新场景只需要改槽位值,不需要重新设计提示词结构。
5. 常见问题与排查路径
5.1 服务端 529 Overloaded
现象:生成请求提交后,页面或 API 返回类似错误。
api error: 529 overloaded. This is a server-side issue, usually temporary...这条错误的意思是服务端过载。它通常出现在生成高峰期,和用户提示词无关,属于服务端临时状态。
检查方式:
- 确认当前时间是否为高峰时段。
- 检查官方状态页面或社区反馈,判断是否是大规模故障。
- 短时间重试或改到低峰时段生成。
处理建议:不要频繁重试,容易让负载更高。建议间隔几分钟后重试,或者使用稍后生成功能。
5.2 生成结果与提示词不符
现象:模板填写完整,但生成的画面和描述差距很大,例如写了夜晚画面却是白天。
排查顺序:
- 检查提示词内是否存在冲突信息。例如第一段写“黄昏”,第三段又写“正午光线”,模型可能随机选择。
- 检查主体描述是否包含明确可见特征。只有“一个剑客”这种描述,模型无法确定外观。
- 检查第三段是否缺失。如果只有场景和动作,没有镜头和画质约束,画面会比较平,缺少电影感。
处理建议:保持三段信息一致,删除冲突词;主体描述至少包含服装、道具、动作三点。
5.3 调用 API 时的模型名称错误
现象:通过 API 调用 H3 时,提示模型名称不存在或不受支持。
示例错误:
The supported API model names are ...不同接入平台的模型名称可能不一致。页面端显示的模型名和 API 端允许传入的模型名不一定相同。解决方法是先检查当前 API 文档或服务商支持的模型列表,不要直接把页面端的名称抄到 API 参数里。
5.4 本地部署与 ComfyUI 场景的显存问题
现象:使用本地部署或 ComfyUI 整合包运行 H3 时,生成过程报显存不足或推理中断。
MiniMAX H3 的本地部署对显卡显存要求较高,常见的 8G 显存显卡在默认参数下很容易爆显存。解决方法包括:
- 降低分辨率,从高分辨率降到 720P 或更低。
- 减少生成帧数,缩短视频时长。
- 开启显存优化和降低采样精度。
- 使用整合包时,确认是否已经替换为官方要求的模型推理框架。
如果是学习用途,优先使用在线入口,减少环境问题干扰。
6. 最佳实践与扩展方向
6.1 发布前提示词检查清单
生成前用下面的清单快速检查提示词,能减少大多数失败生成:
- 第一段是否包含明确的时间和地点,缺哪项补哪项。
- 第二段是否描述了外观、道具和动作,是否只有情绪词而没有画面词。
- 第三段是否包含镜头、特效、画质,是否至少写清楚一个运镜方向。
- 三段之间是否存在冲突信息,如时间、天气、色调矛盾。
- 是否使用了“高速”“剧烈”“缓慢”等明确幅度词。
- 画面主体是否唯一,如果是多人场景,是否说清了主次关系。
- 是否写了类似“4K、电影级质感、浅景深”这类画质约束词。
6.2 多镜头脚本化扩展
单条模板解决单镜头。如果要生成一个完整场景,可以把多个提示词模板串起来,每个镜头使用独立模板,镜头之间保持时间、地点、主体外观一致。
例如同一个剑客,镜头 1 是高架桥上跳跃,镜头 2 是剑气击中装甲,镜头 3 是士兵倒地特写。三段模板中,主体外观保持一致,场景设定保持一致,只调整镜头和动作。这样生成的多段视频拼接后,主体一致性比完全随机生成好很多。
这是 H3 提示词模板从“出单条”走向“出短片”的关键一步。后续可以尝试用导演台模式统一管理多镜头参数,把时间、机位、主角信息集中维护。
6.3 后续可以深入的方向
MiniMAX H3 的提示词体系还有几个值得继续学习的入口:
- ref2va 参考模式的提示词规范:参考图主要约束主体外观,文本提示词应该补充动作和环境。
- 本地部署的模型运行细节:显存优化、模型量化、推理框架适配。
- SKILL 工程化:从单条 SKILL 扩展为整套提示词资产库,按场景类型分类存储。
- 长镜头和转场控制:研究如何让 H3 在单个视频内完成多次运镜切换。
对初次接触 H3 的开发者,建议从在线入口加三段式模板开始,先积累一批稳定出片的提示词,再去研究 API 和本地部署。提示词模板的价值不只在“抄作业”,而在于它暴露了模型理解视频语言的方式。理解了模板为什么这样拆,后续写任何场景都能保持稳定输出。