MiniMax H3 提示词指南:如何撰写更优质的视频、Ref2VA、运镜、音频和参考提示词

一个强大的 MiniMax H3 提示词 不应只定义视觉风格。它应阐明时间推移中发生的变化、镜头运动、哪些细节需保持一致、每个参考素材的作用,以及对话、声音和音乐如何融入序列。为实现更好控制,关键在于选择正确的 H3 模式,描述可观察的变化,并为每个参考素材赋予明确的角色。
本指南涵盖 T2VA、I2VA、FL2VA、L2VA、Ref2VA、镜头控制、音频、角色一致性以及实用故障排除。这些原则也适用于结构化的 AI 视频工作流,例如 Leadde,它能将文档、培训材料和产品信息转化为可扩展的视频,并配有旁白、虚拟形象和多语言输出。
MiniMax H3 提示词指南:最佳提示词结构是什么?
将 MiniMax H3 提示词视为一份视听制作简报,这是最有效的方式。与其堆砌“电影感”、“真实感”和“戏剧性”等词语,不如描述观众在片段发展过程中实际能看到和听到的内容,以理解如何制作逼真的 AI 视频。
简单的 H3 提示词公式
日常提示词可从以下公式开始:
主体 + 动作 + 环境 + 镜头 + 时间 + 音频
例如,“一个女人在下雨的火车站”确立了场景,但没有提供太多时间信息。一个更强的提示词会解释她走向站台,听到火车驶近时停下,转向声音来源,并被一个缓慢的跟踪镜头跟随。
MiniMax 的官方基础提示词指南通过三个字段将此概念形式化:integrated_multimodal_description(集成多模态描述)、overall_soundscape(整体音景)和 non_diegetic_music(非叙事音乐)。第一个字段承载视觉时间线、动作、镜头、说话人、对话和同步场景音频;另外两个字段则将环境/物理声音与仅供观众听到的背景音乐分开。
描述可观察的结果,而非仅仅形容词
一个有用的原则是将抽象意图转化为可视行为。
与其说 “她看起来很自信”,不如描述她稳步前行、保持眼神交流、整理夹克并毫不犹豫地停下。
同样的方法也适用于限制条件。与其重复 “不要放大”,不如描述预期结果:“主体在画面中从头到尾保持大致相同的尺寸。” 一项社区 H3 一致性测试报告显示,在该特定工作流中,可衡量的构图限制比重复发出负面镜头指令效果更好。这是一种经验性工作流观察,并非 MiniMax 的官方保证。
您应该使用哪种 MiniMax H3 模式?
选择正确的模式与重写提示词同样重要。MiniMax 的基础工作流支持纯文本生成,以及首帧、尾帧和首尾帧任务,而其独立的 Ref2VA 检查点则处理多模态参考生成。
| 模式 | 输入 | 最佳提示词目标 |
| T2VA | 文本 | 构建完整的视听场景 |
| I2VA | 首帧 | 保留开头并向前发展 |
| FL2VA | 首帧 + 尾帧 | 描述端点之间的过渡 |
| L2VA | 尾帧 | 向提供的结局发展 |
| Ref2VA | 图像/视频/音频 | 组合不同的参考角色 |
T2VA、I2VA、FL2VA 和 L2VA
T2VA 必须从零开始建立场景。I2VA 将提供的图片视为实际的首帧,因此提示词应在引入运动之前保留身份、服装、物体、颜色和构图。
对于 FL2VA,提示词不应仅仅描述图片 1 和图片 2。MiniMax 特别建议描述它们之间可观察的路径:主体如何移动、姿势如何变化、物体如何被操作,以及构图或光线如何汇聚到最终帧。L2VA 则通过从一个合理的早期状态开始,并逐渐达到提供的最终帧来反向推理。
何时使用 Ref2VA?
当不同的素材承担不同任务时,应使用 Ref2VA——例如,一张图片定义角色,另一张定义服装,一段视频提供行走动作和镜头节奏,一段音频提供语音参考。
这最好理解为关系驱动的生成。模型不仅需要知道每个文件包含什么,还需要知道每个来源的信息应如何影响最终视频。MiniMax 的全参考格式明确区分了可复用主体、具体画面锚点、视频级时间源和音频参考。
使用能解决镜头的最简单模式
一个实用的制作原则是:除非镜头需要,否则不要增加参考复杂性。
如果一个过渡只需要精确的开头和结尾,FL2VA 能直接定义任务。当您确实需要诸如来自图像 1 的身份 + 来自视频 1 的动作 + 来自音频 1 的声音等关系时,再转向 Ref2VA。
这也有助于调试。当相互竞争的独立约束较少时,更容易识别问题是来自运动、身份、构图还是音频。

如何控制镜头、镜头运动、时间安排和过渡?
当时间线被视为剪辑而非段落时,H3 提示词更容易控制。
镜头剪辑、时间戳和时间预算
MiniMax 的官方格式不对 [Shot 1] 进行时间戳。后续镜头以递增的剪辑时间开始,例如 [Shot 2] At 00:03.500。一个新镜头应引入有意义的新信息——例如不同的视角、位置、状态、主体或时间。小距离或角度变化通常最好表达为镜头运动,而非另一个剪辑。
这创建了一个实用的时间预算。在一个 8 秒的片段中,三个动作、两次镜头移动、一个反应、一句台词和两次剪辑都争夺相同的有限时长。当生成感觉仓促时,移除事件通常比添加更多描述性语言效果更好。
H3 可遵循的镜头语言
MiniMax 文档记录了推拉、摇摄、推轨、俯仰、升降、弧形、跟踪、固定镜头、主观视角、滚转和镜头抖动等镜头操作。其推荐的逻辑本质上是:
运动类型 + 可选幅度 + 可选速度
因此,与其说“动态电影镜头”,不如写一些可操作的描述,例如**“镜头缓慢向右推轨,同时保持产品居中。”**
分离必须保持不变的与可以改变的
在生成之前,创建一个简单的心理固定与可变映射。
一个产品视频可能要求瓶身形状、标签文字、瓶盖和颜色保持固定,而镜头位置、反光、水流运动和光线则可以变化。一个角色序列可能锁定面部、发型和服装,同时允许姿势和表情演变。
这减少了矛盾的指令,因为提示词不再要求所有视觉属性同时改变。

如何在不损失角色或产品一致性的情况下使用参考素材?
最强的参考工作流会为每个素材分配一个特定用途。
为每个参考素材赋予一个明确的任务
一个实用的映射可能是:
图像 1 → 角色身份 图像 2 → 服装 图像 3 → 产品设计 视频 1 → 行走动作和镜头路径 音频 1 → 音色
MiniMax 的官方 Ref2VA 格式正是支持这种跨源定义:一个主体可以从图片中获取外观,从视频中获取动作,而单个参考文件也可以提供多个可复用主体。
重要的是避免意外转移。如果视频 1 应该提供动作而非其演员或环境,请在关系设计中明确说明。
主体、画面、故事板和参考视频
在官方术语中,<Subject N> 代表可复用的可见内容,而 <Picture N> 用于图像本身作为具体帧、构图锚点或视频脚本和故事板参考时。<Video N> 代表整体视频关系,例如编辑、连贯性、镜头运动、剪辑、节奏或时间结构。<Audio N> 处理音频复制或音色、表达方式、节奏或音乐风格等特征。
这种区分防止了一个常见的概念性错误:角色参考不自动是关键帧,故事板也不自动是精确终点。
参考经济性和镜头级一致性
更多的参考素材不自动意味着更多的信息。在制作工作流中,将参考视频剪辑到清晰展示您所需动作、镜头路径或音质的部分。
此外,应在整个镜头中评估身份,而不仅仅是第一帧。一项社区测试发现,在特写镜头中,身份漂移比在小脸构图中出现得更早,这在该用户特定的本地设置下。确切的时间不应泛化,但工作流的经验教训很有用:在每个重要镜头的多个时间点检查面部身份、服装和小型道具。
高级 Ref2VA、对话和音频提示词如何工作?
Ref2VA 是 H3 提示词从传统文本到视频提示词转变为多模态制作规划的关键。
Ref2VA 提示词的六部分结构
MiniMax 的全参考指南定义了六个部分:
subject_definitions → summary → retention_analysis → detailed_description → overall_soundscape → non_diegetic_music。
系统首先定义参考素材的含义,然后总结任务,解释每个参考素材如何被保留或转移,最后按播放顺序编写目标视频。
在编写正式提示词之前,一个有用的规划层是:
| 来源 | 保留 | 转移 | 忽略 |
| 图像 1 | 面部、头发 | — | 背景 |
| 视频 1 | — | 行走、镜头 | 演员身份 |
| 音频 1 | 音色 | 表达方式 | 原始对话 |
这会将“使用所有这些参考素材”之类的模糊请求转化为明确的源到目标关系。
对话、声音、音效和音乐
说话角色使用稳定的 ID,例如 (S1) 和 (S2),而对话则放置在 <d>[语言] ...</d> 内部。MiniMax 还区分屏幕内对话和屏幕外画外音,并建议当屏幕内角色仅进行旁白时,明确保持其嘴唇闭合。
环境音效和物理效果属于音景,而 non_diegetic_music 则保留给观众而非角色听到的音乐。如果您想要脚步声、雨声和物体声音但没有配乐,请保留音景并将 non_diegetic_music 设置为 N/A。
自然语言提示词与官方结构化提示词
简短的自然语言指令在托管 H3 系统中仍然有效,因为 MiniMax 使用 H3-Context-IR,这是一个预处理层,它在为 H3-Base 生成结构化表示之前,解释文本、图像、视频和音频之间的关系。开放模型卡将指令解析、跨模态关联、时间理解和逻辑推理描述为该过程的一部分。
这解释了一个明显的矛盾:简单提示词适用于直接的托管生成,而结构化提示词对于精确的多参考、对话、时间控制和可重复制作任务则更有价值。
为什么 MiniMax H3 会忽略提示词,以及最佳测试工作流是什么?
当生成失败时,一次性重写所有内容会使问题原因更难识别。
常见的 H3 提示词问题和修复方法
| 问题 | 可能原因 | 首先测试什么 |
| 说话人错误 | 说话人映射不明确 | 锁定 (S1)/(S2) |
| 角色变化 | 身份信号冲突 | 简化参考素材 |
| 参考素材被忽略 | 角色模糊 | 分配一个任务 |
| 随机剪辑 | 镜头指令过多 | 使用镜头运动 |
| 时间戳被忽略 | 用作动作时间 | 保留给剪辑 |
| FL2VA 跳跃 | 缺少过渡路径 | 描述中间变化 |
| 结局不符 | 收敛性差 | 锁定最终构图 |
| 不想要的音乐 | 音频层混淆 | 明确设置音乐 |
| 文本变化 | 措辞未保留 | 引用确切可见文本 |
| 视频感觉仓促 | 事件过多 | 减少事件点 |
一个有用的原则是,当两种模式都能解决同一任务时,进行对照比较,而不是假设更复杂的模式总能生成更好的片段。
实用的 H3 分步测试工作流
首先定义生成的验收标准:也许角色身份最重要,或者产品标签、终点过渡、对话归属或镜头运动不可妥协。
然后分层测试:首先确立角色和场景;接着添加运动和镜头;视觉行为稳定后再添加声音;只有在简单版本奏效后才引入额外剪辑、故事板或更多角色。高分辨率重新生成应在语义结果正确之后进行,因为高分辨率无法解决矛盾的参考关系。
这种分阶段方法在可扩展视频管线中特别有用。对于将可重复知识或业务内容转化为视频的工作流,包括 Leadde 等文档转视频培训工具,分离内容结构、视觉行为、AI旁白和最终渲染,可以更容易地隔离修订,而不是每次都重建整个制作。
保存成功的镜头,而非重新生成所有内容
对于较长的项目,将每个成功的片段视为经过验证的制作资产。如果镜头 1 和镜头 2 成功,但镜头 3 失败,请重新生成失败的部分,而不是丢弃上游所有内容。
社区 H3 工作流已经为此目的使用检查点镜头:一旦成功的部分被保存,下游实验就可以重新运行,而无需重复支付重新创建早期素材的计算和创意成本。
这引出了一个更广泛的制作原则:
生成 → 验证 → 保存 → 继续。
对于 AI 视频,提示工程最终会演变为工作流工程。
结论
MiniMax H3 提示词在任务结构清晰而非仅仅用更多词语描述时效果最佳。选择最适合镜头的简单模式,描述可观察的变化,将固定属性与可变属性分离,为每个参考素材分配特定角色,并逐层调试。对于高级 Ref2VA 工作流,真正的优势在于明确角色、运动、镜头、音频和关键帧之间的关系,然后将成功的生成转化为下一个镜头的可复用构建块。








