Leadde Logo

MiniMax H3 提示词指南:如何撰写更优质的视频、Ref2VA、运镜、音频和参考提示词

Leadde Team·更新于 2026年8月16日·7 分钟阅读
MiniMax H3 提示词指南:如何撰写更优质的视频、Ref2VA、运镜、音频和参考提示词
- 创作 AI 视频,使用 300+ 个虚拟形象,支持 175+ 种语言。

一个强大的 MiniMax H3 提示词 不应只定义视觉风格。它应阐明时间推移中发生的变化、镜头运动、哪些细节需保持一致、每个参考素材的作用,以及对话、声音和音乐如何融入序列。为实现更好控制,关键在于选择正确的 H3 模式,描述可观察的变化,并为每个参考素材赋予明确的角色

本指南涵盖 T2VA、I2VA、FL2VA、L2VA、Ref2VA、镜头控制、音频、角色一致性以及实用故障排除。这些原则也适用于结构化的 AI 视频工作流,例如 Leadde,它能将文档、培训材料和产品信息转化为可扩展的视频,并配有旁白、虚拟形象和多语言输出

Leadde AI.webp

MiniMax H3 提示词指南:最佳提示词结构是什么?

将 MiniMax H3 提示词视为一份视听制作简报,这是最有效的方式。与其堆砌“电影感”、“真实感”和“戏剧性”等词语,不如描述观众在片段发展过程中实际能看到和听到的内容,以理解如何制作逼真的 AI 视频

简单的 H3 提示词公式

日常提示词可从以下公式开始:

主体 + 动作 + 环境 + 镜头 + 时间 + 音频

例如,“一个女人在下雨的火车站”确立了场景,但没有提供太多时间信息。一个更强的提示词会解释她走向站台,听到火车驶近时停下,转向声音来源,并被一个缓慢的跟踪镜头跟随。

MiniMax 的官方基础提示词指南通过三个字段将此概念形式化:integrated_multimodal_description(集成多模态描述)、overall_soundscape(整体音景)和 non_diegetic_music(非叙事音乐)。第一个字段承载视觉时间线、动作、镜头、说话人、对话和同步场景音频;另外两个字段则将环境/物理声音与仅供观众听到的背景音乐分开。

描述可观察的结果,而非仅仅形容词

一个有用的原则是将抽象意图转化为可视行为。

与其说 “她看起来很自信”,不如描述她稳步前行、保持眼神交流、整理夹克并毫不犹豫地停下。

同样的方法也适用于限制条件。与其重复 “不要放大”,不如描述预期结果:“主体在画面中从头到尾保持大致相同的尺寸。” 一项社区 H3 一致性测试报告显示,在该特定工作流中,可衡量的构图限制比重复发出负面镜头指令效果更好。这是一种经验性工作流观察,并非 MiniMax 的官方保证。

您应该使用哪种 MiniMax H3 模式?

选择正确的模式与重写提示词同样重要。MiniMax 的基础工作流支持纯文本生成,以及首帧、尾帧和首尾帧任务,而其独立的 Ref2VA 检查点则处理多模态参考生成。

模式输入最佳提示词目标
T2VA文本构建完整的视听场景
I2VA首帧保留开头并向前发展
FL2VA首帧 + 尾帧描述端点之间的过渡
L2VA尾帧向提供的结局发展
Ref2VA图像/视频/音频组合不同的参考角色

T2VA、I2VA、FL2VA 和 L2VA

T2VA 必须从零开始建立场景。I2VA 将提供的图片视为实际的首帧,因此提示词应在引入运动之前保留身份、服装、物体、颜色和构图。

对于 FL2VA,提示词不应仅仅描述图片 1 和图片 2。MiniMax 特别建议描述它们之间可观察的路径:主体如何移动、姿势如何变化、物体如何被操作,以及构图或光线如何汇聚到最终帧。L2VA 则通过从一个合理的早期状态开始,并逐渐达到提供的最终帧来反向推理。

何时使用 Ref2VA?

当不同的素材承担不同任务时,应使用 Ref2VA——例如,一张图片定义角色,另一张定义服装,一段视频提供行走动作和镜头节奏,一段音频提供语音参考。

这最好理解为关系驱动的生成。模型不仅需要知道每个文件包含什么,还需要知道每个来源的信息应如何影响最终视频。MiniMax 的全参考格式明确区分了可复用主体、具体画面锚点、视频级时间源和音频参考。

使用能解决镜头的最简单模式

一个实用的制作原则是:除非镜头需要,否则不要增加参考复杂性

如果一个过渡只需要精确的开头和结尾,FL2VA 能直接定义任务。当您确实需要诸如来自图像 1 的身份 + 来自视频 1 的动作 + 来自音频 1 的声音等关系时,再转向 Ref2VA。

这也有助于调试。当相互竞争的独立约束较少时,更容易识别问题是来自运动、身份、构图还是音频。

image.png

如何控制镜头、镜头运动、时间安排和过渡?

当时间线被视为剪辑而非段落时,H3 提示词更容易控制。

镜头剪辑、时间戳和时间预算

MiniMax 的官方格式[Shot 1] 进行时间戳。后续镜头以递增的剪辑时间开始,例如 [Shot 2] At 00:03.500。一个新镜头应引入有意义的新信息——例如不同的视角、位置、状态、主体或时间。小距离或角度变化通常最好表达为镜头运动,而非另一个剪辑。

这创建了一个实用的时间预算。在一个 8 秒的片段中,三个动作、两次镜头移动、一个反应、一句台词和两次剪辑都争夺相同的有限时长。当生成感觉仓促时,移除事件通常比添加更多描述性语言效果更好。

H3 可遵循的镜头语言

MiniMax 文档记录了推拉、摇摄、推轨、俯仰、升降、弧形、跟踪、固定镜头、主观视角、滚转和镜头抖动等镜头操作。其推荐的逻辑本质上是:

运动类型 + 可选幅度 + 可选速度

因此,与其说“动态电影镜头”,不如写一些可操作的描述,例如**“镜头缓慢向右推轨,同时保持产品居中。”**

分离必须保持不变的与可以改变的

在生成之前,创建一个简单的心理固定与可变映射

一个产品视频可能要求瓶身形状、标签文字、瓶盖和颜色保持固定,而镜头位置、反光、水流运动和光线则可以变化。一个角色序列可能锁定面部、发型和服装,同时允许姿势和表情演变。

这减少了矛盾的指令,因为提示词不再要求所有视觉属性同时改变。

image.png

如何在不损失角色或产品一致性的情况下使用参考素材?

最强的参考工作流会为每个素材分配一个特定用途。

为每个参考素材赋予一个明确的任务

一个实用的映射可能是:

图像 1 → 角色身份 图像 2 → 服装 图像 3 → 产品设计 视频 1 → 行走动作和镜头路径 音频 1 → 音色

MiniMax 的官方 Ref2VA 格式正是支持这种跨源定义:一个主体可以从图片中获取外观,从视频中获取动作,而单个参考文件也可以提供多个可复用主体。

重要的是避免意外转移。如果视频 1 应该提供动作而非其演员或环境,请在关系设计中明确说明。

主体、画面、故事板和参考视频

在官方术语中,<Subject N> 代表可复用的可见内容,而 <Picture N> 用于图像本身作为具体帧、构图锚点或视频脚本和故事板参考时。<Video N> 代表整体视频关系,例如编辑、连贯性、镜头运动、剪辑、节奏或时间结构。<Audio N> 处理音频复制或音色、表达方式、节奏或音乐风格等特征。

这种区分防止了一个常见的概念性错误:角色参考不自动是关键帧,故事板也不自动是精确终点

参考经济性和镜头级一致性

更多的参考素材不自动意味着更多的信息。在制作工作流中,将参考视频剪辑到清晰展示您所需动作、镜头路径或音质的部分。

此外,应在整个镜头中评估身份,而不仅仅是第一帧。一项社区测试发现,在特写镜头中,身份漂移比在小脸构图中出现得更早,这在该用户特定的本地设置下。确切的时间不应泛化,但工作流的经验教训很有用:在每个重要镜头的多个时间点检查面部身份、服装和小型道具。

高级 Ref2VA、对话和音频提示词如何工作?

Ref2VA 是 H3 提示词从传统文本到视频提示词转变为多模态制作规划的关键。

Ref2VA 提示词的六部分结构

MiniMax 的全参考指南定义了六个部分:

subject_definitionssummaryretention_analysisdetailed_descriptionoverall_soundscapenon_diegetic_music

系统首先定义参考素材的含义,然后总结任务,解释每个参考素材如何被保留或转移,最后按播放顺序编写目标视频。

在编写正式提示词之前,一个有用的规划层是:

来源保留转移忽略
图像 1面部、头发背景
视频 1行走、镜头演员身份
音频 1音色表达方式原始对话

这会将“使用所有这些参考素材”之类的模糊请求转化为明确的源到目标关系。

对话、声音、音效和音乐

说话角色使用稳定的 ID,例如 (S1)(S2),而对话则放置在 <d>[语言] ...</d> 内部。MiniMax 还区分屏幕内对话和屏幕外画外音,并建议当屏幕内角色仅进行旁白时,明确保持其嘴唇闭合。

环境音效和物理效果属于音景,而 non_diegetic_music 则保留给观众而非角色听到的音乐。如果您想要脚步声、雨声和物体声音但没有配乐,请保留音景并将 non_diegetic_music 设置为 N/A

自然语言提示词与官方结构化提示词

简短的自然语言指令在托管 H3 系统中仍然有效,因为 MiniMax 使用 H3-Context-IR,这是一个预处理层,它在为 H3-Base 生成结构化表示之前,解释文本、图像、视频和音频之间的关系。开放模型卡将指令解析、跨模态关联、时间理解和逻辑推理描述为该过程的一部分。

这解释了一个明显的矛盾:简单提示词适用于直接的托管生成,而结构化提示词对于精确的多参考、对话、时间控制和可重复制作任务则更有价值。

为什么 MiniMax H3 会忽略提示词,以及最佳测试工作流是什么?

当生成失败时,一次性重写所有内容会使问题原因更难识别。

常见的 H3 提示词问题和修复方法

问题可能原因首先测试什么
说话人错误说话人映射不明确锁定 (S1)/(S2)
角色变化身份信号冲突简化参考素材
参考素材被忽略角色模糊分配一个任务
随机剪辑镜头指令过多使用镜头运动
时间戳被忽略用作动作时间保留给剪辑
FL2VA 跳跃缺少过渡路径描述中间变化
结局不符收敛性差锁定最终构图
不想要的音乐音频层混淆明确设置音乐
文本变化措辞未保留引用确切可见文本
视频感觉仓促事件过多减少事件点

一个有用的原则是,当两种模式都能解决同一任务时,进行对照比较,而不是假设更复杂的模式总能生成更好的片段。

实用的 H3 分步测试工作流

首先定义生成的验收标准:也许角色身份最重要,或者产品标签、终点过渡、对话归属或镜头运动不可妥协。

然后分层测试:首先确立角色和场景;接着添加运动和镜头;视觉行为稳定后再添加声音;只有在简单版本奏效后才引入额外剪辑、故事板或更多角色。高分辨率重新生成应在语义结果正确之后进行,因为高分辨率无法解决矛盾的参考关系。

这种分阶段方法在可扩展视频管线中特别有用。对于将可重复知识或业务内容转化为视频的工作流,包括 Leadde文档转视频培训工具,分离内容结构、视觉行为、AI旁白和最终渲染,可以更容易地隔离修订,而不是每次都重建整个制作。

保存成功的镜头,而非重新生成所有内容

对于较长的项目,将每个成功的片段视为经过验证的制作资产。如果镜头 1 和镜头 2 成功,但镜头 3 失败,请重新生成失败的部分,而不是丢弃上游所有内容。

社区 H3 工作流已经为此目的使用检查点镜头:一旦成功的部分被保存,下游实验就可以重新运行,而无需重复支付重新创建早期素材的计算和创意成本。

这引出了一个更广泛的制作原则:

生成 → 验证 → 保存 → 继续。

对于 AI 视频,提示工程最终会演变为工作流工程

结论

MiniMax H3 提示词在任务结构清晰而非仅仅用更多词语描述时效果最佳。选择最适合镜头的简单模式,描述可观察的变化,将固定属性与可变属性分离,为每个参考素材分配特定角色,并逐层调试。对于高级 Ref2VA 工作流,真正的优势在于明确角色、运动、镜头、音频和关键帧之间的关系,然后将成功的生成转化为下一个镜头的可复用构建块。

88 种语言和 175 种方言

准备好试用 Leadde 了吗?

立即免费试用,几分钟内生成高质量 AI 视频。
免费开始