如何使用 MiniMax H3:提示词、参考图、音频和 ComfyUI 全面指南

充分利用 MiniMax H3 的关键在于先选择合适的生成模式,再确定哪些元素由文本、帧、参考素材、运动和音频控制。您可以通过文本生成,锁定首帧或尾帧,或利用图像、视频和音频来引导身份、动作、镜头行为和声音。
H3 融合了多模态参考素材与原生视听生成能力,因此清晰的控制指令往往比冗长的提示词更能带来优质结果。本指南将详细阐述如何选择正确的工作流程、撰写更优的提示词、有效利用参考素材、管理对话与音效、高效测试,以及如何与 ComfyUI 或 API 协同工作。
如果您的起点是 PDF、演示文稿、SOP 或培训文档,而非创意提示词,那么 Leadde 可能是更优选择,它能将结构化内容转化为视频工作流,无需在 H3 中手动指导每个场景。
如何使用 MiniMax H3:从哪个工作流开始?
快速上手 MiniMax H3 的秘诀是:在撰写提示词之前,先选择生成模式。H3 支持文本、首/尾帧输入以及多模态参考素材,但每种输入都扮演着不同角色。MiniMax 官方模型卡将开放权重检查点分为 FL2VA(用于文本和帧生成)和 Ref2VA(用于图像、视频或音频驱动的参考生成)。
| 模式 | 最佳应用场景 | 视频控制要素 |
| T2VA | 从零开始创建场景 | 文本提示词 |
| I2VA | 从精确图像开始 | 首帧 + 提示词 |
| L2VA | 达到特定结局 | 尾帧 + 提示词 |
| FL2VA | 同时控制开始和结束 | 首帧 + 尾帧 |
| Ref2VA | 保留身份、动作、镜头、风格或声音 | 多模态参考素材 + 提示词 |
您的图像是“帧”还是“参考素材”?
区分二者能解决许多控制难题。
帧是时间锚点。如果上传的产品图像必须是观众看到的第一张图像,请将其用作首帧。
参考素材是可复用信息。如果您只需要在创建新构图时保持产品设计、角色面部、服装或视觉风格一致,则应将其视为参考素材。
MiniMax 官方提示词指南明确了这一区别:I2VA 从 0.00 秒处提供的图像开始,而全参考模式则根据每个素材扮演的角色,分别跟踪主体、图片、视频和音频。
H3 控制堆栈
在撰写提示词之前,请先确定视频的六个关键要素由什么控制:身份、时间线、动作、镜头、音频和结局。
例如,一段商业视频可以利用参考图像来定义产品身份,用文本描述产品动作,用参考视频控制镜头运动,用原生音频指令进行声音设计,并用尾帧来呈现最终的特写镜头。
这能有效避免一个常见错误:试图用一个冗长的文本提示词控制所有内容。

如何撰写能提供更多控制力的 MiniMax H3 提示词?
一个有效的 H3 提示词应按播放顺序描述视频内容。像导演一样,描述实际可见和可听的内容,而非像文案撰稿人那样堆砌形容词,这与撰写高效视频脚本的最佳实践异曲同工。
一个实用的结构是:
场景 → 主体 → 动作 → 镜头 → 对话/音效 → 结局
MiniMax 官方基础提示词格式也遵循相同的底层逻辑。其 integrated_multimodal_description 按顺序描述镜头,而 overall_soundscape 和 non_diegetic_music 则分别控制物理音效和背景音乐。
按播放顺序构建场景
避免使用:
一段具有戏剧性动感的电影级高端护肤品广告。
采用可观察的序列描述:
一个玻璃精华瓶立于深色石质基座上。一道窄光扫过标签。瓶身缓慢顺时针旋转,同时镜头逐渐推近。凝结的水珠在光线下闪烁。瓶身停止转动,标志正对镜头。
第二个版本为 H3 提供了可见的状态变化以供执行。
此外,请考虑复杂性预算。一段包含三个角色、四次剪辑、一次变形、两句对话、移动镜头和多个参考素材的 10 秒片段,尽管在技术上可描述,但这并不意味着所有这些事件都能自然地融入 10 秒内。
有意图地指导镜头运动和剪辑
仅当镜头行为有助于画面时才进行明确指示:推近、拉远、摇摄、跟踪、倾斜、弧形运动或保持静止。
避免将每次构图调整都变成一次新的剪辑。从中景到特写的缓慢变化通常可描述为镜头运动,而非新场景。
定义结局,而非仅仅是动作
当提示词明确动作的终点时,视频控制将变得更加容易。
不要以“角色走向窗户”结束,而是定义最终状态:角色停在窗边,转向镜头,并以天际线为背景保持构图。
这对于产品演示视频、标志特写、转场以及首/尾帧工作流尤为重要。
如何在 MiniMax H3 中使用图像、视频、故事板和语音参考素材?
参考视频功能让 H3 不再仅仅是一个传统的图像转视频工具。官方 Ref2VA 模型接受多模态参考素材,并能利用它们影响身份、动作、镜头行为、风格和音频。MiniMax 目前支持最多九张图像、三个参考视频、三个音频片段以及总共 12 个混合文件。
为每个参考素材分配一个明确任务
一个强大的参考设置可能分配如下:图像 1 → 角色身份;图像 2 → 服装;视频 1 → 身体动作;视频 2 → 镜头运动;音频 1 → 声音。
ComfyUI 的官方 H3 文档也推荐相同原则:按连接顺序引用每个输入,并明确说明哪个素材控制身份、风格、动作、镜头或声音。
更多的参考素材并不意味着自动获得更多控制力。它们会为 H3 带来更多需要解决的关系。如果两张图像暗示不同的服装,而参考视频又包含另一个角色外观,那么除非提示词明确了这些职责,否则模型必须自行决定哪个信号最重要。
<Subject> 与 <Picture>
在 MiniMax 的全参考格式中,<Subject N> 代表可复用的可见内容,例如从参考素材中抽象出的人物、物体、环境或其他元素。<Picture N> 代表用作帧或构图锚点的具体图像。<Video N> 和 <Audio N> 则用于跟踪时间或音频参考。
这意味着一个主体不一定对应一个文件。一个角色可以结合来自一张图像的面部身份信息,以及来自另一个来源的服装或动作信息。
何时应使用故事板?
当空间关系难以通过文字描述,而更适合视觉呈现时,故事板便可作为视觉规划层。这对于多镜头序列、产品展示、角色走位或重复构图尤为有用。
从 AI 视频工作流的角度来看,故事板的优势并非在于它能保证每个帧的精确性。而是它能减少仅通过文字传达空间和镜头规划信息的负担。

如何在 MiniMax H3 中控制对话、音效和音乐?
H3 能与视频同步生成原生立体声音频,而非将音频视为独立的后期制作层。MiniMax 文档指出支持 32 kHz 立体声输出,其提示词系统将对话、物理音效和非叙事音乐作为独立概念进行支持。
将对话作为镜头的一部分来撰写
对话应回答四个问题:谁在说话、说了什么、何时说话以及有多少出镜时间。
MiniMax 的结构化格式可以使用持久性说话者 ID(如 (S1))和对话标签(如 <d>[English]...</d>)。然而,初学者无需从语法入手。更重要的原则是时机把握。
运用对话预算
对话会消耗实际时间。
如果说话者出镜四秒,请避免撰写一句实际需要八秒才能说完的台词。否则,模型将不得不压缩、赶速、截断或扭曲语音。
这在实践中很重要,因为本地 H3 用户已经在视觉提示的同时迭代镜头时序和对话,而不是将语音视为一个独立的层。一项报告的 RTX 5080 测试使用了结构化的多镜头提示词,并需要反复调整提示词,而生成本身仍然计算成本高昂。
将声景与背景音乐分离
将声景用于场景中实际存在的音效:脚步声、引擎声、风声、开门声、人群声、织物摩擦声或机械声。
将非叙事音乐用于观众能听到但角色听不到的音乐。
将两者分离能为 H3 提供比“添加电影音效”等模糊指令更有用的指导。MiniMax 的官方提示词格式特意将这两个音频层分开。
哪些设置和测试工作流能带来更好的 MiniMax H3 结果?
MiniMax 文档指出,H3 输出时长为 4-15 秒,帧率为 24 FPS,支持多种宽高比,开放的 H3-Base 工作流默认短边为 768 像素。其完整系统可通过 H3-Regenerate-2K 生成 2K 视频。
根据镜头选择时长、宽高比和分辨率
不要自动选择最长时长。根据有意义事件的数量来匹配时长。
大多数横向内容使用 16:9,竖屏社交视频使用 9:16,当方形构图适合分发渠道时使用 1:1。在 ComfyUI 中,官方 H3 工作流通过分辨率选择器提供宽高比和像素控制,更高的像素数量会增加生成成本。
使用预览保真度阶梯
低成本预览很有用,但仅限于解决正确的问题。
早期测试适用于检查构图、主要动作、镜头方向、剪辑和大致时序。但对于评估小文本、远距离面部、标志或精细产品细节则可靠性较低。
因此,目标并非简单地“始终先生成低分辨率版本”。而是利用成本较低的生成进行结构性决策,然后将计算资源投入到只有在高保真度下才可见的细节上。
一次测试一个变量
一个实用的制作顺序是:首先验证场景,然后是动作和镜头,接着是对话/音频,再是额外的参考素材或剪辑,最后进行高质量生成。
这很重要,因为 AI 视频的实际成本通常是生成成本 × 迭代次数。在一项社区测试中,一个 RTX 5080 系统在大约 11 分钟内生成了一个 15 秒、0.4MP、10 步的 H3 视频,并且随着视频长度增加,每步耗时显著上升。该用户还报告需要采取变通方法来避免内存不足的故障。请将此视为一个真实的案例,而非普遍基准。

如何在 ComfyUI、API 工作流中使用 MiniMax H3 并解决常见问题?
ComfyUI 目前提供官方 H3 模板,支持文本转视频、图像转视频和参考转视频。其原生节点使用 FL2VA 系列处理文本/帧工作流,并使用 Ref2VA 处理多模态参考素材。
MiniMax API 采用不同路径:H3 任务是异步的。您提交生成、Context-IR 或再生任务后,会收到一个 task_id,然后通过该 ID 查询任务结果。成功的生成任务会通过 content.url 返回视频,而 Context-IR 则通过 content.prompt 返回增强型提示词。
完整的 H3 系统不应与开放的 H3-Base 权重混淆。MiniMax 描述了三个模块:H3-Context-IR → H3-Base → H3-Regenerate-2K。本地 H3-Base 验证 768p 生成,而完整的 2K 工作流则将原始上下文与 768p 结果结合进行再生。
从三个层面诊断故障
在重写提示词之前,请先确定故障层面。
| 层面 | 典型问题 | 应对措施 |
| 提示词 | 动作、时序、镜头或结局错误 | 重写时间线 |
| 参考素材 | 身份、服装、动作或声音漂移 | 明确或减少参考素材职责 |
| 渲染 | 小文本、远距离面部、精细细节 | 测试更高保真度的输出/设置 |
这是一个有用的区分,因为并非所有视觉缺陷都源于提示词问题。
MiniMax H3 常见问题及实用解决方案
如果身份漂移,请简化冲突的参考素材,并明确定义哪个来源控制身份。如果产品或标志发生变化,请明确区分必须保留的属性与模型可能重新设计的元素。
如果视频感觉仓促,请减少动作、剪辑或对话,而非增加更多提示词细节。如果语音听起来被压缩,请缩短对话或给予说话者更多时间。
对于首/尾帧扭曲问题,请描述中间的物理过渡,而非仅指定两个端点。如果 R2V 参考素材影响甚微,请明确说明其确切作用,而非仅仅附加它。
本地用户也应谨慎对待性能调优。ComfyUI 官方文档记载了可选的 Sage Attention,并表示其示例工作流可在质量损失最小的情况下将生成速度提高约一倍,但其他缓存、量化和实验性优化技术可能会涉及不同的权衡。
总结
将视频生成视为生产工作流而非提示词长度竞赛时,MiniMax H3 将更容易控制。选择正确的模式,为每个参考素材分配特定职责,在可用时间内预算动作和对话,在最终质量渲染前测试结构性决策,并诊断提示词、参考素材或渲染问题导致的故障。这种方法适用于从简单的文本转视频片段到复杂的多模态设置,正体现了当今人们如何快速制作 AI 视频的趋势。








