MiniMax H3プロンプトガイド:ビデオ、Ref2VA、カメラ、オーディオ、参照プロンプトの効果的な作成術

強力なMiniMax H3プロンプトは、単なる視覚スタイルを超えた定義をする必要があります。時間の経過、カメラの動き、一貫性を保つべき詳細、各参照の貢献、そして対話、サウンド、音楽がシーケンスにどのように組み込まれるかを明確に説明する必要があります。より高い制御性を実現するには、適切なH3モードを選択し、観察可能な変化を記述し、各参照に明確な役割を与えることが鍵となります。
このガイドでは、T2VA、I2VA、FL2VA、L2VA、Ref2VA、カメラ制御、オーディオ、キャラクターの一貫性、および実践的なトラブルシューティングについて解説します。これらの原則は、Leaddeのような構造化されたAI動画ワークフローにも適用可能です。Leaddeでは、ナレーション、アバター、多言語出力を活用し、ドキュメント、トレーニング資料、製品情報からスケーラブルな動画を生成します。
MiniMax H3プロンプトガイド:最適なプロンプト構造とは?
MiniMax H3プロンプトを考える上で最も効果的な方法は、視聴覚制作のブリーフと捉えることです。「シネマティック」「リアル」「ドラマチック」といった言葉を並べるのではなく、クリップが展開するにつれて視聴者が実際に何を見て、何を聞くのかを具体的に記述することで、リアルなAI動画の作り方を理解できます。
シンプルなH3プロンプトの公式
日常的なプロンプト作成には、以下から始めましょう。
被写体 + 動作 + 環境 + カメラ + タイミング + オーディオ
例えば、「雨の駅にいる女性」という記述はシーンを設定しますが、時間的な情報はあまり提供しません。より強力なプロンプトは、彼女がプラットフォームに向かって歩き、接近する電車の音を聞いて立ち止まり、音の方向を向き、ゆっくりと追跡するカメラが続く、といった具体的な動きを説明します。
MiniMaxの公式Base Prompt Guideでは、このアイデアをintegrated_multimodal_description、overall_soundscape、non_diegetic_musicの3つのフィールドで体系化しています。最初のフィールドは視覚的なタイムライン、アクション、ショット、話者、対話、同期されたシーンオーディオを担い、残りの2つは環境音や物理的な音と、視聴者のみが聞くBGMを区別します。
形容詞だけでなく、観察可能な結果を記述する
抽象的な意図を、目に見える行動に変換することが有効な原則です。
**「彼女は自信があるように見える」**と記述する代わりに、彼女がしっかりとした足取りで歩き、アイコンタクトを保ち、ジャケットを整え、ためらうことなく立ち止まる様子を説明しましょう。
このアプローチは制約にも役立ちます。**「ズームインしない」と繰り返す代わりに、意図する結果を「被写体は最初から最後までフレーム内でほぼ同じサイズを保つ」**と記述しましょう。あるコミュニティのH3一貫性テストでは、否定的なカメラ指示を繰り返すよりも、測定可能なフレーミング制約の方が特定のワークフローで効果的であったと報告されています。これはあくまで経験的なワークフロー観察であり、MiniMaxの公式保証ではありません。
どのMiniMax H3モードを使用すべきか?
適切なモードを選択することは、プロンプトを書き直すことと同じくらい重要です。MiniMaxのBaseワークフローは、テキストのみの生成に加え、ファーストフレーム、ラストフレーム、ファースト&ラストフレームのタスクをサポートし、独立したRef2VAチェックポイントはマルチモーダルな参照生成を処理します。
| モード | 入力 | 最適なプロンプトの目的 |
| T2VA | テキスト | 視聴覚シーン全体を構築する |
| I2VA | 最初のフレーム | 開始を維持し、前方へ展開する |
| FL2VA | 最初 + 最後のフレーム | 終点間の遷移を記述する |
| L2VA | 最後のフレーム | 提供された結末に向かって構築する |
| Ref2VA | 画像/動画/音声 | 異なる参照の役割を組み合わせる |
T2VA、I2VA、FL2VA、L2VA
T2VAは、シーンをゼロから構築する必要があります。I2VAは、提供された画像を実際の最初のフレームとして扱うため、プロンプトは動きを導入する前に、アイデンティティ、服装、オブジェクト、色、構図を維持する必要があります。
FL2VAでは、プロンプトは単に画像1と画像2を記述するだけではいけません。MiniMaxは、被写体がどのように動き、ポーズがどのように変化し、オブジェクトがどのように操作され、構図やライティングが最終フレームにどのように収束するかなど、両者間の観察可能な経路を記述することを特に推奨しています。L2VAは、もっともらしい初期状態から始め、提供された最終フレームに徐々に到達させることで、推論プロセスを逆転させます。
Ref2VAはいつ使用すべきか?
Ref2VAは、異なるアセットが異なる役割を果たす場合に使用します。例えば、ある画像がキャラクターを定義し、別の画像が服装を定義し、動画が歩行動作とカメラのリズムを提供し、音声が声の参照を提供するようなケースです。
これは関係性主導の生成として理解すると良いでしょう。モデルは、各ファイルに何が含まれているかだけでなく、各ソースからの情報が最終動画にどのように影響すべきかを理解する必要があります。MiniMaxのフルリファレンス形式は、再利用可能な被写体、具体的な画像アンカー、動画レベルの時間的ソース、および音声参照を明確に区別します。
ショットを解決できる最もシンプルなモードを使用する
実践的な制作ルールとして、ショットが必要としない限り、参照の複雑さを追加しないことです。
遷移が正確な開始と終了のみを必要とする場合、FL2VAはそのタスクに直接的な定義を与えます。画像1からのアイデンティティ + 動画1からの動き + 音声1からの声といった関係性が本当に必要な場合にRef2VAに移行しましょう。
これにより、デバッグも容易になります。競合する独立した制約が少ないほど、問題が動き、アイデンティティ、フレーミング、オーディオのいずれに起因するのかを特定しやすくなります。

ショット、カメラの動き、タイミング、トランジションを制御する方法
H3プロンプトは、タイムラインを段落としてではなく、編集として扱うことで制御しやすくなります。
ショットカット、タイムスタンプ、時間的予算
MiniMaxの公式フォーマットでは、[Shot 1]にタイムスタンプは付けません。後続のショットは、[Shot 2] At 00:03.500のように、カット時間を増やして開始します。新しいショットは、異なる視点、場所、状態、被写体、時間など、意味のある新しい情報を導入すべきです。小さな距離や角度の変化は、別のカットとしてではなく、カメラの動きとして表現する方が通常は適切です。
これにより、実践的な時間的予算が生まれます。8秒のクリップでは、3つのアクション、2つのカメラ移動、1つのリアクション、1つの発話、2つのカットがすべて同じ限られた時間内で競合します。生成が急ぎすぎると感じられる場合、より多くの記述的な言語を追加するよりも、イベントを削除する方が効果的なことがよくあります。
H3が従うべきカメラ言語
MiniMaxは、プッシュ/プル、パン、トラック、ティルト、ペデスタル、アーク、トラッキング、静止ショット、POV、ロール、カメラシェイクなど、様々なカメラ操作を文書化しています。推奨されるロジックは基本的に以下の通りです。
動きの種類 + オプションの振幅 + オプションの速度
したがって、「ダイナミックなシネマティックカメラ」と書く代わりに、**「カメラは製品を中心に保ちながらゆっくりと右にトラックする」**のように、実行可能な内容を記述しましょう。
固定すべきものと変更可能なものを区別する
生成を開始する前に、シンプルな固定要素と可変要素のマップを頭の中で作成しましょう。
製品動画では、カメラ位置、反射、水の動き、ライティングが変化する間も、ボトルの形状、ラベルのテキスト、キャップ、色を固定する必要があるかもしれません。キャラクターのシーケンスでは、顔、髪型、服装を固定しつつ、ポーズや表情の変化を許容する場合があります。
これにより、プロンプトがすべての視覚的プロパティを一度に変更するよう求めることがなくなるため、矛盾する指示が減少します。

キャラクターや製品の一貫性を損なわずに参照を使用する方法
最も強力な参照ワークフローでは、すべてのアセットに特定の目的が割り当てられます。
各参照に明確な役割を一つ与える
実践的なマッピングは以下のようになるでしょう。
画像1 → キャラクターのアイデンティティ 画像2 → 服装 画像3 → 製品デザイン 動画1 → 歩行動作とカメラパス 音声1 → 声の音色
MiniMaxの公式Ref2VAフォーマットは、まさにこのようなクロスソース定義をサポートしています。つまり、ある被写体は画像から外観を、動画から動きを得ることができ、また単一の参照ファイルが複数の再利用可能な被写体を提供することも可能です。
重要なのは、意図しない転送を避けることです。動画1が動きのみを提供し、その俳優や環境は提供しない場合、その関係性設計で明示的に指定しましょう。
被写体、画像、絵コンテ、参照動画
公式用語では、<Subject N>は再利用可能な視覚コンテンツを表し、<Picture N>は画像自体が具体的なフレーム、構図のアンカー、または動画スクリプトや絵コンテの参照として機能する場合に使用されます。<Video N>は、編集、継続、カメラの動き、カット、リズム、時間構造など、動画全体の関係性を表します。<Audio N>は、音声のコピーや、声の音色、話し方、リズム、音楽スタイルなどの特性を扱います。
この区別により、よくある概念的な誤りを防ぐことができます。それは、キャラクター参照が自動的にキーフレームになるわけではなく、絵コンテが自動的に正確な終点になるわけではないということです。
参照の効率性とショットレベルの一貫性
参照資料が多いからといって、自動的に情報量が増えるわけではありません。制作ワークフローでは、必要な動き、カメラパス、または声の質を明確に示す部分に参照動画をトリミングしましょう。
また、フレーム1だけでなく、ショット全体を通してアイデンティティを評価しましょう。あるコミュニティテストでは、特定のユーザーのローカル設定において、クローズアップの方が顔が小さくフレーミングされた場合よりも、アイデンティティのずれがかなり早く発生することが判明しました。正確なタイミングは一般化すべきではありませんが、ワークフローの教訓は有用です。それは、重要な各ショットの複数のポイントで、顔のアイデンティティ、服装、小道具を確認することです。
高度なRef2VA、対話、オーディオプロンプトはどのように機能するか?
Ref2VAは、H3プロンプトが従来のテキストから動画へのプロンプト作成というよりも、マルチモーダルな制作計画に近くなる領域です。
6つのパートからなるRef2VAプロンプト構造
MiniMaxのフルリファレンスガイドでは、6つのセクションを定義しています。
subject_definitions → summary → retention_analysis → detailed_description → overall_soundscape → non_diegetic_music.
システムはまず参照の意味を定義し、次にタスクを要約し、各参照がどのように保持または転送されるかを説明し、最後にターゲット動画を再生順に記述します。
正式なプロンプトを作成する前の有用な計画レイヤーは以下の通りです。
| ソース | 維持 | 転送 | 無視 |
| 画像1 | 顔、髪 | — | 背景 |
| 動画1 | — | 歩行、カメラ | 俳優のアイデンティティ |
| 音声1 | 声の音色 | 話し方 | 元の対話 |
これにより、「これらの参照をすべて使用する」といった曖昧な要求が、明確なソースとターゲットの関係性へと変わります。
対話、声、効果音、音楽
話すキャラクターは(S1)や(S2)のような安定したIDを使用し、対話は<d>[Language] ...</d>の中に配置されます。MiniMaxはまた、画面上の対話と画面外のナレーションを区別し、画面上のキャラクターがナレーションのみを行う場合は、そのキャラクターの唇を閉じたままにするよう明示的に推奨しています。
環境音や物理的な効果音はサウンドスケープに属し、non_diegetic_musicはキャラクターではなく視聴者が聞く音楽のために予約されています。足音、雨音、物音は欲しいがBGMは不要な場合、サウンドスケープを維持し、non_diegetic_music: N/Aと設定しましょう。
自然言語プロンプト vs 公式構造化プロンプト
ホスト型H3システムでは、短い自然言語の指示でも機能します。これは、MiniMaxがH3-Context-IRという前処理レイヤーを使用しているためです。このレイヤーは、H3-Base用の構造化された表現を生成する前に、テキスト、画像、動画、音声間の関係性を解釈します。公開されているモデルカードでは、そのプロセスの一部として、指示の解析、クロスモーダルな関連付け、時間的理解、論理的推論が記述されています。
これにより、一見矛盾する点が説明されます。シンプルなプロンプトは、簡単なホスト型生成に適している一方で、構造化されたプロンプトは、正確な複数参照、対話、タイミング、および反復可能な制作タスクにおいてより価値を発揮します。
MiniMax H3がプロンプトを無視する理由と、最適なテストワークフローとは?
生成が失敗した場合、すべてを一度に書き直すと原因の特定が難しくなります。
よくあるH3プロンプトの問題と解決策
| 問題 | 考えられる原因 | 最初に試すべきこと |
| 違う人物が話す | 話者のマッピングが不明確 | (S1)/(S2)を固定する |
| キャラクターが変わる | アイデンティティの信号が競合 | 参照を簡素化する |
| 参照が無視される | 役割が曖昧 | 役割を一つに絞る |
| ランダムなカット | ショット指示が多すぎる | カメラの動きを使用する |
| タイムスタンプが無視される | アクションのタイミングとして使用 | カットのために予約する |
| FL2VAが飛ぶ | 遷移パスが欠落 | 中間変化を記述する |
| 結末がずれる | 収束が弱い | 最終構図を固定する |
| 不要な音楽 | オーディオレイヤーが混在 | 音楽を明示的に設定する |
| テキストが変わる | 文言が維持されない | 正確な表示テキストを引用する |
| 動画が急ぎすぎに感じる | イベントが多すぎる | ビートを減らす |
有用な原則は、2つのモードが同じタスクを解決できる場合、より複雑なモードが常に優れたクリップを生成すると仮定するのではなく、制御された比較を行うことです。
実践的なH3テストワークフロー(ステップバイステップ)
まず、生成の受け入れ基準を定義することから始めましょう。キャラクターのアイデンティティが最も重要かもしれませんし、製品ラベル、終点遷移、対話の所有権、カメラの動きが譲れない点かもしれません。
次に、レイヤーごとにテストします。まずキャラクターとシーンを確立し、次に動きとカメラを追加し、視覚的な挙動が安定してから声とサウンドを追加します。よりシンプルなバージョンが機能するようになった後で初めて、追加のカット、絵コンテ、または追加のキャラクターを導入します。高解像度での再生成は、意味的な結果が正しい後に行うべきです。なぜなら、高解像度では矛盾する参照関係を解決できないからです。
この段階的なアプローチは、スケーラブルな動画パイプラインで特に有用です。Leaddeのようなドキュメントから動画へのトレーニングツールを含む、反復可能な知識やビジネスコンテンツを動画に変換するワークフローでは、コンテンツ構造、視覚的挙動、AIナレーション、最終レンダリングを分離することで、毎回プロダクション全体を再構築するのではなく、修正点をより簡単に特定できるようになります。
すべてを再生成するのではなく、成功したショットを保存する
長期プロジェクトでは、成功した各クリップを検証済みの制作アセットとして扱いましょう。ショット1とショット2が機能し、ショット3が失敗した場合、上流のすべてを破棄するのではなく、失敗したセクションのみを再生成します。
コミュニティのH3ワークフローでは、この理由からチェックポイントされたショットがすでに使用されています。成功したセクションが保存されれば、以前の素材を再作成するための計算コストやクリエイティブコストを繰り返し支払うことなく、下流の実験を再実行できます。
これは、より広範な制作原則につながります。
生成 → 検証 → 保存 → 続行。
AI動画において、プロンプトエンジニアリングは最終的にワークフローエンジニアリングへと進化します。
まとめ
MiniMax H3プロンプトは、タスクが単に多くの言葉で記述されるよりも、明確に構造化されている場合に最も効果を発揮します。ショットに合った最もシンプルなモードを選択し、観察可能な変化を記述し、固定属性と可変属性を分離し、各参照に特定の役割を割り当て、一度に1つのレイヤーをデバッグしましょう。高度なRef2VAワークフローでは、キャラクター、動き、カメラ、オーディオ、キーフレーム間の関係性を明確にし、成功した生成物を次のショットのための再利用可能な構成要素に変えることで、真の利点が得られます。








