Leadde Logo

MiniMax H3 提示指南:如何撰寫更優質的影片、Ref2VA、鏡頭、音訊和參考提示

Leadde Team·更新於 2026年8月16日·8 分鐘閱讀
MiniMax H3 提示指南:如何撰寫更優質的影片、Ref2VA、鏡頭、音訊和參考提示
輕鬆打造 AI 影片,搭配 300 多種虛擬人像,支援 175 種以上語言。

強大的 MiniMax H3 提示詞 不應只定義視覺風格。它應闡明時間軸上的事件發展、鏡頭運動方式、哪些細節必須保持一致、每個參考資料的作用,以及對話、音效和音樂如何融入序列。為了更好的控制,關鍵在於選擇正確的 H3 模式、描述可觀察的變化,並為每個參考資料賦予明確的角色

本指南涵蓋 T2VA、I2VA、FL2VA、L2VA、Ref2VA、鏡頭控制、音訊、角色一致性及實用故障排除。這些原則也適用於結構化的 AI 影片工作流程,例如 Leadde,它能將文件、培訓材料和產品資訊轉化為可擴展的影片,並配有旁白、虛擬人像和多語言輸出

Leadde AI.webp

MiniMax H3 提示詞指南:最佳提示詞結構為何?

將 MiniMax H3 提示詞視為視聽製作簡報,是最有效的方式。與其堆疊「電影感」、「寫實」和「戲劇性」等詞彙,不如描述影片發展過程中觀眾實際能看到和聽到的內容,以了解如何製作逼真的 AI 影片

簡單的 H3 提示詞公式

日常提示詞撰寫,請從以下公式開始:

主體 + 動作 + 環境 + 鏡頭 + 時間 + 音訊

例如,「一個女人在下雨的火車站」雖然建立了場景,但缺乏時間資訊。更強大的提示詞會說明她走向月台,聽到火車駛近時停下,轉向聲音來源,並由緩慢的跟蹤鏡頭跟隨。

MiniMax 官方的基礎提示詞指南將此概念形式化為三個欄位:integrated_multimodal_descriptionoverall_soundscapenon_diegetic_music。第一個欄位承載視覺時間軸、動作、鏡頭、說話者、對話和同步場景音訊;另外兩個則將環境/物理音效與僅供觀眾聆聽的背景音樂區分開來。

撰寫可觀察的結果,而非僅是形容詞

一個實用的原則是將抽象意圖轉化為可見的行為。

與其說「她看起來很自信」,不如描述她穩步前行、保持眼神交流、整理夾克,並毫不猶豫地停下。

同樣的方法也適用於限制條件。與其重複「不要拉近鏡頭」,不如描述預期結果:「主體在畫面中從頭到尾保持大致相同的大小」。一項社群 H3 一致性測試報告指出,在特定工作流程中,可衡量的構圖限制比重複給出負面鏡頭指令效果更好。這是一個經驗性的工作流程觀察,並非 MiniMax 的官方保證。

應使用哪種 MiniMax H3 模式?

選擇正確的模式與重寫提示詞同樣重要。MiniMax 的基礎工作流程支援純文字生成,以及首幀、末幀和首尾幀任務,而其獨立的 Ref2VA 檢查點則處理多模態參考生成。

模式輸入最佳提示詞目標
T2VA文字建構完整的視聽場景
I2VA首幀保留開頭並向前發展
FL2VA首幀 + 末幀描述端點之間的過渡
L2VA末幀朝向提供的結尾建構
Ref2VA圖像/影片/音訊結合不同的參考角色

T2VA、I2VA、FL2VA 和 L2VA

T2VA 必須從零開始建立場景。I2VA 將提供的圖片視為實際的第一幀,因此提示詞應在引入動作之前,保留身份、服裝、物體、顏色和構圖。

使用 FL2VA 時,提示詞不應僅描述圖片 1 和圖片 2。MiniMax 特別建議描述兩者之間可觀察的路徑:主體如何移動、姿勢如何變化、物體如何被操作,以及構圖或光線如何匯聚到最終幀。L2VA 則反轉推理過程,從一個合理的早期狀態開始,逐步達到提供的最終幀。

何時應使用 Ref2VA?

當不同的資產執行不同的任務時,請使用 Ref2VA——例如,一張圖像定義角色,另一張定義服裝,一段影片提供步行動作和鏡頭節奏,而音訊則提供語音參考。

這最好理解為關係導向的生成。模型不僅需要知道每個檔案包含什麼,還需要了解每個來源的資訊應如何影響最終影片。MiniMax 的完整參考格式明確區分了可重複使用的主體、具體的圖片錨點、影片級別的時間來源和音訊參考。

使用能解決鏡頭問題的最簡單模式

一個實用的製作規則是:除非鏡頭需要,否則不要增加參考複雜性

如果一個轉場只需要精確的開頭和結尾,FL2VA 就能直接定義該任務。當您確實需要諸如「圖像 1 的身份 + 影片 1 的動作 + 音訊 1 的聲音」等關係時,再轉向 Ref2VA。

這也讓除錯變得更容易。當相互競爭的獨立限制較少時,更容易識別問題是來自動作、身份、構圖還是音訊。

image.png

如何控制鏡頭、鏡頭運動、時間和轉場?

當時間軸被視為剪輯而非段落時,H3 提示詞會更容易控制。

鏡頭剪輯、時間戳和時間預算

MiniMax 的官方格式會為 [Shot 1] 添加時間戳。後續鏡頭則以遞增的剪輯時間開始,例如 [Shot 2] At 00:03.500。新鏡頭應引入有意義的新資訊——例如不同的視角、地點、狀態、主體或時間。小幅的距離或角度變化通常最好以鏡頭運動而非另一次剪輯來表達。

這建立了一個實用的時間預算。在一個 8 秒的片段中,三個動作、兩次鏡頭移動、一個反應、一句對白和兩次剪輯都爭奪著相同的有限時長。當生成內容感覺倉促時,刪除事件通常比增加更多描述性語言更有效。

H3 可遵循的鏡頭語言

MiniMax 文件記載了鏡頭操作,包括推/拉、搖攝、軌道移動、俯仰、升降、弧形移動、跟蹤、靜態鏡頭、POV、滾動和鏡頭晃動。其推薦的邏輯本質上是:

運動類型 + 可選幅度 + 可選速度

因此,與其寫「動態電影鏡頭」,不如寫一些可執行的內容,例如「鏡頭緩慢向右移動,同時保持產品居中」。

區分必須固定與可以變化的元素

在生成之前,先在腦中建立一個簡單的固定與變數對照圖

一個產品影片可能要求瓶身形狀、標籤文字、瓶蓋和顏色保持固定,而鏡頭位置、反射、水流動和光線則可以變化。角色序列可能鎖定臉部、髮型和服裝,同時允許姿勢和表情演變。

這減少了矛盾的指令,因為提示詞不再要求所有視覺屬性同時改變。

image.png

如何在不失角色或產品一致性的情況下使用參考資料?

最強大的參考工作流程會為每個資產分配特定用途。

為每個參考資料賦予一個明確的任務

一個實用的映射可能是:

圖像 1 → 角色身份 圖像 2 → 服裝 圖像 3 → 產品設計 影片 1 → 步行動作和鏡頭路徑 音訊 1 → 聲音音色

MiniMax 的官方 Ref2VA 格式正是支援這種跨來源定義:一個主體可以從圖片中獲取外觀,從影片中獲取動作,而單一參考檔案也可以提供多個可重複使用的主體。

重要的是避免意外轉移。如果影片 1 應提供動作而非其演員或環境,請在關係設計中明確說明。

主體、圖片、分鏡腳本和參考影片

在官方術語中,<Subject N> 代表可重複使用的可見內容,而 <Picture N> 則用於圖像本身作為具體幀、構圖錨點或影片腳本和分鏡腳本參考時。<Video N> 代表整體影片關係,例如剪輯、連續性、鏡頭運動、剪切、節奏或時間結構。<Audio N> 處理音訊複製或語音音色、表達方式、節奏或音樂風格等特徵。

這種區分避免了一個常見的概念錯誤:角色參考不自動是關鍵幀,分鏡腳本也不自動是確切的終點

參考資料的經濟性與鏡頭層面的一致性

更多的參考資料不自動意味著更多的資訊。在製作工作流程中,請將參考影片修剪至能清楚展示您所需動作、鏡頭路徑或聲音品質的部分。

此外,應在整個鏡頭中評估身份,而不僅僅是第一幀。一項社群測試發現,在該用戶的特定本地設置下,特寫鏡頭中的身份漂移比小臉構圖中出現得更早。確切的時間不應一概而論,但工作流程的教訓很有用:在每個重要鏡頭的多個時間點檢查臉部身份、服裝和小道具

進階 Ref2VA、對話和音訊提示詞如何運作?

Ref2VA 是 H3 提示詞更像多模態製作規劃,而非傳統文字轉影片提示詞的地方。

Ref2VA 提示詞的六部分結構

MiniMax 的完整參考指南定義了六個部分:

subject_definitionssummaryretention_analysisdetailed_descriptionoverall_soundscapenon_diegetic_music

系統首先定義參考資料的含義,然後總結任務,解釋每個參考資料如何被保留或轉移,最後按播放順序撰寫目標影片。

在撰寫正式提示詞之前,一個有用的規劃層是:

來源保留轉移忽略
圖像 1臉部、頭髮背景
影片 1步行、鏡頭演員身份
音訊 1聲音音色表達方式原始對話

這將「使用所有這些參考資料」等模糊請求轉化為明確的來源到目標關係。

對話、語音、音效和音樂

說話角色使用穩定的 ID,例如 (S1)(S2),而對話則放置在 <d>[Language] ...</d> 內部。MiniMax 還區分了螢幕內對話和螢幕外旁白,並建議當螢幕內角色僅為旁白時,明確保持其嘴唇閉合。

環境音效和物理效果屬於聲景,而 non_diegetic_music 則保留給觀眾而非角色聽到的音樂。如果您想要腳步聲、雨聲和物體聲音但沒有配樂,請保留聲景並將 non_diegetic_music 設定為 N/A

自然語言提示詞與官方結構化提示詞

簡短的自然語言指令在託管的 H3 系統中仍然有效,因為 MiniMax 使用 H3-Context-IR,這是一個預處理層,它在為 H3-Base 生成結構化表示之前,解釋文字、圖像、影片和音訊之間的關係。開放模型卡將指令解析、跨模態關聯、時間理解和邏輯推理描述為該過程的一部分。

這解釋了一個明顯的矛盾:簡單的提示詞適用於直接的託管生成,而結構化提示詞對於精確的多參考、對話、時間和可重複的製作任務則更具價值。

為何 MiniMax H3 會忽略提示詞,以及最佳測試工作流程為何?

當生成失敗時,一次性重寫所有內容會使問題原因更難以識別。

常見 H3 提示詞問題與解決方案

問題可能原因首先測試的項目
錯誤的人說話說話者映射不明確鎖定 (S1)/(S2)
角色變化身份信號衝突簡化參考資料
參考資料被忽略角色不明確分配一個任務
隨機剪輯鏡頭指令過多使用鏡頭運動
時間戳被忽略用作動作時間保留用於剪輯
FL2VA 跳躍缺少過渡路徑描述中間變化
結尾失誤收斂性弱鎖定最終構圖
不想要的音樂音訊層混淆明確設定音樂
文字變化文字未保留引用確切可見文字
影片感覺倉促事件過多減少節奏點

一個有用的原則是,當兩種模式都能解決相同任務時,進行受控比較,而不是假設更複雜的模式總能產生更好的片段。

實用的 H3 逐步測試工作流程

首先定義生成的驗收標準:或許角色身份最重要,或許產品標籤、端點轉場、對話歸屬或鏡頭移動是不可協商的。

然後分層測試:首先建立角色和場景;接著添加動作和鏡頭;在視覺行為穩定後添加語音和音效;只有在較簡單的版本運作正常後,才引入額外的剪輯、分鏡腳本或額外角色。高解析度重新生成應在語義結果正確之後進行,因為更高的解析度無法解決矛盾的參考關係。

這種分階段的方法在可擴展的影片管道中特別有用。對於將可重複知識或商業內容轉化為影片的工作流程,包括像 Leadde 這樣的文件轉影片培訓工具,將內容結構、視覺行為、AI 旁白和最終渲染分開,可以更容易地隔離修改,而不是每次都重建整個製作。

保存成功的鏡頭,而非重新生成所有內容

對於較長的專案,將每個成功的片段視為經過驗證的製作資產。如果鏡頭 1 和鏡頭 2 成功,但鏡頭 3 失敗,請重新生成失敗的部分,而不是丟棄所有上游內容。

社群 H3 工作流程已經因此使用檢查點鏡頭:一旦成功的部分被保存,下游實驗就可以重新運行,而無需重複支付重新創建早期材料的計算和創意成本。

這引導出一個更廣泛的製作原則:

生成 → 驗證 → 保存 → 繼續。

對於 AI 影片,提示詞工程最終會演變為工作流程工程

結論

當任務結構清晰,而非僅用更多文字描述時,MiniMax H3 提示詞的效果最佳。選擇最適合鏡頭的簡單模式,描述可觀察的變化,區分固定屬性與變數,為每個參考資料分配特定角色,並一次除錯一個層次。對於進階的 Ref2VA 工作流程,真正的優勢來自於明確角色、動作、鏡頭、音訊和關鍵幀之間的關係——然後將成功的生成內容轉化為下一個鏡頭的可重複使用構建塊。

88 種語言和 175 種方言

準備好試用 Leadde 了嗎?

立即免費試用,幾分鐘內製作高品質 AI 影片。
免費開始