Leadde Logo

如何使用 MiniMax H3:提示詞、參考圖、音訊與 ComfyUI 完整指南

Leadde Team·更新於 2026年8月16日·7 分鐘閱讀
如何使用 MiniMax H3:提示詞、參考圖、音訊與 ComfyUI 完整指南
輕鬆製作 AI 影片,支援超過 300 種虛擬人像及 175 種以上語言。

MiniMax H3 的最佳使用方式是先選擇正確的生成模式,再決定哪些元素應由文字、影格、參考資料、動作和音訊來控制。您可以從文字生成、鎖定首影格或尾影格,或利用圖像、影片和音訊來引導身份、動作、鏡頭行為和語音。

H3 結合了多模態參考資料與原生影音生成技術,因此,清晰的控制指令通常比冗長的提示詞更能產生優異成果。本指南將說明如何選擇合適的工作流程、撰寫更優質的提示詞、運用參考資料、管理對話與音效、高效測試,以及如何搭配 ComfyUI 或 API 使用。

如果您的起點是 PDF簡報SOP 或訓練文件,而非創意提示詞,那麼 Leadde 能更有效地將結構化來源內容轉化為影片工作流程,在 H3 中手動指導每個場景之前或作為替代方案。

Leadde AI.webp

如何使用 MiniMax H3:該從哪個工作流程開始?

使用 MiniMax H3 最快的方法是在撰寫提示詞之前,先選擇生成模式。H3 支援文字、首/尾影格輸入以及多模態參考資料,但每種輸入都扮演著不同的角色。MiniMax 的官方模型卡將其開放權重檢查點分為 FL2VA(用於文字和影格生成)和 Ref2VA(用於圖像、影片或音訊的參考驅動生成)。

模式最佳用途影片控制方式
T2VA從零開始創建場景文字提示詞
I2VA從精確圖像開始首影格 + 提示詞
L2VA達成特定結局尾影格 + 提示詞
FL2VA控制開始與結束首影格 + 尾影格
Ref2VA保留身份、動作、鏡頭、風格或語音多模態參考資料 + 提示詞

您的圖像是一個影格還是參考資料?

這種區分能解決許多控制問題。

影格是時間錨點。如果上傳的產品圖像必須是觀眾看到的第一個畫面,請將其用作首影格。

參考資料是可重複使用的資訊。如果您只需要在創建新構圖時保持產品設計、角色臉部、服裝或視覺風格的一致性,請將其視為參考資料。

MiniMax 的官方提示詞指南明確指出這項區別:I2VA 從提供的圖像在 0.00 秒處開始,而完整參考模式則根據每個資產所扮演的角色,分別追蹤主體、圖片、影片和音訊。

H3 控制堆疊

在撰寫提示詞之前,請決定影片的六個部分由什麼來控制:身份、時間軸、動作、鏡頭、音訊和結局

例如,一支商業影片可以使用參考圖像來定義產品身份、文字來描述產品動作、參考影片來引導鏡頭運動、原生音訊指令來進行聲音設計,並使用尾影格來呈現最終的特寫鏡頭。

這能避免一個常見的錯誤:即試圖用一個冗長的文字提示詞來控制所有內容。

H3 控制堆疊:向量比較

如何撰寫能讓您擁有更多控制權的 MiniMax H3 提示詞?

一個有效的 H3 提示詞應按照播放順序描述影片內容。想像自己是一位導演,描述實際可見和可聽的內容,而非像文案撰寫者那樣羅列形容詞,這與撰寫有效影片腳本的最佳實踐原則相似。

一個實用的結構是:

場景 → 主體 → 動作 → 鏡頭 → 對話/音效 → 結局

MiniMax 的官方基礎提示詞格式也遵循相同的底層邏輯。其 integrated_multimodal_description 依序描述鏡頭,而 overall_soundscapenon_diegetic_music 則分別控制實體音效和背景音樂。

依播放順序建構場景

不要這樣寫:

一支具有戲劇性動態的高級電影級護膚品廣告。

應使用可觀察的序列:

一個玻璃精華液瓶子立在深色石座上。一束窄光掃過標籤。瓶子緩慢順時針旋轉,同時鏡頭推近。冷凝水珠捕捉到光線。瓶子停止,標誌面向鏡頭。

第二種版本為 H3 提供了可執行的可見狀態變化。

此外,請考慮複雜度預算。一個包含三個角色、四個剪輯、一次變形、兩句對白、一個移動鏡頭和多個參考資料的 10 秒短片,技術上或許可以描述,但這不代表所有這些事件都能自然地融入 10 秒鐘內。

有意識地引導鏡頭運動和剪輯

僅在鏡頭行為有助於畫面時才明確指定:例如推近、拉遠、搖攝、跟蹤、傾斜、弧形運動或保持靜止。

避免將每次構圖調整都變成另一個剪輯。從中景到特寫的緩慢變化,通常可以描述為鏡頭運動,而非一個新場景。

定義結局,而不僅僅是動作

當提示詞解釋動作的結束點時,影片會更容易控制。

與其以「角色走向窗戶」作結,不如定義最終狀態:角色停在窗邊,轉向鏡頭,並以天際線為背景保持構圖。

這對於產品演示影片、標誌鏡頭、轉場以及首/尾影格工作流程尤為重要。

如何在 MiniMax H3 中使用圖像、影片、分鏡圖和語音參考資料?

參考資料轉影片是 H3 超越傳統圖像轉影片工具的關鍵所在。官方 Ref2VA 模型接受多模態參考資料,並能利用它們來影響身份、動作、鏡頭行為、風格和音訊。MiniMax 目前支援最多九張圖像、三段參考影片、三段音訊片段,總計 12 個混合檔案。

為每個參考資料賦予一個明確任務

一個強大的參考資料設定可能會分配:

圖像 1 → 角色身份;圖像 2 → 服裝;影片 1 → 身體動作;影片 2 → 鏡頭運動;音訊 1 → 語音。

ComfyUI 的官方 H3 文件也推薦相同的原則:按照連接順序引用每個輸入,並明確說明哪個資產控制身份、風格、動作、鏡頭或語音。

更多的參考資料不一定會自動帶來更多的控制權。它們會為 H3 帶來更多需要解決的關係。如果兩張圖像暗示不同的服裝,而參考影片又包含另一種角色外觀,那麼除非提示詞明確這些職責,否則模型必須自行決定哪個訊號最重要。

<Subject><Picture>

在 MiniMax 的完整參考格式中,<Subject N> 代表可重複使用的可見內容,例如人物、物體、環境或從參考資產中抽象出來的其他元素。<Picture N> 代表用作影格或構圖錨點的具體圖像。<Video N><Audio N> 則追蹤時間或音訊參考資料。

這意味著一個主體不一定等於一個檔案。一個角色可以將來自一張圖像的臉部身份與來自另一個來源的服裝或動作資訊結合。

何時應該使用分鏡圖?

當空間關係難以用文字解釋而更適合視覺呈現時,分鏡圖可以作為視覺規劃層。這對於多鏡頭序列、產品揭示、角色走位或重複構圖特別有用。

從 AI 影片工作流程的角度來看,分鏡圖的優勢並非保證每個影格都精確無誤。而是減少了僅透過文字傳達空間和鏡頭規劃資訊的需求。

MiniMax H3 最大參考檔案限制

如何在 MiniMax H3 中控制對話、音效和音樂?

H3 能與影片同步生成原生立體音訊,而非將音訊視為獨立的後製層。MiniMax 指定 32 kHz 立體聲輸出,其提示詞系統支援將對話、實體音效和非敘事音樂作為獨立概念處理。

將對話寫入鏡頭的一部分

對話應回答四個問題:誰說話、說什麼、何時說以及有多少螢幕時間

MiniMax 的結構化格式可以使用持久性說話者 ID(例如 (S1))和對話標籤(例如 <d>[English]...</d>)。然而,初學者無需從語法開始。更重要的原則是時機掌握。

運用對話預算

對話會消耗實際時間。

如果一個說話者出現四秒鐘,請避免撰寫實際需要八秒才能說完的句子。否則模型必須壓縮、趕速、截斷或扭曲語音。

這在實踐中很重要,因為本地 H3 用戶已經在視覺提示詞的同時,反覆調整鏡頭時機和對話,而非將語音視為獨立層。一項報告的 RTX 5080 測試使用了結構化的多鏡頭提示詞,並需要重複調整提示詞,而生成本身仍然計算成本高昂。

將聲景與背景音樂分開

聲景用於場景中實際存在的聲音:例如腳步聲、引擎聲、風聲、開門聲、人群聲、布料移動聲或機械聲。

非敘事音樂用於觀眾能聽到但角色聽不到的音樂。

將兩者分開能為 H3 提供比「添加電影音訊」等模糊指令更有用的方向。MiniMax 的官方提示詞格式特意將這兩個音訊層分開。

哪些設定和測試工作流程能產生更好的 MiniMax H3 成果?

MiniMax 文件指出,H3 輸出影片長度為 4–15 秒,24 FPS,支援多種長寬比,開放的 H3-Base 工作流程預設短邊為 768 像素。其完整系統可透過 H3-Regenerate-2K 生成 2K 影片。

根據鏡頭選擇持續時間、長寬比和解析度

不要自動選擇最長的持續時間。應根據有意義事件的數量來匹配持續時間。

大多數橫向內容使用 16:9,垂直社群影片使用 9:16,當方形構圖符合發布管道時使用 1:1。在 ComfyUI 中,官方 H3 工作流程透過解析度選擇器 (Resolution Selector) 提供了長寬比和百萬像素控制,像素數量越高,生成成本也隨之增加。

使用預覽保真度階梯

低成本預覽很有用,但僅限於回答正確的問題。

早期測試適合檢查構圖、主要動作、鏡頭方向、剪輯和大致時機。對於評估小字體、遠處人臉、標誌或精細產品細節則較不可靠。

因此,目標並非簡單地「總是先以低解析度生成」。而是利用成本較低的生成來做出結構性決策,然後將運算資源投入到只有在高保真度下才能看清的細節上。

一次測試一個變數

一個實用的製作順序是先驗證場景,然後是動作和鏡頭,接著是對話/音訊,再來是額外的參考資料或剪輯,最後才是高品質生成。

這很重要,因為 AI 影片的實際成本通常是生成成本 × 迭代次數。在一項社群測試中,RTX 5080 系統在大約 11 分鐘內生成了一個 15 秒、0.4 百萬像素、10 步驟的 H3 影片,且隨著影片長度增加,每個步驟的時間顯著增加。該用戶還報告需要採取變通方法來避免記憶體不足的錯誤。請將此視為單一的實際案例,而非普遍基準。

迭代工作流程:運算成本與測試階段

如何在 ComfyUI、API 工作流程中使用 MiniMax H3 並解決常見問題?

ComfyUI 目前提供官方 H3 模板,支援文字轉影片 (Text-to-Video)、圖像轉影片 (Image-to-Video) 和參考資料轉影片 (Reference-to-Video)。其原生節點使用 FL2VA 系列處理文字/影格工作流程,並使用 Ref2VA 處理多模態參考資料。

MiniMax API 採用不同的路徑:H3 任務是異步的。您提交生成、Context-IR 或重新生成任務,接收 task_id,然後查詢該任務以獲取結果。成功的生成任務會透過 content.url 返回影片,而 Context-IR 則透過 content.prompt 返回增強的提示詞。

完整的 H3 系統也不應與開放的 H3-Base 權重混淆。MiniMax 描述了三個模組:H3-Context-IR → H3-Base → H3-Regenerate-2K。本地 H3-Base 驗證 768p 生成,而完整的 2K 工作流程則將原始上下文與 768p 結果結合進行重新生成。

從三個層面診斷故障

在重寫提示詞之前,請確定故障層面。

層面常見問題應變措施
提示詞動作、時機、鏡頭或結局錯誤重寫時間軸
參考資料身份、服裝、動作或語音漂移釐清或減少參考資料的角色
渲染小字體、遠處人臉、精細細節測試更高保真度的輸出/設定

這是一個有用的區分,因為並非所有視覺缺陷都源於提示詞問題。

MiniMax H3 常見問題與實用解決方案

如果身份漂移,請簡化衝突的參考資料,並明確定義哪個來源控制身份。如果產品或標誌發生變化,請明確區分必須保留的屬性與模型可能重新設計的元素。

如果影片感覺倉促,請減少動作、剪輯或對話,而非增加更多提示詞細節。如果語音聽起來壓縮,請縮短對話或給予說話者更多時間。

對於首/尾影格扭曲問題,請描述中間的物理過渡,而非僅指定兩個端點。如果 R2V 參考資料影響甚微,請明確說明其確切角色,而非僅僅附加它。

本地用戶也應謹慎處理效能調優。ComfyUI 官方文件記載了可選的 Sage Attention,並表示其範例工作流程可在品質損失極小的情況下,將生成速度提高約一倍,但其他快取、量化和實驗性優化技術可能會涉及不同的權衡。

結論

當您將影片生成視為一個製作工作流程,而非提示詞長度競賽時,MiniMax H3 會更容易控制。請選擇正確的模式、為每個參考資料分配明確的職責、在可用時間內規劃動作和對話、在最終品質渲染前測試結構性決策,並將故障診斷為提示詞、參考資料或渲染問題。這種方法適用於從簡單的文字轉影片片段到複雜的多模態設定,反映了當今人們如何快速製作 AI 影片的現狀。

88 種語言和 175 種方言

準備好試用 Leadde 了嗎?

立即免費試用,幾分鐘內製作高品質 AI 影片。
免費開始