Leadde Logo

Så här använder du MiniMax H3: En komplett guide till prompter, referenser, ljud och ComfyUI

Leadde Team·uppdaterad den 16 aug. 2026·16 min läsning
Så här använder du MiniMax H3: En komplett guide till prompter, referenser, ljud och ComfyUI
- Skapa AI-videor med över 300 avatarer på över 175 språk.

MiniMax H3 används bäst genom att först välja rätt genereringsläge, och därefter bestämma vad som ska kontrolleras av text, bildrutor, referenser, rörelse och ljud. Du kan generera från text, låsa en första eller sista bildruta, eller använda bilder, videor och ljud för att styra identitet, rörelse, kamerabeteende och röst.

Eftersom H3 kombinerar multimodala referenser med inbyggd audiovisuell generering, får du oftast bättre resultat med tydlig kontroll snarare än längre prompter. Denna guide förklarar hur du väljer rätt arbetsflöde, skriver bättre prompter, använder referenser, hanterar dialog och ljud, testar effektivt och arbetar med ComfyUI eller API:et.

Om din utgångspunkt är en PDF, presentation, SOP eller ett utbildningsdokument, snarare än en kreativ prompt, kan Leadde vara ett bättre alternativ för att omvandla strukturerat källmaterial till ett videoarbetsflöde, antingen före eller istället för att manuellt styra varje scen i H3.

Leadde AI.webp

Så använder du MiniMax H3: Vilket arbetsflöde ska du börja med?

Det snabbaste sättet att använda MiniMax H3 är att välja genereringsläge innan du skriver prompten. H3 stöder text, inmatning av första/sista bildruta och multimodala referenser, men varje inmatning spelar en olika roll. MiniMax officiella modellkort delar upp sina öppna checkpoints i FL2VA för text- och ram-baserad generering, och Ref2VA för referensdriven generering med bilder, videor eller ljud.

LägeBäst förVad som styr videon
T2VASkapa en scen från grundenTextprompt
I2VABörja från en exakt bildFörsta bildruta + prompt
L2VAUppnå ett specifikt slutSista bildruta + prompt
FL2VAStyra både start och slutFörsta + sista bildrutor
Ref2VABevara identitet, rörelse, kamera, stil eller röstMultimodala referenser + prompt

Är din bild en bildruta eller en referens?

Denna distinktion löser många kontrollproblem.

En bildruta är en tidsmässig förankring. Om en uppladdad produktbild bokstavligen måste vara den första bilden tittarna ser, använd den som en första bildruta.

En referens är återanvändbar information. Om du bara behöver att produktdesignen, karaktärens ansikte, kläderna eller den visuella stilen förblir konsekvent när du skapar en ny komposition, behandla det som en referens.

MiniMax officiella promptvägledning gör denna distinktion tydlig: I2VA börjar från den angivna bilden vid 0.00 sekunder, medan fullreferensläget separat spårar ämnen, bilder, videor och ljud beroende på vilken roll varje tillgång spelar.

H3:s kontrollstack

Innan du promptar, bestäm vad som ska styra sex delar av videon: identitet, tidslinje, rörelse, kamera, ljud och slut.

Till exempel kan en kommersiell video använda en referensbild för produktidentitet, text för produktens handling, en referensvideo för kamerarörelse, inbyggda ljudinstruktioner för ljuddesign och en sista bildruta för den slutliga "hero shot".

Detta förhindrar ett vanligt misstag: att be en lång textprompt att styra allt.

The H3 Control Stack: Vector Comparison

Hur skriver du en MiniMax H3-prompt som ger dig mer kontroll?

En användbar H3-prompt beskriver videon i uppspelningsordning. Tänk som en regissör som beskriver vad som faktiskt kan ses och höras, snarare än en copywriter som listar adjektiv, ungefär som de bästa metoderna för att skriva ett effektivt videoskript.

En praktisk struktur är:

Scen → Ämne → Handling → Kamera → Dialog/Ljud → Slut

MiniMax officiella baspromptformat följer samma underliggande logik. Dess integrated_multimodal_description beskriver tagningar i sekvens, medan overall_soundscape och non_diegetic_music separat styr fysiskt ljud och soundtrack.

Bygg scenen i uppspelningsordning

Istället för:

En premium, filmisk hudvårdsreklam med dramatisk rörelse.

Använd en observerbar sekvens:

En serumflaska i glas står på en mörk stenpiedestal. Ett smalt ljus sveper över etiketten. Flaskan roterar långsamt medurs medan kameran rör sig närmare. Kondens fångar ljuset. Flaskan stannar med logotypen vänd mot kameran.

Den andra versionen ger H3 synliga tillståndsändringar att utföra.

Överväg också en komplexitetsbudget. Ett 10-sekunders klipp med tre karaktärer, fyra klipp, en transformation, två dialograder, en rörlig kamera och flera referenser kan vara tekniskt beskrivbart, men det betyder inte att alla dessa händelser naturligt passar in på tio sekunder.

Styr kamerarörelser och klipp medvetet

Specificera kamerabeteende endast när det bidrar till tagningen: zooma in, zooma ut, panorera, följa, tilta, båga eller förbli statisk.

Undvik att förvandla varje bildjustering till ett nytt klipp. En långsam övergång från halvbild till närbild kan ofta beskrivas som en kamerarörelse snarare än en ny scen.

Definiera slutet, inte bara handlingen

En prompt blir lättare att kontrollera när den förklarar var handlingen slutar.

Istället för att sluta med ”karaktären går mot fönstret”, definiera det slutliga tillståndet: karaktären stannar bredvid fönstret, vänder sig mot kameran och förblir inramad mot horisonten.

Detta är särskilt viktigt för produktdemovideor, logotypbilder, övergångar och arbetsflöden med första/sista bildruta.

Hur använder du bilder, videor, storyboards och röstreferenser i MiniMax H3?

Referens-till-video är där H3 blir mer än ett konventionellt bild-till-video-verktyg. Den officiella Ref2VA-modellen accepterar multimodala referenser och kan använda dem för att påverka identitet, rörelse, kamerabeteende, stil och ljud. MiniMax dokumenterar för närvarande stöd för upp till nio bilder, tre referensvideor, tre ljudklipp och totalt 12 blandade filer.

Ge varje referens en tydlig uppgift

En stark referensuppsättning kan tilldela:

Bild 1 → karaktärsidentitet; Bild 2 → kläder; Video 1 → kroppsrörelse; Video 2 → kamerarörelse; Ljud 1 → röst.

ComfyUI:s officiella H3-dokumentation rekommenderar samma princip: referera varje inmatning i anslutningsordning och ange tydligt vilken tillgång som styr identitet, stil, rörelse, kamera eller röst.

Fler referenser skapar inte automatiskt mer kontroll. De skapar fler relationer för H3 att lösa. Om två bilder antyder olika kläder medan en referensvideo innehåller ett annat karaktärsutseende, måste modellen bestämma vilken signal som är viktigast om inte prompten tydliggör dessa ansvarsområden.

<Ämne> vs <Bild>

I MiniMax fullreferensformat representerar <Ämne N> återanvändbart synligt innehåll som en person, ett objekt, en miljö eller ett annat element abstraherat från referenstillgångar. <Bild N> representerar en konkret bild som används som en bildruta eller kompositionsförankring. <Video N> och <Ljud N> spårar tidsmässiga eller ljudreferenser.

Detta innebär att ett ämne inte behöver motsvara en fil. En karaktär kan kombinera ansiktsidentitet från en bild med kläder eller rörelseinformation från en annan källa.

När ska du använda en storyboard?

När rumsliga relationer blir svårare att förklara än att visa, kan en storyboard fungera som ett visuellt planeringslager. Detta är särskilt användbart för sekvenser med flera tagningar, produktlanseringar, karaktärsplacering eller återkommande kompositioner.

Ur ett AI-videoarbetsflödesperspektiv är fördelen inte att en storyboard garanterar varje bildruta. Den minskar hur mycket rumslig och tagningplaneringsinformation som måste kommuniceras enbart genom prosa.

MiniMax H3 Maximum Reference File Limits

Hur styr du dialog, ljudeffekter och musik i MiniMax H3?

H3 genererar inbyggt stereoljud tillsammans med video, snarare än att behandla ljud som ett separat efterproduktionslager. MiniMax specificerar 32 kHz stereoutgång, och dess promptsystem stöder dialog, fysiska ljud och icke-diegetisk musik som separata koncept.

Skriv dialog som en del av tagningen

Dialogen bör svara på fyra frågor: vem som talar, vad de säger, när de talar och hur mycket skärmtid de har.

MiniMax strukturerade format kan använda persistenta talar-ID:n som (S1) och dialogtaggar som <d>[English]...</d>. Nykomlingar behöver dock inte börja med syntax. Den viktigare principen är timing.

Använd dialogbudgetering

Dialog förbrukar verkliga sekunder.

Om en talare syns i fyra sekunder, undvik att skriva en mening som realistiskt kräver åtta sekunder att leverera. Annars måste modellen komprimera, skynda på, trunkera eller förvränga talet.

Detta är viktigt i praktiken eftersom lokala H3-användare redan itererar på tagningstiming och dialog parallellt med visuell prompting, snarare än att behandla tal som ett oberoende lager. Ett rapporterat RTX 5080-test använde en strukturerad prompt med flera tagningar och krävde upprepade promptjusteringar medan själva genereringen förblev beräkningsmässigt dyr.

Separera ljudlandskap från bakgrundsmusik

Använd ljudlandskapet för ljud som fysiskt existerar i scenen: fotsteg, motorer, vind, dörrar, folkmassor, tygrörelser eller maskiner.

Använd icke-diegetisk musik för musik som hörs av publiken men inte av karaktärerna.

Att separera de två ger H3 mer användbar vägledning än en vag instruktion som ”lägg till filmiskt ljud”. MiniMax officiella promptformat håller medvetet dessa två ljudlager separata.

Vilka inställningar och testarbetsflöden ger bättre MiniMax H3-resultat?

MiniMax dokumenterar H3-utdata på 4–15 sekunder, 24 FPS, med flera bildförhållanden och en standard 768-pixel kort kant för det öppna H3-Base-arbetsflödet. Dess kompletta system kan producera 2K via H3-Regenerate-2K.

Välj varaktighet, bildförhållande och upplösning baserat på tagningen

Välj inte automatiskt den längsta varaktigheten. Anpassa varaktigheten till antalet meningsfulla händelser.

Använd 16:9 för det mesta liggande innehållet, 9:16 för vertikal social video och 1:1 när kvadratisk komposition tjänar distributionskanalen. I ComfyUI exponerar de officiella H3-arbetsflödena kontroller för bildförhållande och megapixlar via en upplösningsväljare, där högre pixelantal ökar genereringskostnaden.

Använd kvalitetsnivåer för förhandsgranskning

En billig förhandsgranskning är användbar, men bara för de rätta frågorna.

Tidiga tester är bra för att kontrollera komposition, större rörelse, kamerariktning, klipp och grov timing. De är mindre tillförlitliga för att utvärdera liten text, avlägsna ansikten, logotyper eller fina produktdetaljer.

Målet är därför inte bara ”generera alltid i låg upplösning först”. Det handlar om att använda billigare genereringar för strukturella beslut, och sedan lägga beräkningskraft på de detaljer som bara blir synliga vid högre kvalitet.

Testa en variabel i taget

En praktisk produktionssekvens är att först validera scenen, sedan rörelse och kamera, sedan dialog/ljud, sedan ytterligare referenser eller klipp, och slutligen den högkvalitativa genereringen.

Detta är viktigt eftersom den verkliga kostnaden för AI-video ofta är genereringskostnad × antal iterationer. I ett communitytest producerade ett RTX 5080-system en 15-sekunders, 0.4MP, 10-stegs H3-generering på cirka 11 minuter, där tiden per steg ökade avsevärt när videolängden ökade. Användaren rapporterade också att de behövde lösningar för att undvika minnesfel. Betrakta detta som ett enskilt verkligt fall, inte ett universellt riktmärke.

Iteration Workflow: Compute Cost vs. Testing Phases

Hur använder du MiniMax H3 i ComfyUI, API-arbetsflöden och åtgärdar vanliga problem?

ComfyUI tillhandahåller för närvarande officiella H3-mallar för Text-till-Video, Bild-till-Video och Referens-till-Video. Dess inbyggda noder använder FL2VA-familjen för text-/bildrute-arbetsflöden och Ref2VA för multimodala referenser.

MiniMax API tar en annan väg: H3-uppgifter är asynkrona. Du skickar in en genererings-, Context-IR- eller regenereringsuppgift, får ett task_id, och frågar sedan den uppgiften efter resultatet. Framgångsrika genereringsuppgifter returnerar videon via content.url, medan Context-IR returnerar en förbättrad prompt via content.prompt.

Det kompletta H3-systemet bör inte heller förväxlas med de öppna H3-Base-vikterna. MiniMax beskriver tre moduler: H3-Context-IR → H3-Base → H3-Regenerate-2K. Lokal H3-Base validerar 768p-generering, medan det fullständiga 2K-arbetsflödet kombinerar den ursprungliga kontexten med 768p-resultatet för regenerering.

Diagnostisera fel på tre nivåer

Innan du skriver om prompten, identifiera fellagret.

NivåTypiskt problemVad du ska ändra
PromptFel handling, timing, kamera eller slutSkriv om tidslinjen
ReferensIdentitet, kläder, rörelse eller röst avvikerTydliggör eller minska referensroller
RenderingLiten text, avlägsna ansikten, fina detaljerTesta utdata/inställningar med högre kvalitet

Detta är en användbar distinktion eftersom inte varje visuell defekt är ett promptingproblem.

Vanliga MiniMax H3-problem och praktiska lösningar

Om identiteten avviker, förenkla motstridiga referenser och definiera tydligt vilken källa som styr identiteten. Om en produkt eller logotyp ändras, separera explicit attribut som måste bevaras från element som modellen kan omforma.

Om videon känns stressad, minska handlingar, klipp eller dialog snarare än att lägga till mer promptdetaljer. Om talet låter komprimerat, förkorta dialogen eller ge talaren mer tid.

För förvrängning av första/sista bildruta, beskriv den mellanliggande fysiska övergången istället för att bara specificera två ändpunkter. Om en R2V-referens har liten inverkan, ange dess exakta roll snarare än att bara bifoga den.

Lokala användare bör också hantera prestandajustering noggrant. ComfyUI dokumenterar officiellt valfri Sage Attention och säger att dess exempelarbetsflöden kan se ungefär dubblerad genereringshastighet med minimal kvalitetsförlust, men andra cachelagrings-, kvantiserings- och experimentella optimeringstekniker kan innebära olika kompromisser.

Sammanfattning

MiniMax H3 är lättare att kontrollera när du behandlar videogenerering som ett produktionsarbetsflöde snarare än en tävling om promptlängd. Välj rätt läge, tilldela varje referens ett specifikt ansvar, budgetera handlingar och dialog inom den tillgängliga tiden, testa strukturella beslut före slutlig kvalitetsrendering, och diagnostisera fel som prompt-, referens- eller renderingsproblem. Detta tillvägagångssätt skalar från enkla text-till-video-klipp till komplexa multimodala uppsättningar, vilket återspeglar hur människor skapar AI-videor så snabbt idag.

88 språk och 175 dialekter

Redo att prova Leadde?

Kom igång gratis idag och skapa engagerande AI-videor på några minuter.