Leadde Logo

Comment utiliser MiniMax H3 : Le guide complet des prompts, références, audio et ComfyUI

Leadde Team·mis à jour le 16 août 2026·19 min de lecture
Comment utiliser MiniMax H3 : Le guide complet des prompts, références, audio et ComfyUI
- Créez des vidéos IA avec plus de 300 avatars dans plus de 175 langues.

Pour optimiser l'utilisation de MiniMax H3, choisissez d'abord le mode de génération approprié, puis déterminez les éléments à contrôler via le texte, les images clés, les références, le mouvement et l'audio. Vous pouvez générer à partir de texte, verrouiller une image clé de début ou de fin, ou utiliser des images, des vidéos et de l'audio pour guider l'identité, le mouvement, le comportement de la caméra et la voix.

Puisque H3 combine des références multimodales avec une génération audiovisuelle native, de meilleurs résultats proviennent généralement d'un contrôle clair plutôt que de prompts plus longs. Ce guide explique comment choisir le bon flux de travail, rédiger de meilleurs prompts, utiliser les références, gérer les dialogues et le son, tester efficacement, et travailler avec ComfyUI ou l'API.

Si votre point de départ est un PDF, une présentation, un document de procédure ou un document de formation plutôt qu'un prompt créatif, Leadde peut s'avérer plus adapté pour transformer un contenu source structuré en un flux de travail vidéo avant ou au lieu de diriger manuellement chaque scène dans H3.

Leadde AI

Comment utiliser MiniMax H3 : Par quel flux de travail commencer ?

La manière la plus rapide d'utiliser MiniMax H3 est de choisir le mode de génération avant de rédiger le prompt. H3 prend en charge les entrées textuelles, les images clés de début/fin et les références multimodales, mais chaque entrée joue un rôle différent. La fiche modèle officielle de MiniMax sépare ses checkpoints open-weight en FL2VA pour la génération basée sur le texte et les images clés, et Ref2VA pour la génération basée sur des références avec des images, des vidéos ou de l'audio.

ModeIdéal pourCe qui contrôle la vidéo
T2VACréer une scène de zéroPrompt textuel
I2VAPartir d'une image exacteImage clé de début + prompt
L2VAAtteindre une fin spécifiqueImage clé de fin + prompt
FL2VAContrôler le début et la finImages clés de début + fin
Ref2VAPréserver l'identité, le mouvement, la caméra, le style ou la voixRéférences multimodales + prompt

Votre image est-elle une image clé ou une référence ?

Cette distinction résout de nombreux problèmes de contrôle.

Une image clé est une ancre temporelle. Si une image de produit téléchargée doit littéralement être la première image que les spectateurs voient, utilisez-la comme image clé de début.

Une référence est une information réutilisable. Si vous avez seulement besoin que le design du produit, le visage du personnage, la tenue ou le style visuel restent cohérents lors de la création d'une nouvelle composition, traitez-le comme une référence.

Les directives de prompt officielles de MiniMax rendent cette distinction explicite : I2VA commence à partir de l'image fournie à 0,00 seconde, tandis que le mode de référence complète suit séparément les sujets, les images, les vidéos et l'audio selon le rôle que joue chaque actif.

La pile de contrôle H3

Avant de formuler le prompt, décidez ce qui contrôle six parties de la vidéo : l'identité, la chronologie, le mouvement, la caméra, l'audio et la fin.

Par exemple, une vidéo commerciale pourrait utiliser une image de référence pour l'identité du produit, du texte pour l'action du produit, une vidéo de référence pour le mouvement de la caméra, des instructions audio natives pour la conception sonore, et une image clé de fin pour le plan final héroïque.

Cela évite une erreur courante : demander à un seul long prompt textuel de tout contrôler.

La pile de contrôle H3 : Comparaison vectorielle

Comment rédiger un prompt MiniMax H3 qui vous donne plus de contrôle ?

Un prompt H3 utile décrit la vidéo dans l'ordre de lecture. Pensez comme un réalisateur décrivant ce qui peut réellement être vu et entendu, plutôt que comme un rédacteur publicitaire énumérant des adjectifs, un peu comme les meilleures pratiques utilisées pour rédiger un script vidéo efficace.

Une structure pratique est :

Scène → Sujet → Action → Caméra → Dialogue/Son → Fin

Le format de prompt de base officiel de MiniMax suit la même logique sous-jacente. Sa integrated_multimodal_description décrit les plans en séquence, tandis que overall_soundscape et non_diegetic_music contrôlent séparément le son physique et la bande sonore.

Construisez la scène dans l'ordre de lecture

Au lieu de :

Une publicité cinématographique haut de gamme pour des soins de la peau avec un mouvement dramatique.

Utilisez une séquence observable :

Une bouteille de sérum en verre repose sur un piédestal en pierre sombre. Une lumière étroite balaie l'étiquette. La bouteille tourne lentement dans le sens des aiguilles d'une montre tandis que la caméra se rapproche. La condensation capte la lumière. La bouteille s'arrête, le logo face à la caméra.

La deuxième version donne à H3 des changements d'état visibles à exécuter.

Considérez également un budget de complexité. Un clip de 10 secondes avec trois personnages, quatre coupes, une transformation, deux lignes de dialogue, une caméra en mouvement et plusieurs références peut être techniquement descriptible, mais cela ne signifie pas que tous ces événements s'intègrent naturellement en dix secondes.

Dirigez intentionnellement les mouvements de caméra et les coupes

Spécifiez le comportement de la caméra uniquement lorsqu'il contribue au plan : zoom avant, zoom arrière, panoramique, travelling, inclinaison, mouvement en arc, ou rester statique.

Évitez de transformer chaque ajustement de cadrage en une nouvelle coupe. Un changement lent d'un plan moyen à un gros plan peut souvent être décrit comme un mouvement de caméra plutôt que comme une nouvelle scène.

Définissez la fin, pas seulement l'action

Un prompt devient plus facile à contrôler lorsqu'il explique où l'action se termine.

Au lieu de terminer par « le personnage marche vers la fenêtre », définissez l'état final : le personnage s'arrête près de la fenêtre, se tourne vers la caméra et reste cadré sur la ligne d'horizon.

Ceci est particulièrement important pour les vidéos de démonstration de produit, les plans de logo, les transitions et les flux de travail avec images clés de début/fin.

Comment utiliser les images, vidéos, storyboards et références vocales dans MiniMax H3 ?

La référence-vers-vidéo est le point où H3 devient plus qu'un outil conventionnel d'image-vers-vidéo. Le modèle officiel Ref2VA accepte les références multimodales et peut les utiliser pour influencer l'identité, le mouvement, le comportement de la caméra, le style et l'audio. MiniMax documente actuellement la prise en charge de jusqu'à neuf images, trois vidéos de référence, trois clips audio et un total de 12 fichiers mixtes.

Attribuez un rôle clair à chaque référence

Une configuration de référence efficace pourrait attribuer :

Image 1 → identité du personnage ; Image 2 → vêtements ; Vidéo 1 → mouvement corporel ; Vidéo 2 → mouvement de caméra ; Audio 1 → voix.

La documentation officielle H3 de ComfyUI recommande le même principe : référencer chaque entrée dans l'ordre de connexion et indiquer explicitement quel actif contrôle l'identité, le style, le mouvement, la caméra ou la voix.

Plus de références ne créent pas automatiquement plus de contrôle. Elles créent plus de relations que H3 doit résoudre. Si deux images impliquent des tenues différentes alors qu'une vidéo de référence contient une autre apparence de personnage, le modèle doit décider quel signal est le plus important, à moins que le prompt ne clarifie ces responsabilités.

<Subject> vs <Picture>

Dans le format de référence complète de MiniMax, <Subject N> représente un contenu visible réutilisable tel qu'une personne, un objet, un environnement ou un autre élément abstrait des actifs de référence. <Picture N> représente une image concrète utilisée comme image clé ou ancre de composition. <Video N> et <Audio N> suivent les références temporelles ou audio.

Cela signifie qu'un sujet ne doit pas nécessairement être égal à un fichier. Un personnage pourrait combiner l'identité faciale d'une image avec des informations de vêtements ou de mouvement provenant d'une autre source.

Quand utiliser un storyboard ?

Lorsque les relations spatiales deviennent plus difficiles à expliquer qu'à montrer, un storyboard peut servir de couche de planification visuelle. Ceci est particulièrement utile pour les séquences multi-plans, les révélations de produits, le blocage de personnages ou les compositions récurrentes.

Du point de vue d'un flux de travail vidéo IA, l'avantage n'est pas qu'un storyboard garantisse chaque image clé. Il réduit la quantité d'informations spatiales et de planification de plans qui doivent être communiquées uniquement par le texte.

Limites maximales de fichiers de référence MiniMax H3

Comment contrôler les dialogues, les effets sonores et la musique dans MiniMax H3 ?

H3 génère de l'audio stéréo natif en même temps que la vidéo plutôt que de traiter l'audio comme une couche de post-production distincte. MiniMax spécifie une sortie stéréo 32 kHz, et son système de prompting prend en charge les dialogues, les sons physiques et la musique non diégétique comme concepts distincts.

Rédigez le dialogue comme partie intégrante du plan

Le dialogue doit répondre à quatre questions : qui parle, ce qu'il dit, quand il parle et combien de temps d'écran il a.

Le format structuré de MiniMax peut utiliser des identifiants de locuteur persistants tels que (S1) et des balises de dialogue telles que <d>[English]...</d>. Cependant, les débutants n'ont pas besoin de commencer par la syntaxe. Le principe le plus important est le timing.

Utilisez un budget de dialogue

Le dialogue consomme de vraies secondes.

Si un locuteur apparaît pendant quatre secondes, évitez d'écrire une phrase qui nécessiterait de manière réaliste huit secondes pour être prononcée. Sinon, le modèle devra compresser, précipiter, tronquer ou déformer le discours.

Ceci est important en pratique car les utilisateurs locaux de H3 itèrent déjà sur le timing des plans et les dialogues en parallèle du prompt visuel, plutôt que de traiter la parole comme une couche indépendante. Un test rapporté sur RTX 5080 a utilisé un prompt structuré multi-plans et a nécessité des ajustements répétés du prompt, tandis que la génération elle-même restait coûteuse en calcul.

Séparez l'ambiance sonore de la musique de fond

Utilisez l'ambiance sonore pour les sons qui existent physiquement dans la scène : pas, moteurs, vent, portes, foules, mouvement de tissu ou machines.

Utilisez la musique non diégétique pour la musique entendue par le public mais pas par les personnages.

Séparer les deux donne à H3 une direction plus utile qu'une instruction vague telle que « ajouter de l'audio cinématographique ». Le format de prompt officiel de MiniMax maintient délibérément ces deux couches audio séparées.

Quels réglages et flux de travail de test produisent de meilleurs résultats avec MiniMax H3 ?

MiniMax documente une sortie H3 de 4 à 15 secondes, 24 FPS, avec plusieurs rapports d'aspect et un côté court par défaut de 768 pixels pour le flux de travail open H3-Base. Son système complet peut produire du 2K via H3-Regenerate-2K.

Choisissez la durée, le rapport d'aspect et la résolution en fonction du plan

Ne choisissez pas automatiquement la durée la plus longue. Adaptez la durée au nombre d'événements significatifs.

Utilisez le 16:9 pour la plupart des contenus paysages, le 9:16 pour les vidéos sociales verticales, et le 1:1 lorsque la composition carrée sert le canal de distribution. Dans ComfyUI, les flux de travail H3 officiels exposent les contrôles de rapport d'aspect et de mégapixels via un sélecteur de résolution, les nombres de pixels plus élevés augmentant le coût de génération.

Utilisez une échelle de fidélité d'aperçu

Un aperçu à faible coût est utile, mais seulement pour les bonnes questions.

Les premiers tests sont bons pour vérifier la composition, le mouvement majeur, la direction de la caméra, les coupes et le timing approximatif. Ils sont moins fiables pour évaluer le petit texte, les visages éloignés, les logos ou les détails fins des produits.

L'objectif n'est donc pas simplement de « toujours générer d'abord en basse résolution ». Il s'agit d'utiliser des générations moins coûteuses pour les décisions structurelles, puis de dépenser des ressources de calcul sur les détails qui ne deviennent visibles qu'à une fidélité plus élevée.

Testez une variable à la fois

Une séquence de production pratique consiste à valider d'abord la scène, puis le mouvement et la caméra, ensuite le dialogue/audio, puis les références ou coupes supplémentaires, et enfin la génération de haute qualité.

Ceci est important car le coût réel de la vidéo IA est souvent coût de génération × nombre d'itérations. Lors d'un test communautaire, un système RTX 5080 a produit une génération H3 de 15 secondes, 0,4 MP, en 10 étapes en environ 11 minutes, le temps par étape augmentant considérablement à mesure que la durée de la vidéo augmentait. L'utilisateur a également signalé avoir eu besoin de solutions de contournement pour éviter les échecs de mémoire insuffisante. Considérez ceci comme un cas réel unique, et non comme un benchmark universel.

Flux de travail d'itération : Coût de calcul vs Phases de test

Comment utiliser MiniMax H3 dans ComfyUI, les flux de travail API et résoudre les problèmes courants ?

ComfyUI fournit actuellement des modèles H3 officiels pour le Texte-vers-Vidéo, l'Image-vers-Vidéo et la Référence-vers-Vidéo. Ses nœuds natifs utilisent la famille FL2VA pour les flux de travail texte/image clé et Ref2VA pour les références multimodales.

L'API MiniMax adopte une approche différente : les tâches H3 sont asynchrones. Vous soumettez une tâche de génération, Context-IR ou de régénération, recevez un task_id, puis interrogez cette tâche pour obtenir le résultat. Les tâches de génération réussies renvoient la vidéo via content.url, tandis que Context-IR renvoie un prompt amélioré via content.prompt.

Le système H3 complet ne doit pas non plus être confondu avec les poids open H3-Base. MiniMax décrit trois modules : H3-Context-IR → H3-Base → H3-Regenerate-2K. H3-Base local valide la génération 768p, tandis que le flux de travail 2K complet combine le contexte original avec le résultat 768p pour la régénération.

Diagnostiquez les échecs à trois niveaux

Avant de réécrire le prompt, identifiez la couche d'échec.

CoucheProblème typiqueQue changer
PromptMauvaise action, timing, caméra ou finRéécrire la chronologie
RéférenceDérive de l'identité, des vêtements, du mouvement ou de la voixClarifier ou réduire les rôles des références
RenduPetit texte, visages éloignés, détails finsTester des sorties/réglages de plus haute fidélité

C'est une distinction utile car tout défaut visuel n'est pas un problème de prompting.

Problèmes courants de MiniMax H3 et solutions pratiques

Si l'identité dérive, simplifiez les références conflictuelles et définissez clairement quelle source contrôle l'identité. Si un produit ou un logo change, séparez explicitement les attributs à préserver des éléments que le modèle peut redessiner.

Si la vidéo semble précipitée, réduisez les actions, les coupes ou les dialogues plutôt que d'ajouter plus de détails au prompt. Si le discours semble compressé, raccourcissez le dialogue ou donnez plus de temps au locuteur.

Pour la déformation d'images clés de début/fin, décrivez la transition physique intermédiaire au lieu de spécifier seulement deux points d'extrémité. Si une référence R2V a peu d'influence, indiquez son rôle exact plutôt que de simplement l'attacher.

Les utilisateurs locaux doivent également aborder l'optimisation des performances avec prudence. ComfyUI documente officiellement l'attention Sage optionnelle et indique que ses flux de travail d'exemple peuvent voir une vitesse de génération environ doublée avec une perte de qualité minimale, mais d'autres techniques de mise en cache, de quantification et d'optimisation expérimentale peuvent impliquer des compromis différents.

Conclusion

MiniMax H3 est plus facile à contrôler lorsque vous traitez la génération vidéo comme un flux de travail de production plutôt que comme un concours de longueur de prompt. Choisissez le mode correct, attribuez à chaque référence une responsabilité spécifique, budgétisez les actions et les dialogues dans le temps disponible, testez les décisions structurelles avant le rendu de qualité finale, et diagnostiquez les échecs comme des problèmes de prompt, de référence ou de rendu. Cette approche s'adapte des simples clips texte-vers-vidéo aux configurations multimodales complexes, reflétant comment les gens créent des vidéos IA si rapidement aujourd'hui.

88 langues et 175 dialectes

Prêt à essayer Leadde ?

Commencez un essai gratuit dès aujourd'hui et créez des vidéos captivantes avec l'IA en quelques minutes.
Commencer gratuitement