Leadde Logo

Como Usar o MiniMax H3: Guia Completo para Prompts, Referências, Áudio e ComfyUI

Leadde Team·atualizado em 16 de ago. de 2026·17 min de leitura
Como Usar o MiniMax H3: Guia Completo para Prompts, Referências, Áudio e ComfyUI
- Crie vídeos com IA com mais de 300 avatares em mais de 175 idiomas.

O MiniMax H3 é melhor aproveitado ao escolher primeiro o modo de geração correto e, em seguida, decidir o que será controlado por texto, frames, referências, movimento e áudio. Você pode gerar a partir de texto, fixar um frame inicial ou final, ou usar imagens, vídeos e áudio para guiar a identidade, o movimento, o comportamento da câmera e a voz.

Como o H3 combina referências multimodais com geração audiovisual nativa, resultados superiores são geralmente alcançados com controle preciso, em vez de prompts extensos. Este guia explica como escolher o fluxo de trabalho certo, escrever prompts melhores, usar referências, gerenciar diálogos e som, testar com eficiência e trabalhar com ComfyUI ou a API.

Se o seu ponto de partida for um PDF, apresentação, POP ou documento de treinamento, em vez de um prompt criativo, o Leadde pode ser mais adequado para transformar conteúdo fonte estruturado em um fluxo de trabalho de vídeo, antes ou em vez de dirigir manualmente cada cena no H3.

Leadde AI.webp

Como Usar o MiniMax H3: Com Qual Fluxo de Trabalho Você Deve Começar?

A maneira mais rápida de usar o MiniMax H3 é escolher o modo de geração antes de escrever o prompt. O H3 suporta entradas de texto, frames iniciais/finais e referências multimodais, mas cada entrada desempenha um papel diferente. O cartão de modelo oficial da MiniMax separa seus checkpoints de peso aberto em FL2VA para geração baseada em texto e frames, e Ref2VA para geração orientada por referência com imagens, vídeos ou áudio.

ModoIdeal ParaO Que Controla o Vídeo
T2VACriar uma cena do zeroPrompt de texto
I2VAComeçar de uma imagem exataFrame inicial + prompt
L2VAAlcançar um final específicoFrame final + prompt
FL2VAControlar início e fimFrames inicial + final
Ref2VAPreservar identidade, movimento, câmera, estilo ou vozReferências multimodais + prompt

Sua imagem é um frame ou uma referência?

Essa distinção resolve muitos problemas de controle.

Um frame é uma âncora temporal. Se uma imagem de produto carregada deve ser literalmente a primeira imagem que os espectadores veem, use-a como um frame inicial.

Uma referência é informação reutilizável. Se você precisa apenas que o design do produto, o rosto do personagem, a roupa ou o estilo visual permaneçam consistentes ao criar uma nova composição, trate-a como uma referência.

A orientação oficial de prompts da MiniMax torna essa distinção explícita: o I2VA começa da imagem fornecida em 0,00 segundos, enquanto o modo de referência completa rastreia separadamente sujeitos, imagens, vídeos e áudio de acordo com o papel que cada ativo desempenha.

A Pilha de Controle do H3

Antes de criar o prompt, decida o que controla seis partes do vídeo: identidade, linha do tempo, movimento, câmera, áudio e final.

Por exemplo, um vídeo comercial poderia usar uma imagem de referência para a identidade do produto, texto para a ação do produto, um vídeo de referência para o movimento da câmera, instruções de áudio nativas para o design de som e um frame final para o take principal.

Isso evita um erro comum: pedir a um único prompt de texto longo para controlar tudo.

A Pilha de Controle do H3: Comparação de Vetores

Como Escrever um Prompt do MiniMax H3 Que Ofereça Mais Controle?

Um prompt H3 útil descreve o vídeo na ordem de reprodução. Pense como um diretor descrevendo o que pode ser realmente visto e ouvido, em vez de um copywriter listando adjetivos, muito parecido com as melhores práticas usadas para escrever um roteiro de vídeo eficaz.

Uma estrutura prática é:

Cena → Assunto → Ação → Câmera → Diálogo/Som → Final

O formato de prompt base oficial da MiniMax segue a mesma lógica subjacente. Sua integrated_multimodal_description descreve os takes em sequência, enquanto overall_soundscape e non_diegetic_music controlam separadamente o som físico e a trilha sonora.

Construa a cena na ordem de reprodução

Em vez de:

Um comercial cinematográfico premium de cuidados com a pele com movimento dramático.

Use uma sequência observável:

Um frasco de soro de vidro repousa sobre um pedestal de pedra escura. Uma luz estreita varre o rótulo. O frasco gira lentamente no sentido horário enquanto a câmera se aproxima. A condensação capta a luz. O frasco para com o logo voltado para a câmera.

A segunda versão dá ao H3 mudanças de estado visíveis para executar.

Considere também um orçamento de complexidade. Um clipe de 10 segundos com três personagens, quatro cortes, uma transformação, duas linhas de diálogo, uma câmera em movimento e várias referências pode ser tecnicamente descritível, mas isso não significa que todos esses eventos se encaixem naturalmente em dez segundos.

Direcione o movimento da câmera e os cortes intencionalmente

Especifique o comportamento da câmera apenas quando ele contribuir para o take: aproximar, afastar, panorâmica, seguir, inclinar, arco ou permanecer estática.

Evite transformar cada ajuste de enquadramento em um novo corte. Uma mudança lenta de um plano médio para um close-up pode ser frequentemente descrita como um movimento de câmera, em vez de uma nova cena.

Defina o final, não apenas a ação

Um prompt se torna mais fácil de controlar quando explica onde a ação termina.

Em vez de terminar com “o personagem caminha em direção à janela”, defina o estado final: o personagem para ao lado da janela, vira-se para a câmera e permanece enquadrado contra o horizonte.

Isso é especialmente importante para vídeos de demonstração de produtos, takes de logo, transições e fluxos de trabalho de frames iniciais/finais.

Como Usar Imagens, Vídeos, Storyboards e Referências de Voz no MiniMax H3?

A referência para vídeo é onde o H3 se torna mais do que uma ferramenta convencional de imagem para vídeo. O modelo oficial Ref2VA aceita referências multimodais e pode usá-las para influenciar identidade, movimento, comportamento da câmera, estilo e áudio. A MiniMax atualmente documenta suporte para até nove imagens, três vídeos de referência, três clipes de áudio e um total de 12 arquivos mistos.

Dê a cada referência uma função clara

Uma configuração de referência robusta pode atribuir:

Imagem 1 → identidade do personagem; Imagem 2 → vestuário; Vídeo 1 → movimento corporal; Vídeo 2 → movimento da câmera; Áudio 1 → voz.

A documentação oficial do H3 da ComfyUI recomenda o mesmo princípio: referenciar cada entrada na ordem de conexão e declarar explicitamente qual ativo controla a identidade, estilo, movimento, câmera ou voz.

Mais referências não criam automaticamente mais controle. Elas criam mais relações para o H3 resolver. Se duas imagens implicam roupas diferentes enquanto um vídeo de referência contém outra aparência de personagem, o modelo deve decidir qual sinal é mais importante, a menos que o prompt deixe essas responsabilidades claras.

<Subject> vs <Picture>

No formato de referência completa da MiniMax, <Subject N> representa conteúdo visível reutilizável, como uma pessoa, objeto, ambiente ou outro elemento abstraído de ativos de referência. <Picture N> representa uma imagem concreta usada como um frame ou âncora de composição. <Video N> e <Audio N> rastreiam referências temporais ou de áudio.

Isso significa que um sujeito não precisa ser igual a um arquivo. Um personagem pode combinar a identidade facial de uma imagem com informações de vestuário ou movimento de outra fonte.

Quando você deve usar um storyboard?

Quando as relações espaciais se tornam mais difíceis de explicar do que de mostrar, um storyboard pode atuar como uma camada de planejamento visual. Isso é particularmente útil para sequências de múltiplos takes, revelações de produtos, bloqueio de personagens ou composições recorrentes.

Do ponto de vista de um fluxo de trabalho de vídeo com IA, a vantagem não é que um storyboard garanta cada frame. Ele reduz a quantidade de informações espaciais e de planejamento de takes que precisam ser comunicadas apenas por meio de texto.

Limites Máximos de Arquivos de Referência do MiniMax H3

Como Controlar Diálogos, Efeitos Sonoros e Música no MiniMax H3?

O H3 gera áudio estéreo nativo junto com o vídeo, em vez de tratar o áudio como uma camada separada de pós-produção. A MiniMax especifica saída estéreo de 32 kHz, e seu sistema de prompts suporta diálogos, sons físicos e música não diegética como conceitos separados.

Escreva o diálogo como parte do take

O diálogo deve responder a quatro perguntas: quem fala, o que diz, quando fala e quanto tempo de tela tem.

O formato estruturado da MiniMax pode usar IDs de locutor persistentes, como (S1), e tags de diálogo, como <d>[English]...</d>. No entanto, iniciantes não precisam começar com a sintaxe. O princípio mais importante é o timing.

O diálogo consome segundos reais.

Se um locutor aparece por quatro segundos, evite escrever uma frase que realisticamente exija oito segundos para ser entregue. Caso contrário, o modelo terá que comprimir, apressar, truncar ou distorcer a fala.

Isso é importante na prática porque os usuários locais do H3 já estão iterando no timing dos takes e no diálogo junto com o prompting visual, em vez de tratar a fala como uma camada independente. Um teste relatado com RTX 5080 usou um prompt multi-take estruturado e exigiu ajustes repetidos no prompt, enquanto a geração em si permaneceu computacionalmente cara.

Separe a paisagem sonora da música de fundo

Use a paisagem sonora para sons que existem fisicamente na cena: passos, motores, vento, portas, multidões, movimento de tecido ou máquinas.

Use música não diegética para músicas ouvidas pela audiência, mas não pelos personagens.

Separar os dois dá ao H3 uma direção mais útil do que uma instrução vaga como “adicionar áudio cinematográfico”. O formato de prompt oficial da MiniMax mantém deliberadamente essas duas camadas de áudio separadas.

Quais Configurações e Fluxo de Trabalho de Teste Produzem Melhores Resultados no MiniMax H3?

A MiniMax documenta a saída do H3 em 4–15 segundos, 24 FPS, com múltiplas proporções de aspecto e uma borda curta padrão de 768 pixels para o fluxo de trabalho H3-Base aberto. Seu sistema completo pode produzir 2K através do H3-Regenerate-2K.

Escolha duração, proporção de aspecto e resolução com base no take

Não escolha automaticamente a duração mais longa. Combine a duração com o número de eventos significativos.

Use 16:9 para a maioria do conteúdo paisagem, 9:16 para vídeo social vertical e 1:1 quando a composição quadrada serve ao canal de distribuição. No ComfyUI, os fluxos de trabalho oficiais do H3 expõem controles de proporção de aspecto e megapixels através de um Seletor de Resolução, com contagens de pixels mais altas aumentando o custo de geração.

Use uma Escada de Fidelidade de Pré-visualização

Uma pré-visualização de baixo custo é útil, mas apenas para as perguntas certas.

Testes iniciais são bons para verificar composição, movimento principal, direção da câmera, cortes e timing aproximado. Eles são menos confiáveis para avaliar texto pequeno, rostos distantes, logos ou detalhes finos do produto.

O objetivo, portanto, não é simplesmente “sempre gerar em baixa resolução primeiro”. É usar gerações mais baratas para decisões estruturais e, em seguida, gastar poder computacional nos detalhes que só se tornam visíveis em maior fidelidade.

Teste uma variável por vez

Uma sequência de produção prática é validar a cena primeiro, depois movimento e câmera, depois diálogo/áudio, depois referências ou cortes adicionais e, finalmente, a geração de alta qualidade.

Isso é importante porque o custo real do vídeo com IA é frequentemente custo de geração × número de iterações. Em um teste da comunidade, um sistema RTX 5080 produziu uma geração H3 de 15 segundos, 0,4 MP, em 10 etapas, em cerca de 11 minutos, com o tempo por etapa aumentando substancialmente à medida que a duração do vídeo aumentava. O usuário também relatou a necessidade de soluções alternativas para evitar falhas de falta de memória. Trate isso como um único caso real, não um benchmark universal.

Fluxo de Trabalho de Iteração: Custo Computacional vs. Fases de Teste

Como Usar o MiniMax H3 no ComfyUI, Fluxos de Trabalho de API e Corrigir Problemas Comuns?

O ComfyUI atualmente oferece templates oficiais do H3 para Texto para Vídeo, Imagem para Vídeo e Referência para Vídeo. Seus nós nativos usam a família FL2VA para fluxos de trabalho de texto/frame e Ref2VA para referências multimodais.

A API da MiniMax adota uma abordagem diferente: as tarefas do H3 são assíncronas. Você envia uma tarefa de geração, Context-IR ou regeneração, recebe um task_id e, em seguida, consulta essa tarefa para obter o resultado. Tarefas de geração bem-sucedidas retornam o vídeo através de content.url, enquanto o Context-IR retorna um prompt aprimorado através de content.prompt.

O sistema H3 completo também não deve ser confundido com os pesos abertos do H3-Base. A MiniMax descreve três módulos: H3-Context-IR → H3-Base → H3-Regenerate-2K. O H3-Base local valida a geração em 768p, enquanto o fluxo de trabalho completo em 2K combina o contexto original com o resultado em 768p para regeneração.

Diagnostique falhas em três níveis

Antes de reescrever o prompt, identifique a camada da falha.

CamadaProblema TípicoO Que Mudar
PromptAção, timing, câmera ou final erradosReescreva a linha do tempo
ReferênciaIdentidade, vestuário, movimento ou voz desviamEsclareça ou reduza os papéis de referência
RenderizaçãoTexto minúsculo, rostos distantes, detalhes finosTeste saída/configurações de maior fidelidade

Essa é uma distinção útil porque nem todo defeito visual é um problema de prompt.

Problemas comuns do MiniMax H3 e soluções práticas

Se a identidade desvia, simplifique referências conflitantes e defina claramente qual fonte controla a identidade. Se um produto ou logo muda, separe explicitamente os atributos que devem ser preservados dos elementos que o modelo pode redesenhar.

Se o vídeo parece apressado, reduza ações, cortes ou diálogos em vez de adicionar mais detalhes ao prompt. Se a fala soa comprimida, encurte o diálogo ou dê mais tempo ao locutor.

Para distorção de frames iniciais/finais, descreva a transição física intermediária em vez de especificar apenas dois pontos finais. Se uma referência R2V tem pouca influência, declare seu papel exato em vez de simplesmente anexá-la.

Usuários locais também devem tratar o ajuste de desempenho com cuidado. O ComfyUI documenta oficialmente o Sage Attention opcional e afirma que seus fluxos de trabalho de exemplo podem ter a velocidade de geração aproximadamente dobrada com perda mínima de qualidade, mas outras técnicas de cache, quantização e otimização experimental podem envolver diferentes trade-offs.

Conclusão

O MiniMax H3 é mais fácil de controlar quando você trata a geração de vídeo como um fluxo de trabalho de produção, em vez de uma competição de comprimento de prompt. Escolha o modo correto, atribua a cada referência uma responsabilidade específica, orce ações e diálogos dentro do tempo disponível, teste decisões estruturais antes da renderização de qualidade final e diagnostique falhas como problemas de prompt, referência ou renderização. Essa abordagem se adapta desde clipes simples de texto para vídeo até configurações multimodais complexas, refletindo como as pessoas estão criando vídeos com IA tão rapidamente hoje.

88 idiomas e 175 dialetos

Pronto para experimentar a Leadde?

Comece seu teste gratuito hoje e crie vídeos envolventes com IA em minutos.
Começar gratuitamente