Domina MiniMax H3: Guía completa de prompts, referencias, audio y ComfyUI

MiniMax H3 se utiliza mejor eligiendo primero el modo de generación adecuado y luego decidiendo qué controlar con texto, fotogramas, referencias, movimiento y audio. Puedes generar a partir de texto, fijar un fotograma inicial o final, o usar imágenes, videos y audio para guiar la identidad, el movimiento, el comportamiento de la cámara y la voz.
Dado que H3 combina referencias multimodales con generación audiovisual nativa, los mejores resultados suelen provenir de un control claro, no de prompts más largos. Esta guía explica cómo elegir el flujo de trabajo correcto, escribir prompts más efectivos, usar referencias, gestionar diálogos y sonido, probar de forma eficiente y trabajar con ComfyUI o la API.
Si tu punto de partida es un PDF, una presentación, un SOP o un documento de capacitación, en lugar de un prompt creativo, Leadde puede ser una mejor opción para transformar contenido fuente estructurado en un flujo de trabajo de video, antes o en lugar de dirigir manualmente cada escena en H3.
Cómo usar MiniMax H3: ¿Con qué flujo de trabajo deberías empezar?
La forma más rápida de usar MiniMax H3 es elegir el modo de generación antes de escribir el prompt. H3 admite entradas de texto, fotogramas iniciales/finales y referencias multimodales, pero cada entrada desempeña un papel diferente. La documentación oficial del modelo de MiniMax separa sus puntos de control de peso abierto en FL2VA para la generación basada en texto y fotogramas, y Ref2VA para la generación impulsada por referencias con imágenes, videos o audio.
| Modo | Ideal para | Qué controla el video |
| T2VA | Crear una escena desde cero | Prompt de texto |
| I2VA | Empezar desde una imagen exacta | Fotograma inicial + prompt |
| L2VA | Alcanzar un final específico | Fotograma final + prompt |
| FL2VA | Controlar tanto el inicio como el final | Fotogramas inicial + final |
| Ref2VA | Preservar identidad, movimiento, cámara, estilo o voz | Referencias multimodales + prompt |
¿Es tu imagen un fotograma o una referencia?
Esta distinción resuelve muchos problemas de control.
Un fotograma es un ancla temporal. Si una imagen de producto subida debe ser literalmente la primera imagen que vean los espectadores, úsala como fotograma inicial.
Una referencia es información reutilizable. Si solo necesitas que el diseño del producto, el rostro del personaje, el atuendo o el estilo visual se mantengan consistentes al crear una nueva composición, trátala como una referencia.
La guía oficial de prompts de MiniMax hace explícita esta distinción: I2VA comienza desde la imagen proporcionada en 0.00 segundos, mientras que el modo de referencia completa rastrea por separado sujetos, imágenes, videos y audio según el papel que desempeña cada activo.
La pila de control de H3
Antes de crear el prompt, decide qué controlará seis partes del video: identidad, línea de tiempo, movimiento, cámara, audio y final.
Por ejemplo, un video comercial podría usar una imagen de referencia para la identidad del producto, texto para la acción del producto, un video de referencia para el movimiento de la cámara, instrucciones de audio nativas para el diseño de sonido y un fotograma final para la toma heroica definitiva.
Esto evita un error común: pedirle a un único prompt de texto largo que controle todo.

¿Cómo escribir un prompt de MiniMax H3 que te dé más control?
Un prompt de H3 útil describe el video en orden de reproducción. Piensa como un director que describe lo que realmente se puede ver y oír, en lugar de un copywriter que enumera adjetivos, muy parecido a las mejores prácticas utilizadas para escribir un guion de video efectivo.
Una estructura práctica es:
Escena → Sujeto → Acción → Cámara → Diálogo/Sonido → Final
El formato de prompt base oficial de MiniMax sigue la misma lógica subyacente. Su integrated_multimodal_description describe las tomas en secuencia, mientras que overall_soundscape y non_diegetic_music controlan por separado el sonido físico y la banda sonora.
Construye la escena en orden de reproducción
En lugar de:
Un anuncio cinematográfico premium de cuidado de la piel con movimiento dramático.
Usa una secuencia observable:
Un frasco de suero de vidrio se alza sobre un pedestal de piedra oscura. Una luz estrecha barre la etiqueta. El frasco gira lentamente en el sentido de las agujas del reloj mientras la cámara se acerca. La condensación atrapa la luz. El frasco se detiene con el logo mirando a la cámara.
La segunda versión le da a H3 cambios de estado visibles para ejecutar.
Considera también un presupuesto de complejidad. Un clip de 10 segundos con tres personajes, cuatro cortes, una transformación, dos líneas de diálogo, una cámara en movimiento y varias referencias puede ser técnicamente descriptible, pero eso no significa que todos esos eventos encajen naturalmente en diez segundos.
Dirige el movimiento de cámara y los cortes intencionalmente
Especifica el comportamiento de la cámara solo cuando contribuya a la toma: acercar, alejar, panoramizar, seguir, inclinar, arquear o permanecer estática.
Evita convertir cada ajuste de encuadre en otro corte. Un cambio lento de un plano medio a un primer plano a menudo puede describirse como un movimiento de cámara en lugar de una nueva escena.
Define el final, no solo la acción
Un prompt es más fácil de controlar cuando explica dónde termina la acción.
En lugar de terminar con “el personaje camina hacia la ventana”, define el estado final: el personaje se detiene junto a la ventana, se gira hacia la cámara y permanece encuadrado contra el horizonte.
Esto es especialmente importante para videos de demostración de productos, tomas de logotipos, transiciones y flujos de trabajo de fotogramas iniciales/finales.
¿Cómo usar imágenes, videos, storyboards y referencias de voz en MiniMax H3?
La funcionalidad de referencia a video es donde H3 se convierte en algo más que una herramienta convencional de imagen a video. El modelo oficial Ref2VA acepta referencias multimodales y puede usarlas para influir en la identidad, el movimiento, el comportamiento de la cámara, el estilo y el audio. MiniMax documenta actualmente soporte para hasta nueve imágenes, tres videos de referencia, tres clips de audio y un total de 12 archivos mixtos.
Asigna a cada referencia una tarea clara
Una configuración de referencia sólida podría asignar:
Imagen 1 → identidad del personaje; Imagen 2 → vestuario; Video 1 → movimiento corporal; Video 2 → movimiento de cámara; Audio 1 → voz.
La documentación oficial de H3 de ComfyUI recomienda el mismo principio: referenciar cada entrada en orden de conexión y establecer explícitamente qué activo controla la identidad, el estilo, el movimiento, la cámara o la voz.
Más referencias no crean automáticamente más control. Crean más relaciones que H3 debe resolver. Si dos imágenes implican atuendos diferentes mientras un video de referencia contiene otra apariencia de personaje, el modelo debe decidir qué señal es más importante, a menos que el prompt aclare esas responsabilidades.
<Subject> vs <Picture>
En el formato de referencia completa de MiniMax, <Subject N> representa contenido visible reutilizable como una persona, objeto, entorno o otro elemento abstraído de los activos de referencia. <Picture N> representa una imagen concreta utilizada como fotograma o ancla de composición. <Video N> y <Audio N> rastrean referencias temporales o de audio.
Esto significa que un sujeto no tiene por qué equivaler a un archivo. Un personaje podría combinar la identidad facial de una imagen con información de vestuario o movimiento de otra fuente.
¿Cuándo deberías usar un storyboard?
Cuando las relaciones espaciales son más difíciles de explicar que de mostrar, un storyboard puede actuar como una capa de planificación visual. Esto es particularmente útil para secuencias de múltiples tomas, revelaciones de productos, posicionamiento de personajes o composiciones recurrentes.
Desde la perspectiva de un flujo de trabajo de video con IA, la ventaja no es que un storyboard garantice cada fotograma. Reduce la cantidad de información espacial y de planificación de tomas que debe comunicarse solo a través de la prosa.

¿Cómo controlar diálogos, efectos de sonido y música en MiniMax H3?
H3 genera audio estéreo nativo junto con el video, en lugar de tratar el audio como una capa de postproducción separada. MiniMax especifica una salida estéreo de 32 kHz, y su sistema de prompting soporta diálogos, sonidos físicos y música no diegética como conceptos separados.
Escribe el diálogo como parte de la toma
El diálogo debe responder a cuatro preguntas: quién habla, qué dice, cuándo habla y cuánto tiempo de pantalla tiene.
El formato estructurado de MiniMax puede usar IDs de orador persistentes como (S1) y etiquetas de diálogo como <d>[English]...</d>. Sin embargo, los principiantes no necesitan empezar con la sintaxis. El principio más importante es la sincronización.
Usa un presupuesto de diálogo
El diálogo consume segundos reales.
Si un orador aparece durante cuatro segundos, evita escribir una frase que, de forma realista, requiera ocho segundos para ser pronunciada. De lo contrario, el modelo deberá comprimir, acelerar, truncar o distorsionar el discurso.
Esto es importante en la práctica porque los usuarios locales de H3 ya están iterando en la sincronización de tomas y el diálogo junto con el prompting visual, en lugar de tratar el habla como una capa independiente. Una prueba reportada con RTX 5080 utilizó un prompt estructurado de múltiples tomas y requirió ajustes repetidos del prompt, mientras que la generación en sí misma seguía siendo computacionalmente costosa.
Separa el paisaje sonoro de la música de fondo
Usa el paisaje sonoro para los sonidos que existen físicamente en la escena: pasos, motores, viento, puertas, multitudes, movimiento de telas o maquinaria.
Usa la música no diegética para la música que escucha la audiencia, pero no los personajes.
Separar ambos le da a H3 una dirección más útil que una instrucción vaga como “añadir audio cinematográfico”. El formato de prompt oficial de MiniMax mantiene deliberadamente estas dos capas de audio separadas.
¿Qué configuraciones y flujo de trabajo de prueba producen mejores resultados en MiniMax H3?
MiniMax documenta una salida de H3 de 4 a 15 segundos, 24 FPS, con múltiples relaciones de aspecto y un borde corto predeterminado de 768 píxeles para el flujo de trabajo abierto H3-Base. Su sistema completo puede producir 2K a través de H3-Regenerate-2K.
Elige la duración, relación de aspecto y resolución según la toma
No elijas automáticamente la duración más larga. Ajusta la duración al número de eventos significativos.
Usa 16:9 para la mayoría del contenido horizontal, 9:16 para videos sociales verticales y 1:1 cuando la composición cuadrada sirva al canal de distribución. En ComfyUI, los flujos de trabajo oficiales de H3 exponen controles de relación de aspecto y megapíxeles a través de un Selector de Resolución, donde un mayor número de píxeles aumenta el costo de generación.
Usa una escalera de fidelidad de previsualización
Una previsualización de bajo costo es útil, pero solo para las preguntas correctas.
Las pruebas iniciales son buenas para verificar la composición, el movimiento principal, la dirección de la cámara, los cortes y la sincronización aproximada. Son menos fiables para evaluar texto pequeño, rostros distantes, logotipos o detalles finos del producto.
El objetivo, por lo tanto, no es simplemente “generar siempre en baja resolución primero”. Es usar generaciones más económicas para decisiones estructurales, y luego invertir el cómputo en los detalles que solo se hacen visibles con mayor fidelidad.
Prueba una variable a la vez
Una secuencia de producción práctica es validar primero la escena, luego el movimiento y la cámara, después el diálogo/audio, luego las referencias o cortes adicionales, y finalmente la generación de alta calidad.
Esto importa porque el costo real del video con IA a menudo es costo de generación × número de iteraciones. En una prueba de la comunidad, un sistema RTX 5080 produjo una generación H3 de 15 segundos, 0.4 MP y 10 pasos en aproximadamente 11 minutos, con un tiempo por paso aumentando sustancialmente a medida que la duración del video se incrementaba. El usuario también informó la necesidad de soluciones alternativas para evitar fallos por falta de memoria. Trata esto como un caso real único, no como un benchmark universal.

¿Cómo usar MiniMax H3 en ComfyUI, flujos de trabajo de API y solucionar problemas comunes?
ComfyUI ofrece actualmente plantillas oficiales de H3 para Texto a Video, Imagen a Video y Referencia a Video. Sus nodos nativos utilizan la familia FL2VA para flujos de trabajo de texto/fotogramas y Ref2VA para referencias multimodales.
La API de MiniMax toma una ruta diferente: las tareas de H3 son asíncronas. Envías una tarea de generación, Context-IR o regeneración, recibes un task_id y luego consultas esa tarea para obtener el resultado. Las tareas de generación exitosas devuelven el video a través de content.url, mientras que Context-IR devuelve un prompt mejorado a través de content.prompt.
El sistema H3 completo tampoco debe confundirse con los pesos abiertos de H3-Base. MiniMax describe tres módulos: H3-Context-IR → H3-Base → H3-Regenerate-2K. H3-Base local valida la generación de 768p, mientras que el flujo de trabajo completo de 2K combina el contexto original con el resultado de 768p para la regeneración.
Diagnostica fallos en tres niveles
Antes de reescribir el prompt, identifica la capa del fallo.
| Capa | Problema Típico | Qué cambiar |
| Prompt | Acción, sincronización, cámara o final incorrectos | Reescribe la línea de tiempo |
| Referencia | Deriva de identidad, vestuario, movimiento o voz | Aclara o reduce los roles de referencia |
| Renderizado | Texto diminuto, rostros distantes, detalles finos | Prueba configuraciones/salidas de mayor fidelidad |
Esta es una distinción útil porque no todos los defectos visuales son un problema de prompting.
Problemas comunes de MiniMax H3 y soluciones prácticas
Si la identidad se desvía, simplifica las referencias conflictivas y define claramente qué fuente controla la identidad. Si un producto o logotipo cambia, separa explícitamente los atributos que deben preservarse de los elementos que el modelo puede rediseñar.
Si el video se siente apresurado, reduce las acciones, los cortes o el diálogo en lugar de añadir más detalles al prompt. Si el habla suena comprimida, acorta el diálogo o dale más tiempo al orador.
Para la deformación de fotogramas iniciales/finales, describe la transición física intermedia en lugar de especificar solo dos puntos finales. Si una referencia R2V tiene poca influencia, indica su rol exacto en lugar de simplemente adjuntarla.
Los usuarios locales también deben tratar la optimización del rendimiento con cuidado. ComfyUI documenta oficialmente la atención Sage Attention opcional y afirma que sus flujos de trabajo de ejemplo pueden ver una velocidad de generación aproximadamente duplicada con una pérdida mínima de calidad, pero otras técnicas de almacenamiento en caché, cuantificación y optimización experimental pueden implicar diferentes compensaciones.
Conclusión
MiniMax H3 es más fácil de controlar cuando tratas la generación de video como un flujo de trabajo de producción, en lugar de un concurso de longitud de prompts. Elige el modo correcto, asigna a cada referencia una responsabilidad específica, presupuesta acciones y diálogos dentro del tiempo disponible, prueba las decisiones estructurales antes del renderizado de calidad final y diagnostica los fallos como problemas de prompt, referencia o renderizado. Ese enfoque se adapta desde simples clips de texto a video hasta configuraciones multimodales complejas, reflejando cómo la gente está creando videos con IA tan rápido hoy en día.








