Leadde Logo

MiniMax H3 Prompt Guide: Cómo escribir mejores prompts de video, Ref2VA, cámara, audio y referencia

Leadde Team·actualizado el 16 ago 2026·19 min de lectura
MiniMax H3 Prompt Guide: Cómo escribir mejores prompts de video, Ref2VA, cámara, audio y referencia
- Crea videos con IA con más de 300 avatares en más de 175 idiomas.

Un prompt MiniMax H3 eficaz debe definir más que el estilo visual. Debe explicar qué sucede a lo largo del tiempo, cómo se mueve la cámara, qué detalles deben permanecer consistentes, qué aporta cada referencia y cómo el diálogo, el sonido y la música encajan en la secuencia. Para un mayor control, la clave es elegir el modo H3 adecuado, describir los cambios observables y asignar un rol claro a cada referencia.

Esta guía cubre T2VA, I2VA, FL2VA, L2VA, Ref2VA, el control de cámara, el audio, la consistencia de personajes y la resolución práctica de problemas. Estos principios también se aplican a flujos de trabajo de video con IA estructurados como Leadde, donde documentos, materiales de capacitación e información de productos se transforman en videos escalables con narración, avatares y salida multilingüe.

Leadde AI.webp

Guía de Prompts MiniMax H3: ¿Cuál es la Mejor Estructura de Prompt?

La forma más útil de concebir un prompt MiniMax H3 es como un brief de producción audiovisual. En lugar de acumular palabras como “cinemático,” “realista” y “dramático,” describe lo que el espectador realmente puede ver y oír a medida que el clip se desarrolla para entender cómo crear videos realistas con IA.

La Fórmula Simple del Prompt H3

Para el prompting diario, comienza con:

Subject + Action + Environment + Camera + Timing + Audio

Por ejemplo, “una mujer en una estación de tren lluviosa” establece una escena, pero no genera mucha información temporal. Un prompt más potente explica que ella camina hacia el andén, se detiene al oír un tren que se acerca, se gira hacia el sonido y es seguida por una cámara lenta en travelling.

La Guía Oficial de Prompts Base de MiniMax formaliza esta idea con tres campos: integrated_multimodal_description, overall_soundscape y non_diegetic_music. El primero contiene la línea de tiempo visual, acciones, tomas, oradores, diálogo y audio de escena sincronizado; los otros dos separan el sonido ambiental/físico de la música de fondo exclusiva para la audiencia.

Escribe Resultados Observables, No Solo Adjetivos

Una regla útil es convertir las intenciones abstractas en comportamientos visibles.

En lugar de “se ve segura,” describe cómo camina con firmeza, mantiene el contacto visual, se ajusta la chaqueta y se detiene sin dudar.

El mismo enfoque puede ayudar con las restricciones. En lugar de repetir “no hagas zoom,” describe el resultado deseado: “el sujeto permanece aproximadamente del mismo tamaño en el encuadre de principio a fin.” Una prueba de consistencia H3 de la comunidad informó que las restricciones de encuadre medibles funcionaron mejor en ese flujo de trabajo particular que repetir una instrucción negativa de cámara. Esta es una observación anecdótica del flujo de trabajo, no una garantía oficial de MiniMax.

¿Qué Modo MiniMax H3 Deberías Usar?

Elegir el modo correcto puede ser tan importante como reescribir el prompt. El flujo de trabajo Base de MiniMax soporta la generación solo de texto, además de tareas de primer fotograma, último fotograma y primer y último fotograma, mientras que su checkpoint Ref2VA separado maneja la generación de referencia multimodal.

ModoEntradaMejor Objetivo del Prompt
T2VATextoConstruir la escena audiovisual completa
I2VAPrimer fotogramaPreservar el inicio y desarrollar hacia adelante
FL2VAPrimer + último fotogramaDescribir la transición entre puntos finales
L2VAÚltimo fotogramaConstruir hacia el final proporcionado
Ref2VAImágenes/video/audioCombinar diferentes roles de referencia

T2VA, I2VA, FL2VA, y L2VA

T2VA debe establecer la escena desde cero. I2VA trata la imagen proporcionada como el primer fotograma real, por lo que el prompt debe preservar la identidad, la vestimenta, los objetos, los colores y la composición antes de introducir movimiento.

Con FL2VA, el prompt no debe limitarse a describir la Imagen 1 y la Imagen 2. MiniMax recomienda específicamente describir la trayectoria observable entre ellas: cómo se mueve el sujeto, cómo cambian las poses, cómo se manipulan los objetos y cómo la composición o la iluminación convergen en el fotograma final. L2VA invierte el proceso de razonamiento al partir de un estado anterior plausible y aterrizar gradualmente en el último fotograma proporcionado.

¿Cuándo Deberías Usar Ref2VA?

Usa Ref2VA cuando diferentes activos realizan trabajos distintos; por ejemplo, una imagen define un personaje, otra define la vestimenta, un video proporciona el movimiento al caminar y el ritmo de la cámara, y el audio suministra una referencia de voz.

Esto se entiende mejor como una generación basada en relaciones. El modelo necesita saber no solo qué contiene cada archivo, sino cómo la información de cada fuente debe influir en el video final. El formato de referencia completa de MiniMax distingue explícitamente sujetos reutilizables, anclajes de imagen concretos, fuentes temporales a nivel de video y referencias de audio.

Usa el Modo Más Simple que Pueda Resolver la Toma

Una regla práctica de producción es: no añadas complejidad de referencia a menos que la toma lo requiera.

Si una transición solo necesita un inicio y un final precisos, FL2VA le da a la tarea una definición directa. Pasa a Ref2VA cuando realmente necesites relaciones como identidad de la Imagen 1 + movimiento del Video 1 + voz del Audio 1.

Esto también facilita la depuración. Cuando compiten menos restricciones independientes, es más fácil identificar si el problema proviene del movimiento, la identidad, el encuadre o el audio.

image.png

¿Cómo Controlas las Tomas, el Movimiento de Cámara, el Tiempo y las Transiciones?

Los prompts H3 son más fáciles de controlar cuando la línea de tiempo se trata como una edición en lugar de un párrafo.

Cortes de Toma, Marcas de Tiempo y Presupuesto Temporal

El formato oficial de MiniMax no marca con tiempo [Shot 1]. Las tomas posteriores comienzan con tiempos de corte crecientes, como [Shot 2] At 00:03.500. Una nueva toma debe introducir información nueva y significativa, como un punto de vista diferente, ubicación, estado, sujeto o tiempo. Un pequeño cambio de distancia o ángulo suele expresarse mejor como movimiento de cámara que como otro corte.

Esto crea un presupuesto temporal práctico. En un clip de 8 segundos, tres acciones, dos movimientos de cámara, una reacción, una frase hablada y dos cortes compiten por la misma duración limitada. Cuando una generación se siente apresurada, eliminar eventos a menudo funciona mejor que añadir más lenguaje descriptivo.

Lenguaje de Cámara que H3 Puede Seguir

MiniMax documenta operaciones de cámara que incluyen push/pull, pan, truck, tilt, pedestal, arc, tracking, tomas estáticas, POV, roll y camera shake. Su lógica recomendada es esencialmente:

Motion Type + optional Amplitude + optional Speed

Así que, en lugar de “cámara cinematográfica dinámica,” escribe algo accionable, como “la cámara se desplaza lentamente a la derecha manteniendo el producto centrado.”

Separa lo que Debe Permanecer Fijo de lo que Puede Cambiar

Antes de generar, crea un simple mapa mental de fijo vs. variable.

Un video de producto puede requerir que la forma de la botella, el texto de la etiqueta, la tapa y el color permanezcan fijos mientras que la posición de la cámara, los reflejos, el movimiento del agua y la iluminación cambian. Una secuencia de personajes puede fijar el rostro, el peinado y el atuendo, permitiendo que la pose y la expresión evolucionen.

Esto reduce las instrucciones contradictorias porque el prompt ya no pide que cada propiedad visual cambie a la vez.

image.png

¿Cómo Usar Referencias Sin Perder la Consistencia de Personajes o Productos?

Los flujos de trabajo de referencia más potentes asignan a cada activo un propósito específico.

Asigna un Trabajo Claro a Cada Referencia

Un mapeo práctico podría ser:

Imagen 1 → identidad del personaje Imagen 2 → vestimenta Imagen 3 → diseño del producto Video 1 → movimiento al caminar y trayectoria de la cámara Audio 1 → timbre de voz

El formato oficial Ref2VA de MiniMax soporta exactamente este tipo de definición de fuente cruzada: un sujeto puede obtener la apariencia de una imagen y el movimiento de un video, mientras que un solo archivo de referencia también puede proporcionar múltiples sujetos reutilizables.

La parte importante es evitar la transferencia accidental. Si el Video 1 debe proporcionar movimiento pero no su actor o entorno, indícalo explícitamente en el diseño de la relación.

Sujetos, Imágenes, Storyboards y Video de Referencia

En la terminología oficial, <Subject N> representa contenido visible reutilizable, mientras que <Picture N> se usa cuando una imagen en sí misma sirve como un fotograma concreto, anclaje de composición o referencia de guion de video y storyboard. <Video N> representa relaciones de video completas como edición, continuación, movimiento de cámara, cortes, ritmo o estructura temporal. <Audio N> maneja la copia de audio o características como el timbre de voz, la entrega, el ritmo o el estilo musical.

Esta distinción previene un error conceptual común: una referencia de personaje no es automáticamente un fotograma clave, y un storyboard no es automáticamente un punto final exacto.

Economía de Referencia y Consistencia a Nivel de Toma

Más material de referencia no es automáticamente más informativo. En los flujos de trabajo de producción, recorta un video de referencia a la porción que demuestre claramente el movimiento, la trayectoria de la cámara o la calidad vocal que necesitas.

También evalúa la identidad a lo largo de la toma en lugar de solo en el fotograma uno. Una prueba de la comunidad encontró una deriva de identidad sustancialmente más temprana en primeros planos que en encuadres con rostros más pequeños bajo la configuración local específica de ese usuario. Los tiempos exactos no deben generalizarse, pero la lección del flujo de trabajo es útil: verifica la identidad facial, la vestimenta y los pequeños accesorios en varios puntos de cada toma importante.

¿Cómo Funciona el Prompting Avanzado de Ref2VA, Diálogo y Audio?

Ref2VA es donde el prompting H3 se asemeja más a la planificación de producción multimodal que al prompting convencional de texto a video.

La Estructura de Prompt Ref2VA de Seis Partes

La guía de referencia completa de MiniMax define seis secciones:

subject_definitionssummaryretention_analysisdetailed_descriptionoverall_soundscapenon_diegetic_music.

El sistema primero define lo que significan las referencias, luego resume la tarea, explica cómo se preserva o transfiere cada referencia y finalmente escribe el video objetivo en orden de reproducción.

Una capa de planificación útil antes de escribir el prompt formal es:

FuentePreservarTransferirIgnorar
Imagen 1Rostro, cabelloFondo
Video 1Caminar, cámaraIdentidad del actor
Audio 1Timbre de vozEntregaDiálogo original

Esto convierte una solicitud vaga como “usa todas estas referencias” en relaciones explícitas de fuente a objetivo.

Diálogo, Voz, Efectos de Sonido y Música

Los personajes que hablan usan IDs estables como (S1) y (S2), mientras que el diálogo se coloca dentro de <d>[Language] ...</d>. MiniMax también distingue el diálogo en pantalla de la voz en off y recomienda explícitamente mantener los labios de un personaje en pantalla cerrados cuando ese personaje solo está narrando.

Los sonidos ambientales y los efectos físicos pertenecen al paisaje sonoro, mientras que non_diegetic_music se reserva para la música escuchada por la audiencia en lugar de los personajes. Si quieres pasos, lluvia y sonidos de objetos pero sin banda sonora, mantén el paisaje sonoro y establece non_diegetic_music: N/A.

Prompt en Lenguaje Natural vs Prompt Estructurado Oficial

Las instrucciones cortas en lenguaje natural aún pueden funcionar en el sistema H3 alojado porque MiniMax utiliza H3-Context-IR, una capa de preprocesamiento que interpreta las relaciones entre texto, imágenes, video y audio antes de producir una representación estructurada para H3-Base. La tarjeta de modelo abierta describe el análisis de instrucciones, la asociación intermodal, la comprensión temporal y el razonamiento lógico como parte de ese proceso.

Esto explica una aparente contradicción: los prompts simples pueden ser apropiados para generaciones alojadas sencillas, mientras que los prompts estructurados se vuelven más valiosos para tareas de producción precisas con múltiples referencias, diálogo, temporización y repetibles.

¿Por Qué MiniMax H3 Ignora los Prompts y Cuál es el Mejor Flujo de Trabajo de Pruebas?

Cuando una generación falla, reescribir todo a la vez dificulta la identificación de la causa.

Problemas Comunes y Soluciones de Prompts H3

ProblemaCausa ProbablePrimera Prueba a Realizar
Persona equivocada hablaMapeo de orador poco claroFijar (S1)/(S2)
Cambios de personajeSeñales de identidad conflictivasSimplificar referencias
Referencia ignoradaRol ambiguoAsignar un trabajo
Cortes aleatoriosDemasiadas instrucciones de tomaUsar movimiento de cámara
Marca de tiempo ignoradaUsada como temporización de acciónReservarla para cortes
Saltos de FL2VARuta de transición faltanteDescribir cambios intermedios
Finales fallidosConvergencia débilFijar composición final
Música no deseadaCapas de audio mezcladasEstablecer música explícitamente
Cambios de textoRedacción no preservadaCitar texto visible exacto
Video se siente apresuradoDemasiados eventosReducir eventos

Un principio útil es realizar una comparación controlada cuando dos modos pueden resolver la misma tarea, en lugar de asumir que el modo más complejo siempre producirá el mejor clip.

Un Flujo de Trabajo de Pruebas H3 Práctico Paso a Paso

Comienza definiendo el criterio de aceptación para la generación: quizás la identidad del personaje sea lo más importante, o quizás la etiqueta del producto, la transición del punto final, la autoría del diálogo o el movimiento de cámara sean innegociables.

Luego, prueba por capas: establece primero el personaje y la escena; añade movimiento y cámara después; añade voz y sonido una vez que el comportamiento visual sea estable; introduce cortes adicionales, storyboards o personajes extra solo después de que la versión más simple funcione. La regeneración de alta resolución debe realizarse después de que el resultado semántico sea correcto, porque una mayor resolución no puede resolver relaciones de referencia contradictorias.

Este enfoque por etapas es especialmente útil en pipelines de video escalables. Para flujos de trabajo que transforman contenido de conocimiento o empresarial repetible en video, incluyendo herramientas de capacitación de documento a video como Leadde, separar la estructura del contenido, el comportamiento visual, la narración con IA y el renderizado final facilita el aislamiento de las revisiones en lugar de reconstruir toda la producción cada vez.

Guarda las Tomas Exitosas en Lugar de Regenerar Todo

Para proyectos más largos, trata cada clip exitoso como un activo de producción validado. Si la Toma 1 y la Toma 2 funcionan pero la Toma 3 falla, regenera la sección fallida en lugar de descartar todo lo anterior.

Los flujos de trabajo H3 de la comunidad ya están utilizando tomas con puntos de control por esta razón: una vez que se guarda una sección exitosa, los experimentos posteriores pueden ejecutarse de nuevo sin pagar repetidamente el costo computacional y creativo de recrear material anterior.

Esto lleva a un principio de producción más amplio:

Generar → validar → guardar → continuar.

Para el video con IA, la ingeniería de prompts eventualmente se convierte en ingeniería de flujo de trabajo.

Conclusión

El prompting MiniMax H3 funciona mejor cuando la tarea está claramente estructurada en lugar de simplemente descrita con más palabras. Elige el modo más simple que se ajuste a la toma, describe los cambios observables, separa los atributos fijos de las variables, asigna a cada referencia un rol específico y depura una capa a la vez. Para los flujos de trabajo avanzados de Ref2VA, la verdadera ventaja proviene de hacer explícitas las relaciones entre personajes, movimiento, cámara, audio y fotogramas clave, y luego convertir las generaciones exitosas en bloques de construcción reutilizables para la siguiente toma.

88 idiomas y 175 dialectos

¿Listo para probar Leadde?

Empieza una prueba gratuita hoy y crea vídeos atractivos con IA en minutos.
Comenzar gratis