Leadde Logo

MiniMax H3 프롬프트 가이드: 더 나은 비디오, Ref2VA, 카메라, 오디오 및 레퍼런스 프롬프트 작성법

Leadde Team·업데이트 2026년 8월 16일·10분 읽기
MiniMax H3 프롬프트 가이드: 더 나은 비디오, Ref2VA, 카메라, 오디오 및 레퍼런스 프롬프트 작성법
- 175개 이상의 언어로 300개 이상의 아바타를 활용하여 AI 비디오를 제작하세요.

강력한 MiniMax H3 프롬프트는 시각적 스타일 그 이상을 정의해야 합니다. 시간의 흐름에 따른 변화, 카메라 움직임, 일관성을 유지해야 할 세부 사항, 각 레퍼런스의 역할, 그리고 대화, 사운드, 음악이 시퀀스에 어떻게 어우러지는지를 설명해야 합니다. 더 나은 제어를 위해서는 올바른 H3 모드를 선택하고, 관찰 가능한 변화를 묘사하며, 각 레퍼런스에 명확한 역할을 부여하는 것이 핵심입니다.

이 가이드는 T2VA, I2VA, FL2VA, L2VA, Ref2VA, 카메라 제어, 오디오, 캐릭터 일관성, 그리고 실용적인 문제 해결 방법을 다룹니다. 이러한 원칙들은 Leadde와 같은 구조화된 AI 비디오 워크플로우에도 적용됩니다. Leadde에서는 문서, 교육 자료, 제품 정보가 확장 가능한 비디오로 변환되며, 내레이션, 아바타, 다국어 출력을 지원합니다.

Leadde AI.webp

MiniMax H3 프롬프트 가이드: 최적의 프롬프트 구조는 무엇인가요?

MiniMax H3 프롬프트를 이해하는 가장 유용한 방법은 시청각 제작 브리프로 생각하는 것입니다. 단순히 "시네마틱", "사실적", "극적"과 같은 단어를 늘어놓기보다는, 클립이 전개되면서 시청자가 실제로 보고 들을 수 있는 것을 묘사하여 사실적인 AI 비디오를 만드는 방법을 명확히 이해해야 합니다.

간단한 H3 프롬프트 공식

일상적인 프롬프트 작성 시 다음으로 시작하세요:

주제 + 행동 + 환경 + 카메라 + 타이밍 + 오디오

예를 들어, "비 오는 기차역의 한 여성"은 장면을 설정하지만, 시간적 정보를 충분히 제공하지 못합니다. 더 강력한 프롬프트는 그녀가 플랫폼으로 걸어가다가 다가오는 기차 소리를 듣고 멈춰 서서 소리 쪽으로 몸을 돌리고, 느린 트래킹 카메라가 그녀를 따라가는 상황을 설명합니다.

MiniMax의 공식 기본 프롬프트 가이드는 이 아이디어를 integrated_multimodal_description, overall_soundscape, non_diegetic_music 세 가지 필드로 공식화합니다. 첫 번째 필드는 시각적 타임라인, 행동, 샷, 화자, 대화, 동기화된 장면 오디오를 담고 있으며, 나머지 두 필드는 환경/물리적 사운드와 시청자만 듣는 배경 음악을 분리합니다.

단순히 형용사가 아닌, 관찰 가능한 결과를 작성하세요

유용한 규칙은 추상적인 의도를 가시적인 행동으로 전환하는 것입니다.

"그녀는 자신감 있어 보인다" 대신, 그녀가 흔들림 없이 걷고, 눈을 마주치며, 재킷을 똑바로 고쳐 입고, 망설임 없이 멈춰 서는 모습을 묘사하세요.

동일한 접근 방식은 제약 조건 설정에도 유용합니다. **"확대하지 마세요"**를 반복하는 대신, 의도하는 결과를 묘사하세요: "피사체가 처음부터 끝까지 프레임 내에서 거의 동일한 크기를 유지합니다." 한 커뮤니티 H3 일관성 테스트에 따르면, 측정 가능한 프레이밍 제약 조건이 부정적인 카메라 지시를 반복하는 것보다 특정 워크플로우에서 더 효과적이었습니다. 이는 일화적인 워크플로우 관찰이며, MiniMax의 공식적인 보장은 아닙니다.

어떤 MiniMax H3 모드를 사용해야 할까요?

올바른 모드 선택은 프롬프트 재작성만큼이나 중요합니다. MiniMax의 기본 워크플로우는 텍스트 전용 생성과 첫 프레임, 마지막 프레임, 그리고 첫 프레임과 마지막 프레임 작업을 지원하며, 별도의 Ref2VA 체크포인트는 멀티모달 레퍼런스 생성을 처리합니다.

모드입력최적의 프롬프트 목표
T2VAText전체 시청각 장면 구축
I2VAFirst frame시작을 보존하고 앞으로 전개
FL2VAFirst + last frame시작점과 끝점 사이의 전환 묘사
L2VALast frame제공된 엔딩을 향해 구축
Ref2VAImages/video/audio다양한 레퍼런스 역할 결합

T2VA, I2VA, FL2VA, L2VA

T2VA는 장면을 처음부터 설정해야 합니다. I2VA는 제공된 그림을 실제 첫 프레임으로 간주하므로, 프롬프트는 움직임을 도입하기 전에 정체성, 의상, 사물, 색상, 구도를 보존해야 합니다.

FL2VA를 사용할 때는 프롬프트가 단순히 그림 1과 그림 2를 묘사하는 것을 넘어섭니다. MiniMax는 피사체가 어떻게 움직이는지, 포즈가 어떻게 변하는지, 사물이 어떻게 조작되는지, 그리고 구도나 조명이 최종 프레임으로 어떻게 수렴하는지 등, 두 프레임 사이의 관찰 가능한 경로를 구체적으로 묘사할 것을 권장합니다. L2VA는 그 반대로, 그럴듯한 이전 상태에서 시작하여 점진적으로 제공된 마지막 프레임에 도달하도록 추론 과정을 역전시킵니다.

Ref2VA는 언제 사용해야 할까요?

Ref2VA는 서로 다른 에셋이 각기 다른 역할을 수행할 때 사용합니다. 예를 들어, 한 이미지는 캐릭터를 정의하고, 다른 이미지는 의상을 정의하며, 비디오는 걷는 움직임과 카메라 리듬을 제공하고, 오디오는 음성 레퍼런스를 제공하는 경우입니다.

이는 관계 중심 생성으로 이해하는 것이 가장 좋습니다. 모델은 각 파일에 무엇이 포함되어 있는지뿐만 아니라, 각 소스의 정보가 최종 비디오에 어떻게 영향을 미쳐야 하는지를 알아야 합니다. MiniMax의 전체 레퍼런스 형식은 재사용 가능한 피사체, 구체적인 그림 앵커, 비디오 수준의 시간적 소스, 오디오 레퍼런스를 명확하게 구분합니다.

샷을 해결할 수 있는 가장 간단한 모드를 사용하세요

실용적인 제작 규칙은 다음과 같습니다: 샷에 필요하지 않다면 레퍼런스 복잡성을 추가하지 마세요.

전환에 정확한 시작과 끝만 필요하다면, FL2VA가 작업을 명확하게 정의해 줍니다. 이미지 1에서 정체성 + 비디오 1에서 움직임 + 오디오 1에서 음성과 같은 관계가 진정으로 필요할 때 Ref2VA로 전환하세요.

이는 디버깅을 더 쉽게 만듭니다. 독립적인 제약 조건이 적을수록 문제가 움직임, 정체성, 프레이밍 또는 오디오 중 어디에서 발생하는지 파악하기 쉽습니다.

image.png

샷, 카메라 움직임, 타이밍, 전환을 어떻게 제어하나요?

타임라인을 문단이 아닌 편집처럼 다룰 때 H3 프롬프트 제어가 더 쉬워집니다.

샷 컷, 타임스탬프, 시간 예산

MiniMax의 공식 형식은 [Shot 1]에 타임스탬프를 사용하지 않습니다. 이후 샷은 [Shot 2] At 00:03.500과 같이 증가하는 컷 시간으로 시작합니다. 새로운 샷은 다른 시점, 위치, 상태, 피사체 또는 시간과 같은 의미 있는 새로운 정보를 도입해야 합니다. 작은 거리 또는 각도 변화는 다른 컷보다는 카메라 움직임으로 표현하는 것이 일반적으로 더 좋습니다.

이는 실용적인 시간 예산을 설정하게 합니다. 8초짜리 클립에서 세 가지 행동, 두 가지 카메라 움직임, 반응, 한 문장의 대화, 두 번의 컷이 모두 동일한 제한된 시간 동안 경쟁합니다. 생성이 너무 급하게 느껴질 때, 더 많은 묘사적인 언어를 추가하는 것보다 이벤트를 제거하는 것이 종종 더 효과적입니다.

H3가 따를 수 있는 카메라 언어

MiniMax는 푸시/풀, 팬, 트럭, 틸트, 페데스탈, 아크, 트래킹, 정지 샷, POV, 롤, 카메라 흔들림 등 다양한 카메라 작동을 문서화합니다. 권장되는 논리는 본질적으로 다음과 같습니다:

움직임 유형 + 선택적 진폭 + 선택적 속도

따라서 "역동적인 시네마틱 카메라" 대신, **"카메라가 제품을 중앙에 유지하면서 천천히 오른쪽으로 트럭킹합니다"**와 같이 실행 가능한 것을 작성하세요.

고정되어야 할 것과 변경될 수 있는 것을 분리하세요

생성하기 전에 간단한 정신적 고정-대-가변 맵을 만드세요.

제품 비디오에서는 카메라 위치, 반사, 물의 움직임, 조명이 변하더라도 병 모양, 라벨 텍스트, 캡, 색상은 고정되어야 할 수 있습니다. 캐릭터 시퀀스는 얼굴, 헤어스타일, 의상을 고정하고 포즈와 표정은 변화하도록 허용할 수 있습니다.

이는 프롬프트가 모든 시각적 속성을 한 번에 변경하도록 요구하지 않으므로 모순된 지시를 줄여줍니다.

image.png

캐릭터 또는 제품 일관성을 잃지 않고 레퍼런스를 어떻게 사용하나요?

가장 강력한 레퍼런스 워크플로우는 모든 에셋에 특정 목적을 할당합니다.

모든 레퍼런스에 하나의 명확한 역할을 부여하세요

실용적인 매핑은 다음과 같습니다:

이미지 1 → 캐릭터 정체성 이미지 2 → 의상 이미지 3 → 제품 디자인 비디오 1 → 걷는 움직임 및 카메라 경로 오디오 1 → 음성 음색

MiniMax의 공식 Ref2VA 형식은 바로 이러한 교차 소스 정의를 지원합니다. 하나의 피사체가 그림에서 외형을 얻고 비디오에서 움직임을 얻을 수 있으며, 단일 레퍼런스 파일이 여러 재사용 가능한 피사체를 제공할 수도 있습니다.

중요한 점은 의도치 않은 전송을 피하는 것입니다. 비디오 1이 움직임만 제공하고 배우나 환경은 제공하지 않아야 한다면, 관계 설계에서 이를 명시적으로 언급하세요.

피사체, 그림, 스토리보드, 레퍼런스 비디오

공식 용어에서 <Subject N>은 재사용 가능한 가시적 콘텐츠를 나타내고, <Picture N>은 이미지 자체가 구체적인 프레임, 구도 앵커 또는 비디오 스크립트 및 스토리보드 레퍼런스 역할을 할 때 사용됩니다. <Video N>은 편집, 연속성, 카메라 움직임, 컷, 리듬 또는 시간 구조와 같은 전체 비디오 관계를 나타냅니다. <Audio N>은 오디오 복사 또는 음성 음색, 전달 방식, 리듬, 음악 스타일과 같은 특성을 처리합니다.

이러한 구분은 흔한 개념적 오류를 방지합니다: 캐릭터 레퍼런스가 자동으로 키프레임이 아니며, 스토리보드가 자동으로 정확한 끝점이 아닙니다.

레퍼런스 경제성과 샷 수준 일관성

레퍼런스 자료가 많다고 해서 자동으로 더 많은 정보를 제공하는 것은 아닙니다. 제작 워크플로우에서는 필요한 움직임, 카메라 경로 또는 음성 품질을 명확하게 보여주는 부분으로 레퍼런스 비디오를 다듬으세요.

또한 첫 프레임에서만 평가하지 말고, 샷 전체에 걸쳐 정체성을 평가하세요. 한 커뮤니티 테스트에서는 특정 사용자 환경에서 작은 얼굴 프레이밍보다 클로즈업에서 정체성 이탈이 훨씬 더 일찍 발생하는 것을 발견했습니다. 정확한 타이밍은 일반화될 수 없지만, 워크플로우 교훈은 유용합니다: 각 중요한 샷의 여러 지점에서 얼굴 정체성, 의상, 작은 소품을 확인하세요.

고급 Ref2VA, 대화, 오디오 프롬프트는 어떻게 작동하나요?

Ref2VA는 H3 프롬프트가 기존의 텍스트-투-비디오 프롬프트 작성보다 멀티모달 제작 계획에 더 가까워지는 지점입니다.

Ref2VA의 6단계 프롬프트 구조

MiniMax의 전체 레퍼런스 가이드는 여섯 가지 섹션을 정의합니다:

subject_definitionssummaryretention_analysisdetailed_descriptionoverall_soundscapenon_diegetic_music.

시스템은 먼저 레퍼런스가 무엇을 의미하는지 정의하고, 작업을 요약하며, 각 레퍼런스가 어떻게 보존되거나 전송되는지 설명한 다음, 최종적으로 재생 순서대로 대상 비디오를 작성합니다.

공식 프롬프트를 작성하기 전 유용한 계획 단계는 다음과 같습니다:

소스보존전송무시
Image 1얼굴, 머리카락배경
Video 1걷기, 카메라배우 정체성
Audio 1음성 음색전달 방식원본 대화

이는 "이 모든 레퍼런스를 사용하세요"와 같은 모호한 요청을 명시적인 소스-대상 관계로 전환합니다.

대화, 음성, 음향 효과, 음악

말하는 캐릭터는 (S1)(S2)와 같은 안정적인 ID를 사용하며, 대화는 <d>[Language] ...</d> 안에 배치됩니다. MiniMax는 또한 화면 내 대화와 화면 밖 내레이션을 구분하며, 화면 내 캐릭터가 내레이션만 할 때는 입을 다물도록 명시적으로 권장합니다.

환경 소리와 물리적 효과는 사운드스케이프에 포함되며, non_diegetic_music은 캐릭터가 아닌 시청자가 듣는 음악을 위해 사용됩니다. 발자국 소리, 빗소리, 사물 소리는 원하지만 배경 음악은 원하지 않는다면, 사운드스케이프를 유지하고 non_diegetic_music: N/A로 설정하세요.

자연어 프롬프트 vs 공식 구조화된 프롬프트

짧은 자연어 지시도 호스팅된 H3 시스템에서 여전히 작동합니다. 이는 MiniMax가 텍스트, 이미지, 비디오, 오디오 간의 관계를 해석하여 H3-Base를 위한 구조화된 표현을 생성하기 전 전처리 계층인 H3-Context-IR을 사용하기 때문입니다. 공개 모델 카드는 지시어 파싱, 교차 모달 연관성, 시간적 이해, 논리적 추론을 해당 프로세스의 일부로 설명합니다.

이는 다음과 같은 명백한 모순을 설명합니다. 간단한 프롬프트는 간단한 호스팅 생성에 적합할 수 있지만, 구조화된 프롬프트는 정밀한 다중 레퍼런스, 대화, 타이밍, 반복 가능한 제작 작업에 더 가치가 있습니다.

MiniMax H3가 프롬프트를 무시하는 이유는 무엇이며, 최적의 테스트 워크플로우는 무엇인가요?

생성이 실패했을 때, 모든 것을 한 번에 다시 작성하면 원인을 파악하기 더 어려워집니다.

일반적인 H3 프롬프트 문제 및 해결책

문제가능한 원인가장 먼저 테스트할 것
잘못된 사람이 말함화자 매핑 불분명(S1)/(S2) 고정
캐릭터 변경충돌하는 정체성 신호레퍼런스 단순화
레퍼런스 무시됨역할이 모호함하나의 역할 할당
무작위 컷너무 많은 샷 지시카메라 움직임 사용
타임스탬프 무시됨행동 타이밍으로 사용됨컷을 위해 예약
FL2VA 점프전환 경로 누락중간 변화 묘사
엔딩 불일치약한 수렴최종 구도 고정
원치 않는 음악오디오 레이어 혼합음악 명시적으로 설정
텍스트 변경문구 보존 안 됨정확한 가시 텍스트 인용
비디오가 급하게 느껴짐너무 많은 이벤트비트 줄이기

유용한 원칙은 두 가지 모드가 동일한 작업을 해결할 수 있을 때, 더 복잡한 모드가 항상 더 나은 클립을 생성할 것이라고 가정하기보다는 통제된 비교를 실행하는 것입니다.

실용적인 단계별 H3 테스트 워크플로우

생성을 위한 수용 기준을 정의하는 것부터 시작하십시오. 아마도 캐릭터 정체성이 가장 중요하거나, 제품 라벨, 끝점 전환, 대화 소유권 또는 카메라 움직임이 협상 불가능한 요소일 수 있습니다.

그런 다음 계층별로 테스트하십시오. 먼저 캐릭터와 장면을 설정하고; 다음으로 움직임과 카메라를 추가하며; 시각적 행동이 안정된 후 음성과 사운드를 추가하고; 더 간단한 버전이 작동한 후에만 추가 컷, 스토리보드 또는 추가 캐릭터를 도입하세요. 고해상도 재생성은 의미론적 결과가 올바른 후에 이루어져야 합니다. 고해상도가 모순된 레퍼런스 관계를 해결할 수는 없기 때문입니다.

이러한 단계별 접근 방식은 확장 가능한 비디오 파이프라인에서 특히 유용합니다. Leadde와 같은 문서-비디오 교육 도구를 포함하여 반복 가능한 지식이나 비즈니스 콘텐츠를 비디오로 전환하는 워크플로우의 경우, 콘텐츠 구조, 시각적 행동, AI 내레이션, 최종 렌더링을 분리하면 매번 전체 제작물을 다시 만드는 대신 수정 사항을 더 쉽게 분리할 수 있습니다.

모든 것을 다시 생성하는 대신 성공적인 샷을 저장하세요

더 긴 프로젝트의 경우, 성공적인 각 클립을 검증된 제작 에셋으로 취급하십시오. 샷 1과 샷 2는 작동하지만 샷 3이 실패한다면, 이전의 모든 것을 버리는 대신 실패한 섹션만 다시 생성하세요.

커뮤니티 H3 워크플로우는 이러한 이유로 이미 체크포인트된 샷을 활용하고 있습니다. 성공적인 섹션이 저장되면, 이전 자료를 다시 만드는 데 드는 계산 및 창의적 비용을 반복적으로 지불하지 않고도 후속 실험을 다시 실행할 수 있습니다.

이는 더 넓은 제작 원칙으로 이어집니다:

생성 → 검증 → 저장 → 계속.

AI 비디오의 경우, 프롬프트 엔지니어링은 결국 워크플로우 엔지니어링이 됩니다.

결론

MiniMax H3 프롬프트는 단순히 많은 단어로 묘사하기보다 작업이 명확하게 구조화될 때 가장 효과적입니다. 샷에 맞는 가장 간단한 모드를 선택하고, 관찰 가능한 변화를 묘사하며, 고정된 속성과 가변적인 속성을 분리하고, 모든 레퍼런스에 특정 역할을 할당하며, 한 번에 한 계층씩 디버깅하세요. 고급 Ref2VA 워크플로우의 경우, 캐릭터, 움직임, 카메라, 오디오, 키프레임 간의 관계를 명시적으로 설정하고, 성공적인 생성을 다음 샷을 위한 재사용 가능한 빌딩 블록으로 전환하는 데서 진정한 이점이 나옵니다.

88개 언어 및 175개 방언

Leadde를 사용해 보시겠어요?

오늘 무료 체험을 시작하고 몇 분 안에 매력적인 AI 비디오를 만들어보세요.