Leadde Logo

MiniMax H3 사용법: 프롬프트, 레퍼런스, 오디오, ComfyUI 완벽 가이드

Leadde Team·업데이트 2026년 8월 16일·10분 읽기
MiniMax H3 사용법: 프롬프트, 레퍼런스, 오디오, ComfyUI 완벽 가이드
- 175개 이상의 언어로 300개 이상의 아바타를 활용해 AI 비디오를 제작하세요.

MiniMax H3를 가장 효과적으로 활용하려면, 먼저 올바른 생성 모드를 선택한 다음 텍스트, 프레임, 레퍼런스, 움직임, 오디오로 무엇을 제어할지 결정해야 합니다. 텍스트로 영상을 생성하거나, 첫 프레임 또는 마지막 프레임을 고정하거나, 이미지, 영상, 오디오를 활용하여 아이덴티티, 움직임, 카메라 동작, 음성을 가이드할 수 있습니다.

H3는 멀티모달 레퍼런스와 네이티브 시청각 생성을 결합하므로, 긴 프롬프트보다는 명확한 제어를 통해 더 나은 결과를 얻을 수 있습니다. 이 가이드는 올바른 워크플로우를 선택하고, 더 나은 프롬프트를 작성하며, 레퍼런스를 사용하고, 대화와 사운드를 관리하며, 효율적으로 테스트하고, ComfyUI 또는 API와 연동하는 방법을 설명합니다.

만약 시작점이 창의적인 프롬프트가 아닌 PDF, 프레젠테이션, SOP 또는 교육 문서라면, H3에서 각 장면을 수동으로 지시하기 전이나 대신에 Leadde가 구조화된 원본 콘텐츠를 영상 워크플로우로 전환하는 데 더 적합할 수 있습니다.

Leadde AI.webp

MiniMax H3 사용법: 어떤 워크플로우로 시작해야 할까요?

MiniMax H3를 가장 빠르게 사용하는 방법은 프롬프트를 작성하기 전에 생성 모드를 선택하는 것입니다. H3는 텍스트, 첫/마지막 프레임 입력, 멀티모달 레퍼런스를 지원하지만, 각 입력은 다른 역할을 수행합니다. MiniMax의 공식 모델 카드는 오픈 웨이트 체크포인트를 텍스트 및 프레임 기반 생성을 위한 FL2VA와 이미지, 영상 또는 오디오를 사용한 레퍼런스 기반 생성을 위한 Ref2VA로 구분합니다.

모드가장 적합한 용도영상을 제어하는 요소
T2VA장면을 처음부터 생성할 때텍스트 프롬프트
I2VA정확한 이미지에서 시작할 때첫 프레임 + 프롬프트
L2VA특정 엔딩에 도달할 때마지막 프레임 + 프롬프트
FL2VA시작과 끝을 모두 제어할 때첫 프레임 + 마지막 프레임
Ref2VA아이덴티티, 움직임, 카메라, 스타일 또는 음성을 유지할 때멀티모달 레퍼런스 + 프롬프트

이미지가 프레임인가요, 레퍼런스인가요?

이 구분은 많은 제어 문제를 해결합니다.

프레임은 시간적 기준점입니다. 업로드된 제품 이미지가 시청자가 보는 첫 번째 이미지여야 한다면, 이를 첫 프레임으로 사용하세요.

레퍼런스는 재사용 가능한 정보입니다. 새로운 구도를 만들면서 제품 디자인, 캐릭터 얼굴, 의상 또는 시각적 스타일만 일관되게 유지해야 한다면, 이를 레퍼런스로 취급하세요.

MiniMax의 공식 프롬프트 가이드는 이 구분을 명확히 합니다. I2VA는 제공된 이미지에서 0.00초부터 시작하는 반면, 전체 레퍼런스 모드는 각 에셋이 수행하는 역할에 따라 피사체, 그림, 영상, 오디오를 개별적으로 추적합니다.

H3 제어 스택

프롬프트를 작성하기 전에 영상의 여섯 가지 요소인 아이덴티티, 타임라인, 움직임, 카메라, 오디오, 엔딩을 무엇이 제어할지 결정하세요.

예를 들어, 상업용 영상은 제품 아이덴티티에 레퍼런스 이미지를, 제품의 동작에 텍스트를, 카메라 움직임에 레퍼런스 영상을, 사운드 디자인에 네이티브 오디오 지침을, 그리고 최종 히어로 샷에 마지막 프레임을 사용할 수 있습니다.

이는 하나의 긴 텍스트 프롬프트로 모든 것을 제어하려는 일반적인 실수를 방지합니다.

The H3 Control Stack: Vector Comparison

MiniMax H3 프롬프트로 더 강력한 제어력을 얻는 방법은 무엇인가요?

유용한 H3 프롬프트는 영상을 재생 순서대로 설명합니다. 카피라이터처럼 형용사를 나열하기보다는, 효과적인 영상 스크립트 작성법에서 사용되는 모범 사례처럼 실제로 보고 들을 수 있는 것을 묘사하는 감독처럼 생각하세요.

실용적인 구조는 다음과 같습니다.

장면 → 피사체 → 동작 → 카메라 → 대화/사운드 → 엔딩

MiniMax의 공식 기본 프롬프트 형식도 동일한 기본 논리를 따릅니다. integrated_multimodal_description은 샷을 순서대로 설명하고, overall_soundscapenon_diegetic_music은 물리적 사운드와 사운드트랙을 개별적으로 제어합니다.

재생 순서대로 장면 구성하기

다음과 같이 작성하는 대신:

극적인 움직임이 있는 프리미엄 시네마틱 스킨케어 광고.

관찰 가능한 순서를 사용하세요:

어두운 돌 받침대 위에 유리 세럼 병이 놓여 있습니다. 좁은 빛이 라벨을 스쳐 지나갑니다. 카메라가 가까이 다가가는 동안 병은 시계 방향으로 천천히 회전합니다. 응결된 물방울이 빛을 반사합니다. 병은 로고가 카메라를 향하도록 멈춥니다.

두 번째 버전은 H3가 실행할 수 있는 가시적인 상태 변화를 제공합니다.

또한 복잡성 예산을 고려하세요. 세 명의 캐릭터, 네 번의 컷, 변형, 두 줄의 대화, 움직이는 카메라, 여러 레퍼런스가 포함된 10초짜리 클립은 기술적으로 묘사할 수 있지만, 이 모든 이벤트가 10초 안에 자연스럽게 들어맞는다는 의미는 아닙니다.

카메라 움직임과 컷을 의도적으로 지시하기

카메라 동작은 샷에 기여할 때만 지정하세요: 밀어 넣기(push in), 당겨 빼기(pull back), 패닝(pan), 트래킹(track), 틸트(tilt), 아크(arc) 또는 정지.

모든 프레이밍 조정을 또 다른 컷으로 바꾸는 것을 피하세요. 미디엄 샷에서 클로즈업으로의 느린 전환은 새로운 장면보다는 카메라 움직임으로 묘사될 수 있습니다.

동작뿐만 아니라 엔딩 정의하기

동작이 어디서 끝나는지 설명할 때 프롬프트 제어가 더 쉬워집니다.

"캐릭터가 창문 쪽으로 걸어간다"로 끝내는 대신, 최종 상태를 정의하세요: 캐릭터는 창문 옆에 멈춰서 카메라를 향해 돌아서고, 스카이라인을 배경으로 프레임 안에 머무릅니다.

이는 제품 데모 영상, 로고 샷, 전환, 첫/마지막 프레임 워크플로우에 특히 중요합니다.

MiniMax H3에서 이미지, 영상, 스토리보드, 음성 레퍼런스를 사용하는 방법은 무엇인가요?

레퍼런스-투-비디오는 H3가 기존의 이미지-투-비디오 도구 이상이 되는 지점입니다. 공식 Ref2VA 모델은 멀티모달 레퍼런스를 받아 아이덴티티, 움직임, 카메라 동작, 스타일, 오디오에 영향을 줄 수 있습니다. MiniMax는 현재 최대 9개의 이미지, 3개의 레퍼런스 영상, 3개의 오디오 클립, 총 12개의 혼합 파일을 지원한다고 명시하고 있습니다.

모든 레퍼런스에 명확한 역할 부여하기

강력한 레퍼런스 설정은 다음과 같이 할당할 수 있습니다.

이미지 1 → 캐릭터 아이덴티티; 이미지 2 → 의상; 영상 1 → 신체 움직임; 영상 2 → 카메라 움직임; 오디오 1 → 음성.

ComfyUI의 공식 H3 문서는 동일한 원칙을 권장합니다: 각 입력을 연결 순서대로 참조하고, 어떤 에셋이 아이덴티티, 스타일, 움직임, 카메라 또는 음성을 제어하는지 명시적으로 밝히세요.

더 많은 레퍼런스가 자동으로 더 많은 제어를 생성하지는 않습니다. 오히려 H3가 해결해야 할 더 많은 관계를 만듭니다. 두 이미지가 다른 의상을 암시하고 레퍼런스 영상에 다른 캐릭터 모습이 포함되어 있다면, 프롬프트가 이러한 책임을 명확히 하지 않는 한 모델은 어떤 신호가 가장 중요한지 결정해야 합니다.

<Subject> vs <Picture>

MiniMax의 전체 레퍼런스 형식에서 <Subject N>은 사람, 사물, 환경 또는 레퍼런스 에셋에서 추상화된 기타 요소와 같이 재사용 가능한 가시적 콘텐츠를 나타냅니다. <Picture N>은 프레임 또는 구성 기준점으로 사용되는 구체적인 이미지를 나타냅니다. <Video N><Audio N>은 시간적 또는 오디오 레퍼런스를 추적합니다.

이는 하나의 피사체가 하나의 파일과 같을 필요가 없다는 의미입니다. 캐릭터는 한 이미지의 얼굴 아이덴티티와 다른 소스의 의상 또는 움직임 정보를 결합할 수 있습니다.

스토리보드는 언제 사용해야 할까요?

공간적 관계를 설명하는 것보다 보여주는 것이 더 어려워질 때, 스토리보드는 시각적 계획 레이어 역할을 할 수 있습니다. 이는 여러 샷 시퀀스, 제품 공개, 캐릭터 블로킹 또는 반복되는 구도에 특히 유용합니다.

AI 영상 워크플로우 관점에서 스토리보드의 장점은 모든 프레임을 보장한다는 것이 아닙니다. 이는 순수하게 글로만 전달해야 하는 공간 및 샷 계획 정보의 양을 줄여줍니다.

MiniMax H3 Maximum Reference File Limits

MiniMax H3에서 대화, 음향 효과, 음악을 제어하는 방법은 무엇인가요?

H3는 오디오를 별도의 후반 작업 레이어로 취급하지 않고 영상과 함께 네이티브 스테레오 오디오를 생성합니다. MiniMax는 32kHz 스테레오 출력을 지정하며, 프롬프트 시스템은 대화, 물리적 사운드, 비극중 음악을 별개의 개념으로 지원합니다.

샷의 일부로 대화 작성하기

대화는 네 가지 질문에 답해야 합니다: 누가 말하는지, 무엇을 말하는지, 언제 말하는지, 그리고 얼마나 많은 스크린 타임을 가지는지.

MiniMax의 구조화된 형식은 (S1)과 같은 영구적인 화자 ID와 <d>[English]...</d>와 같은 대화 태그를 사용할 수 있습니다. 그러나 초보자는 구문부터 시작할 필요는 없습니다. 더 중요한 원칙은 타이밍입니다.

대화 예산 책정하기

대화는 실제 시간을 소비합니다.

화자가 4초 동안 등장한다면, 현실적으로 8초가 필요한 문장을 작성하는 것을 피하세요. 그렇지 않으면 모델이 음성을 압축하거나, 서두르거나, 잘라내거나, 왜곡해야 합니다.

이는 실제 사용에서 중요합니다. 로컬 H3 사용자들은 이미 시각적 프롬프트와 함께 샷 타이밍 및 대화를 반복하고 있으며, 음성을 독립적인 레이어로 취급하지 않습니다. 한 RTX 5080 테스트에서는 구조화된 멀티 샷 프롬프트를 사용했으며, 생성 자체는 계산 비용이 많이 들었지만 반복적인 프롬프트 조정이 필요했다고 보고되었습니다.

사운드스케이프와 배경 음악 분리하기

장면에 물리적으로 존재하는 소리(발자국, 엔진, 바람, 문, 군중, 옷감 움직임 또는 기계)에는 사운드스케이프를 사용하세요.

관객에게는 들리지만 캐릭터에게는 들리지 않는 음악에는 **비극중 음악(non-diegetic music)**을 사용하세요.

이 둘을 분리하면 "시네마틱 오디오 추가"와 같은 모호한 지시보다 H3에 더 유용한 방향을 제시할 수 있습니다. MiniMax의 공식 프롬프트 형식은 이 두 오디오 레이어를 의도적으로 분리합니다.

MiniMax H3 결과 개선을 위한 설정 및 테스트 워크플로우는 무엇인가요?

MiniMax는 H3 출력을 4~15초, 24FPS, 여러 종횡비, 그리고 오픈 H3-Base 워크플로우의 기본 768픽셀 짧은 변으로 문서화합니다. 전체 시스템은 H3-Regenerate-2K를 통해 2K 해상도를 생성할 수 있습니다.

샷에 따라 지속 시간, 종횡비, 해상도 선택하기

가장 긴 지속 시간을 자동으로 선택하지 마세요. 의미 있는 이벤트의 수에 맞춰 지속 시간을 조정하세요.

대부분의 가로 콘텐츠에는 16:9를, 세로 소셜 영상에는 9:16을, 정사각형 구도가 배포 채널에 적합할 때는 1:1을 사용하세요. ComfyUI에서 공식 H3 워크플로우는 해상도 선택기를 통해 종횡비 및 메가픽셀 제어를 노출하며, 픽셀 수가 높을수록 생성 비용이 증가합니다.

미리보기 충실도 계층 사용하기

저비용 미리보기는 유용하지만, 올바른 질문에만 해당됩니다.

초기 테스트는 구도, 주요 움직임, 카메라 방향, 컷, 대략적인 타이밍을 확인하는 데 좋습니다. 작은 텍스트, 멀리 있는 얼굴, 로고 또는 미세한 제품 세부 사항을 평가하는 데는 신뢰도가 떨어집니다.

따라서 목표는 단순히 "항상 낮은 해상도로 먼저 생성"하는 것이 아닙니다. 구조적 결정을 위해 더 저렴한 생성을 사용한 다음, 더 높은 충실도에서만 보이는 세부 사항에 컴퓨팅 자원을 투자하는 것입니다.

한 번에 하나의 변수만 테스트하기

실용적인 제작 순서는 장면을 먼저 검증하고, 그 다음 움직임과 카메라, 그 다음 대화/오디오, 그 다음 추가 레퍼런스 또는 컷, 마지막으로 고품질 생성을 진행하는 것입니다.

이는 AI 영상의 실제 비용이 종종 생성 비용 × 반복 횟수이기 때문에 중요합니다. 한 커뮤니티 테스트에서 RTX 5080 시스템은 15초, 0.4MP, 10단계 H3 생성을 약 11분 만에 생성했으며, 영상 길이가 증가함에 따라 단계별 시간이 상당히 증가했습니다. 사용자는 또한 메모리 부족 오류를 피하기 위한 해결책이 필요했다고 보고되었습니다. 이는 보편적인 벤치마크가 아닌 단일 실제 사례로 간주해야 합니다.

Iteration Workflow: Compute Cost vs. Testing Phases

ComfyUI, API 워크플로우에서 MiniMax H3를 사용하고 일반적인 문제를 해결하는 방법은 무엇인가요?

ComfyUI는 현재 텍스트-투-비디오, 이미지-투-비디오, 레퍼런스-투-비디오를 위한 공식 H3 템플릿을 제공합니다. 네이티브 노드는 텍스트/프레임 워크플로우에 FL2VA 제품군을, 멀티모달 레퍼런스에 Ref2VA를 사용합니다.

MiniMax API는 다른 경로를 따릅니다: H3 작업은 비동기식입니다. 생성, Context-IR 또는 재생성 작업을 제출하고 task_id를 받은 다음, 해당 작업의 결과를 쿼리합니다. 성공적인 생성 작업은 content.url을 통해 영상을 반환하고, Context-IR은 content.prompt를 통해 향상된 프롬프트를 반환합니다.

완전한 H3 시스템은 오픈 H3-Base 웨이트와 혼동해서는 안 됩니다. MiniMax는 세 가지 모듈을 설명합니다: H3-Context-IR → H3-Base → H3-Regenerate-2K. 로컬 H3-Base는 768p 생성을 검증하는 반면, 전체 2K 워크플로우는 원본 컨텍스트와 768p 결과를 결합하여 재생성합니다.

세 가지 수준에서 실패 진단하기

프롬프트를 다시 작성하기 전에 실패 레이어를 식별하세요.

레이어일반적인 문제변경할 내용
프롬프트잘못된 동작, 타이밍, 카메라 또는 엔딩타임라인 재작성
레퍼런스아이덴티티, 의상, 움직임 또는 음성 이탈레퍼런스 역할 명확화 또는 축소
렌더링작은 텍스트, 멀리 있는 얼굴, 미세한 디테일더 높은 충실도 출력/설정 테스트

모든 시각적 결함이 프롬프트 문제는 아니기 때문에 이는 유용한 구분입니다.

MiniMax H3의 일반적인 문제와 실용적인 해결책

아이덴티티가 이탈한다면, 충돌하는 레퍼런스를 단순화하고 어떤 소스가 아이덴티티를 제어하는지 명확하게 정의하세요. 제품이나 로고가 변경된다면, 반드시 유지해야 할 속성과 모델이 재설계할 수 있는 요소를 명시적으로 분리하세요.

영상이 너무 서두르는 느낌이라면, 더 많은 프롬프트 세부 정보를 추가하기보다는 동작, 컷 또는 대화를 줄이세요. 음성이 압축된 것처럼 들린다면, 대화를 줄이거나 화자에게 더 많은 시간을 주세요.

첫/마지막 프레임 왜곡의 경우, 두 끝점만 지정하는 대신 중간 물리적 전환을 묘사하세요. R2V 레퍼런스의 영향이 미미하다면, 단순히 첨부하는 대신 정확한 역할을 명시하세요.

로컬 사용자들은 성능 튜닝에도 신중해야 합니다. ComfyUI는 공식적으로 선택적 Sage Attention을 문서화하고 있으며, 예시 워크플로우에서 최소한의 품질 손실로 생성 속도가 약 두 배 빨라질 수 있다고 말하지만, 다른 캐싱, 양자화 및 실험적 최적화 기술은 다른 트레이드오프를 수반할 수 있습니다.

결론

MiniMax H3는 프롬프트 길이 경쟁보다는 영상 생성을 제작 워크플로우로 다룰 때 더 쉽게 제어할 수 있습니다. 올바른 모드를 선택하고, 각 레퍼런스에 특정 책임을 할당하며, 사용 가능한 시간 내에서 동작과 대화 예산을 책정하고, 최종 품질 렌더링 전에 구조적 결정을 테스트하며, 실패를 프롬프트, 레퍼런스 또는 렌더링 문제로 진단하세요. 이러한 접근 방식은 단순한 텍스트-투-비디오 클립부터 복잡한 멀티모달 설정까지 확장되며, 오늘날 사람들이 AI 영상을 얼마나 빠르게 만드는지를 반영합니다.

88개 언어 및 175개 방언

Leadde를 사용해 보시겠어요?

오늘 무료 체험을 시작하고 몇 분 안에 매력적인 AI 비디오를 만들어보세요.