중국 인공지능 기업 MiniMax가 7월 31일 범용 멀티모달 영상 생성 모델 MiniMax H3를 정식 출시했다. H3는 텍스트, 이미지, 영상, 오디오를 함께 참조해 최대 2K, 15초 영상을 네이티브 스테레오 음향과 함께 만든다. 일반 사용자는 Hailuo AI에서, 개발자는 MiniMax API에서 바로 이용할 수 있다.[1][2][3][4][5] 8월 1일 오후 4시 34분 기준 Artificial Analysis의 블라인드 사용자 평가에서는 음향을 포함한 영상 편집 1위, 텍스트 영상 2위를 유지했다. MiniMax는 H3를 공개 가중치(open weight) 모델로 수일 내 배포할 계획이다.[6][7][8][2]
텍스트, 이미지, 영상, 오디오를 한 맥락으로 처리
MiniMax는 H3가 대상 영상뿐 아니라 참조 입력 사이의 관계도 해석하도록 설계됐다고 설명했다. 카메라 움직임이 담긴 영상, 인물이 있는 이미지, 노래가 들어 있는 오디오를 함께 넣어 새 영상을 만들거나 기존 영상의 인물과 동작을 바꾸는 방식이다. 텍스트 프롬프트는 모든 요청에 필요하며 참조 입력은 이미지 최대 9장, 영상 최대 3개, 오디오 최대 3개까지 넣을 수 있다.[2][5][9]
기존에는 인물 참조, 움직임 전이, 음성과 음악 결합을 서로 다른 생성과 편집 단계로 나누는 경우가 많았다. H3가 약속하는 변화는 여러 자료의 관계를 자연어로 지정해 한 요청에서 생성과 편집을 이어가는 것이다. MiniMax가 발표에서 내세운 “Open Weights”는 현재 배포 상태가 아니라 수일 내 가중치를 공개하겠다는 계획을 가리킨다. 지금 이용할 수 있는 것은 MiniMax와 제3자가 운영하는 웹 서비스, 앱과 API다.[2]
같은 날 공개된 바이트댄스 Seedance 2.5는 영상 생성과 편집 분야에서 H3와 경쟁한다. 두 모델 모두 텍스트, 이미지, 영상, 오디오를 참조하고 생성물에 음향을 결합한다. H3는 최대 15초 분량의 2K 영상 생성과 여러 웹 서비스와 API에서 바로 이용할 수 있다는 점을 앞세우고, Seedance 2.5는 최대 30초 분량의 영상 생성, 최대 50개의 참조 자료, 전체 길이를 최대 3분까지 늘리는 연장과 부분 편집을 내세운다. 따라서 H3를 평가할 때는 한 편의 영상 품질뿐 아니라 긴 장면의 일관성, 참조 자료 활용, 편집 제어와 서비스 접근성도 함께 봐야 한다.
MiniMax H3: Omni-Reference, Commercial-Grade Generation, Unbeatable Cost Efficiency, Open Weights
웹과 데스크톱 앱, 여러 영상 플랫폼과 API에서 이용
MiniMax는 웹 서비스 Hailuo AI와 데스크톱 앱 MiniMax Hub에서 H3를 제공한다.[3][10] H3는 자체 서비스에만 머물지 않았다. 일반 사용자는 Runway, OpenArt, Leonardo.Ai, Pollo AI와 Topview에서도 H3를 선택할 수 있다. 다섯 플랫폼은 7월 31일 공식 계정에서 H3 제공을 시작했다고 발표했다. OpenArt는 Wonder 이용자에게 8월 5일까지 무제한 생성을, Pollo AI는 출시 기념 50% 할인을 안내했다.[11][12][13][14][15]
| 대상 | 사용 가능한 곳 | 접근 방식 |
|---|---|---|
| 일반 사용자 | Hailuo AI, Runway, OpenArt, Leonardo.Ai, Pollo AI, Topview | 웹 영상 생성기 |
| 데스크톱 사용자 | MiniMax Hub | macOS 13 이상, Windows 10 이상 |
| 개발자 | MiniMax API, Runware, Vercel AI Gateway | API와 SDK |
MiniMax Hub는 macOS 13 이상과 Windows 10 이상에서 쓸 수 있다. MiniMax 공식 API의 2K 영상 요금은 초당 0.13달러다.[10][16] Runware와 Vercel AI Gateway도 H3용 API와 SDK를 제공한다. 공급자별 요금과 사용 정책은 다를 수 있다.[17][18]
외부 아레나에서는 음향 포함 영상 편집 1위
8월 1일 오후 4시 34분 기준 Artificial Analysis에서 H3는 음향 포함 영상 편집 1위, 텍스트 영상 2위, 이미지 영상 3위였다. 음향을 제외한 텍스트 영상과 이미지 영상에서는 모두 2위였다. 각 행은 과제와 음향 조건이 다른 별도 평가 집단이다. Elo 점수는 같은 행 안의 모델을 비교할 때만 의미가 있으며, 행 사이 점수 크기로 H3의 강한 과제를 판단할 수는 없다.[6][7][8][19]
| 평가 | 순위 | Elo |
|---|---|---|
| 텍스트 영상, 음향 포함 | 2위 | 1,242 |
| 텍스트 영상, 음향 제외 | 2위 | 1,305 |
| 이미지 영상, 음향 포함 | 3위 | 1,184 |
| 이미지 영상, 음향 제외 | 2위 | 1,351 |
| 영상 편집, 음향 포함 | 1위 | 1,130 |
음향 포함 텍스트 영상에서는 1,242점으로, 1,245점인 Gemini Omni Flash에 이어 2위였다. 이미지 영상에서는 Dreamina Seedance 2.0 720p와 Gemini Omni Flash 다음인 3위였고, 영상 편집에서는 Gemini Omni Flash를 앞선 1위였다.[6][7][8] Artificial Analysis는 같은 프롬프트의 두 결과를 모델명 없이 보여 주고 사용자가 선호하는 쪽을 고르게 한다. 이 순위는 상대적인 사용자 선호를 보여 주지만 물리 정확성, 참조 충실도, 작은 글자 정확도나 API 안정성을 각각 검증한 결과는 아니다. Arena.ai도 H3를 텍스트 영상과 이미지 영상 평가에 추가했다.[19][20]
X에서는 장점과 실패 사례가 함께 나와
공개 생성 사례에서는 립싱크, 콘티 구도와 카메라 움직임 재현이 강점으로 언급됐다. 액션 동작, 악기 연주 동기화와 프레임 안정성은 결과에 따라 편차가 있었다. 이는 아레나의 상대적 선호도 순위와 모순되는 결과라기보다, 개별 제작 조건에서 따로 확인해야 할 품질 요소를 보여 준다. 아래 5건은 H3 결과 영상과 접근 경로, 구체적인 관찰을 함께 공개한 게시물이다. 소수 사례이므로 모델 전체 품질을 대표하지는 않는다.
X 사용자 @akazomesirou는 Sjinn에서 H3를, Dreamina에서 Seedance 2.5를 비슷한 프롬프트로 생성한 두 영상을 나란히 올렸다. 두 모델 모두 가면라이더식 날아차기를 제대로 만들지 못했고, H3의 2,000자 프롬프트 제한도 불편했다고 적었다. 비용은 H3가 유리할 것으로 평가했다.[21]
Sjinn経由でMiniMax H3(1つ目)とドリミナでseedance2.5を同じようなプロンプトで生成
H3の方はなんか惜しいのとプロンプトの文字数が2000文字までなのが結構厳しい
そしてどちらもライダーキック風飛び蹴りは苦手
でもコストはH3の方が確実にいいだろう
@Hailuo_AI @sjinn_ai @dreamina_world
#MiniMaxH3 #seedance2_5 #sjinn #dreamina #ai動画
G. Kim은 OpenArt에서 만든 15초 H3 영상에서 두 번째 프레임이 멈췄다고 적었다. 결과 전체를 실패로 보지는 않았고, 음향 설계는 마음에 든다고 평가했다.[22]
Trying out more @Hailuo_AI H3 on @openart_ai. It's not bad even though the second frame froze up! Will work on learning how to prompt with H3 more, but I do love the sound design!
Topview 등과 크리에이터 파트너십을 맺은 @seisei_ai_1st는 첨부한 음악 영상에서 립싱크는 좋았지만 악기 연주 동기화는 Seedance 2.0이 더 정확해 보인다고 평가했다.[23]
#MiniMaxH3 の楽器シンク検証🔥
バラードでもリップシンクはかなり良い、楽器シンクはSeedance2.0の方が精度は高いかなー🤔
でも2K出力だし、リップシンクはかなり精度高いのでお気に入りのモデルになりそう🥰
Hailuo AI: 2K, 15 秒
Use music: @TopviewAIhq
#MiniMaxH3 #HailuoAI #TopviewAI #CPP
@hasamaru_studio는 Hailuo AI에서 콘티 이미지를 참조로 넣은 15초 영상을 공개했다. 콘티의 구도와 카메라 움직임을 잘 따랐고, 프롬프트로 동작을 추가했을 때도 결과에 충실하게 반영됐다고 평가했다.[24]
Hailuo AIの新モデル「MiniMax H3」で、絵コンテ画像をリファレンスにした動画生成を検証してみました。
体感では、絵コンテの構図やカメラワークの再現精度はかなり高く感じました。
さらにプロンプトでも動きを重ねて指定することで、添付動画のようにかなり忠実に再現できました!
【生成内容】
MiniMax-H3 | 2K | 15秒
#MiniMaxH3 #HailuoAI #AI動画 #AIクリエイター
@Hoshimiko_AIart는 Hailuo AI에서 만든 세로 영상을 첨부하고 일본어 대사와 목소리 일관성, 오디오 파일 활용, 비용을 장점으로 들었다. 액션 장면에는 덜 적합하고 현재 2K만 선택할 수 있다는 점은 한계로 꼽았다.[25]
Seedance2.5 も登場して、盛り上がる動画生成界隈ですが、個人的には「MiniMax H3」にかなり注目しています✨👀
コストパフォーマンスに優れ、気軽に失敗できるというのはかなり精神的にラクです。
@Hailuo_AI #MiniMaxH3
---
さらに、日本語の台詞が安定していて声にも一貫性があり、音声/音楽ファイルの利用が得意なので、アクションシーンでなければかなり使いやすいです。
今は、解像度を2kしか選べないですが、720pも選べるようになって更に安く、更に早く生成できるようになれば、個人的な使用頻度ではSeedanceを上回ると思います✨(*´▽`人)
다섯 사례를 함께 보면 H3는 음성과 참조 구도를 활용하는 작업에서 시험할 가치가 있지만, 복잡한 액션과 정밀한 악기 동기화, 프레임 안정성이 중요한 제작에는 결과를 직접 확인해야 한다. 아레나 상위권은 폭넓은 선호를 보여 주지만 이런 세부 실패 가능성까지 없다는 뜻은 아니다.
MiniMax는 입력 맥락 압축과 2K 재생성을 핵심으로 제시
MiniMax는 여러 참조 자료의 관계를 언어로 정리하는 방식을 Contextual Omni Representation이라고 부른다. 회사 설명으로는 전용 모델이 원본 자료 하나당 약 10만 토큰을 처리해 평균 약 4천 토큰으로 압축한다. 이 표현은 인물, 움직임과 음향의 관계를 한 프롬프트에서 유지하기 위한 구성이다.[2]
H3-VAE는 유효 시퀀스 길이를 4배 늘려 긴 영상 표현과 2K 출력을 뒷받침하고, H3-Omni Transformer는 이해와 생성 연산을 분리해 학습 처리량을 약 30% 높였다는 것이 회사 설명이다. 2K 영상은 별도 확대 모듈 대신 저해상도 결과와 처음의 맥락을 다시 참조하는 In-context Regeneration으로 만든다. MiniMax는 이 방식이 작은 글자와 세부 묘사를 복원하는 데 유리하다고 주장한다. 4배와 30% 수치를 검증할 전체 기술 보고서와 재현 자료는 아직 공개되지 않았다.[2]
공개 가중치 모델은 예고, 체크포인트는 아직
MiniMax는 관련 법규를 전제로 H3 가중치를 수일 내 공개할 계획이라고 밝혔다. 더 다양한 AI 하드웨어와 호환하고 이용자가 맞춤형 모델을 만들기 쉽게 하려는 목적이라는 설명이다. 전체 기술 보고서도 추후 공개할 예정이다.[2]
8월 1일 오후 4시 34분 기준 MiniMax 공식 GitHub와 Hugging Face에는 H3 체크포인트가 없었고, 라이선스 정보도 공개되지 않았다.[26][27] 현재 웹과 데스크톱 앱, 여러 영상 제작 플랫폼과 API에서는 H3를 시험할 수 있다. 외부 선호도 평가에서는 상위권이지만 공개 사례에서 액션, 정밀 동기화와 프레임 안정성의 편차가 확인됐다. 자체 운영에 필요한 체크포인트와 라이선스는 후속 공개를 기다려야 한다.