MiniMax H3 Open Weights が公開されました — そして、3つの注意点があります

VideoToPrompton 16 days ago9 min read

待望の時が来ました。MiniMaxAI/MiniMax-H3は、カウントダウンがリリースなしで期限切れになってから約1日後の2026年8月3日にHugging Faceで公開されました。数時間で1,400以上の「いいね」を獲得しました。

私たちはアナウンススレッドからではなく、直接リポジトリを確認しました。その結果、ローンチが宣伝された方法とは大きく異なる3つの点があることがわかりました。H3をローカルで実行する予定がある場合は、まずライセンスのセクションを読んでください。多くの読者にとって、それは決定的な情報となるでしょう。

2026年8月4日時点のステータス

項目ステータス
ホスト型API経由のH3 (fal, ComfyUI, Runway, Leonardo, Topview)✅ 7月31日から稼働中、グローバルで利用可能
Hugging Faceでの公式オープンウェイト8月3日公開
米国 / 英国 / EU / 韓国でのライセンスに基づく利用除外 — 以下参照
ベースモデルの出力解像度⚠️ 768p; 2Kにはセカンドパスが必要

注意点1:ライセンスは米国、英国、EU、韓国を除外

これは最も重要であり、最も報じられていない詳細です。H3はApacheやMITではなく、MiniMax H3コミュニティライセンス契約の下で提供されます。その許諾は「適用地域」に限定されており、以下のように定義されています。

"Applicable Territory" means worldwide, excluding the Excluded Territories. "Excluded Territories" means the European Union, the United Kingdom, the Republic of Korea and the United States of America.

したがって、米国、英国、EU、または韓国にいる場合、コミュニティライセンスは、ウェイトを使用、複製、配布、または変更する権利を付与しません。MiniMaxは、これらの地域のユーザーに対し、「堅牢な管理とガードレールに基づいて付与される」別途のライセンスについて問い合わせるよう求めています。

MiniMaxは、その理由を説明するdocs/QA-about-License.mdを公開しており、彼らの功績として、それは直接的に述べられています。

Regions such as the EU, UK, South Korea, and the US are currently developing or enforcing AI-related regulations that may have specific implications for generative video models, especially around areas such as likeness generation, copyright, content safety, and responsible deployment.

彼らはEU AI Actの施行、英国と韓国における規制の不確実性、そして — 特筆すべきことに — MiniMaxが米国で「生成ビデオAIに特化した著作権関連の進行中の訴訟に関与している」ことを挙げています。彼らの表明している立場は、この制限は「まだではないが、決してないわけではない」という意味であるということです。

**重要な区別:**これはホスト型APIではなく、ウェイトを制限するものです。APIはグローバルで利用可能です。なぜなら、MiniMaxがサービス提供インフラを管理し、そこで安全対策を強制できるからです。除外地域にいる場合でも、fal、Runway、Leonardo、ComfyUIのパートナーノード、そしてHailuo自体はすべて利用可能です。ダウンロードしたモデルを自分で合法的に実行することはできません。

落とし穴2:「ネイティブ2K」は2段階のプロセス

リリース時のメッセージでは、ネイティブ2Kが強調されていました。リポジトリはより正確です。モデルカードより:

Output resolution: Supports various resolution dimensions. The shorter side is set to 768 pixels by default. 2K generation can be achieved with H3-Regenerate-2K.

H3は実際には3つのモジュールシステムです。

  • H3-Context-IR — 乱雑なマルチモーダル入力を受け取り、ジェネレーターが消費する「Context Intermediate Representation」に洗練します。
  • H3-Base — 768pでオーディオとビデオを生成します。
  • H3-Regenerate-2K — 768pの結果に元のコンテキストを加えてH3にフィードバックし、2Kで再生成します。

つまり、2Kはベースモデルのネイティブな出力モードではなく、再生成のパスです。これは悪い設計ではありません。元のコンテキストを利用して再生成することで、アップスケーリングよりも優れたディテールが得られます。しかし、2Kを望む場合、ローカルパイプラインは1回ではなく2回の生成パスを必要とすることを意味します。

その他の確認済みスペック:4〜15秒の出力、24 FPS、32 kHzステレオオーディオ、21:9から9:16のアスペクト比、および11言語(アラビア語、中国語、英語、フランス語、ドイツ語、イタリア語、日本語、韓国語、ポルトガル語、ロシア語、スペイン語)での安定した対話サポート。

落とし穴3:非常に大きい

リリース前、<a href="https://x.com/cheatyyyy/status/2083863807211049110" rel="nofollow" target="_blank">cheatyyyy</a>はComfyUIとdiffusersにH3サポートを追加するオープンなPRを読み、「メインのDiTは33B、剪定された20Bバリアント」と報告し、「これが3090で動くか分からない」と締めくくりました。

33Bという数字は確認済みです。transformerフォルダは66.3GBで、bf16で33Bパラメータに相当します。**剪定された20Bバリアントは、リリースされたリポジトリには含まれていません。**今後登場する可能性はありますが、初日には出荷されませんでした。

リポジトリの合計サイズは約499GBです。これは、共有コンポーネントに加えて、2つの完全なバンドル(FL2VAとRef2VA)が含まれているためです。単一の利用可能なパイプラインは約:

コンポーネントサイズ (bf16)
Text encoder (Qwen3-VL-32B)66.7GB
Transformer (DiT, 33B)66.3GB
Video VAE10.4GB
Audio VAE0.6GB
合計~144GB

したがって、「3090で動くか」という問いへの答えは、bf16ではノーであり、到底無理です。

**更新:**コミュニティによる量子化により、数日以内にそのギャップが解消されました。DeepBeepMeep/MiniMax-H3リポジトリは現在、GGUFテキストエンコーダーとともに、約21GBの剪定された約20B int8ビルドを出荷しており、最小動作セットは約35GBにまで削減されています。私たちは12GBのRTX 3060でエンドツーエンドでテストしました。5秒のクリップあたり25分かかりますが、VRAMのピークはわずか4.7GBで動作します。これは、実際のボトルネックがGPUではなくシステムRAMであることが判明したためです。完全なウォークスルーと途中で遭遇する6つのエラー:RTX 3060でMiniMax H3をローカルで実行する

2つのバリアント

リリースでは、異なる入力モードを持つ2つのベースモデルが出荷されています。

  • H3-Base-FL2VA (first-and-last-frame):画像なしでテキストからビデオを生成し、1枚の画像で最初または最後のフレームの条件付けを行い、2枚の画像でそれらの間のトランジションを生成します。
  • H3-Base-Ref2VA (omni-reference):最大9枚の画像、3つのビデオクリップ、3つのオーディオクリップに対応し、合計ファイル数は12に厳しく制限されています。各ビデオまたはオーディオクリップは2〜15秒である必要があり、合計時間は15秒を超えてはなりません。オーディオは単独の入力にはできません。画像またはビデオを伴う必要があります。

これらの参照上限は、falがリリース時に公開したものと一致しており、それがリリース初週にクリエイターにとってマルチキャラクターの一貫性が非常にうまく機能した理由です。

プロンプティングにおいて最も重要な部分

モデルカードには、真剣に受け止めるべき一文が隠されています。

H3-Context-IR is critical to the quality of the final output, so we strongly recommend incorporating it into your generation pipeline or following the "Prompting Guidance" to build your own context-processing system.

言い換えれば、MiniMaxは、出力品質の大部分は、ジェネレーターが実行される前に、入力がどのように構造化されたコンテキストに前処理されるかによって決まると述べています。彼らは、まさにこの目的のために、リポジトリに2つのプロンプト作成ガイド(docs/VIDEO_PROMPT_WRITING_GUIDE_base_en.md..._ref_en.md)を同梱しています。

これは、アーキテクチャを知らずに最初の週にクリエイターたちが到達した結論を裏付けています。効果的だったプロンプトは、リクエストを事前に構造化したものでした。明示的なカメラシーケンス、名前付きのクロージングフレーム、スタイルとライティングのためのラベル付きブロックなどです。私たちは、クリエイター間で広まった連続ショットテンプレートを含め、これらのパターンをMiniMax H3 launch prompts writeupで詳しく分析しました。このモデルファミリーへの書き込みのベースライン構造は、Hailuo H3 prompt guideにあります。

もしあなたがまだホスト型APIを使用しているなら(ライセンスを考慮すると、多くの読者がそうでしょうが)、<a href="https://x.com/sidharth_raja/status/2084063524452753424" rel="nofollow" target="_blank">sidharth_raja</a>は、プロバイダー間で実際の価格差があることを指摘しました。falが$0.26/秒に対し、OpenRouterは$0.13/秒です。15秒のクリップでは、$3.90対$1.95となります。

クリエイターが使用しているものを把握する

私たちはXからAI video promptsを継続的に収集し、モデルごとに分類しています。そのため、人々が公開するにつれてH3とHailuoの例が蓄積されます。trending promptsでそれらを参照してください。

もしあなたが逆の方向へ進み、見たクリップの背後にあるプロンプトを復元したいのであれば、それが私たちのvideo to promptツールが行うことです。リンクを貼り付けるかビデオをアップロードすると、シーン、モーション、カメラワークを網羅した構造化されたプロンプトが返されます。