MiniMax H3 Open Weightsが公開 — 3つの注意点

VideoToPrompton a day ago8 min read

待望の時が来ました。MiniMaxAI/MiniMax-H3は、カウントダウンがリリースなしで終了してから約1日後の2026年8月3日にHugging Faceで公開されました。数時間で1,400以上の「いいね」を獲得しました。

私たちは発表スレッドからではなく、直接リポジトリを確認しましたが、その内容にはローンチが宣伝された方法と大きく異なる点が3つありました。H3をローカルで実行する予定がある場合は、まずライセンスのセクションを読んでください。多くの読者にとって、それは決定的な情報となるでしょう。

2026年8月4日時点のステータス

項目ステータス
ホスト型API経由のH3 (fal, ComfyUI, Runway, Leonardo, Topview)✅ 7月31日から稼働中、グローバルで利用可能
Hugging Faceでの公式オープンウェイト8月3日公開
米国 / 英国 / EU / 韓国でのライセンスに基づく利用除外 — 以下参照
ベースモデルの出力解像度⚠️ 768p; 2Kには2回目のパスが必要

注意点1:ライセンスは米国、英国、EU、韓国を除外

これは最も重要であり、最も報じられていない詳細です。H3はApacheやMITではなく、MiniMax H3 Community License Agreementの下で提供されます。その許諾は「適用地域」に限定されており、以下のように定義されています。

"Applicable Territory" means worldwide, excluding the Excluded Territories. "Excluded Territories" means the European Union, the United Kingdom, the Republic of Korea and the United States of America.

したがって、米国、英国、EU、または韓国にいる場合、コミュニティライセンスはウェイトを使用、複製、配布、または変更する権利を付与しません。MiniMaxは、これらの地域のユーザーに対し、「堅牢な管理とガードレールに基づいて付与される」別のライセンスについて問い合わせるよう求めています。

MiniMaxは、その理由を説明するdocs/QA-about-License.mdを公開しており、彼らの功績として、それは直接的に述べられています。

Regions such as the EU, UK, South Korea, and the US are currently developing or enforcing AI-related regulations that may have specific implications for generative video models, especially around areas such as likeness generation, copyright, content safety, and responsible deployment.

彼らは、EU AI Actの施行、英国と韓国における規制の不確実性、そして特筆すべきことに、MiniMaxが米国で「生成ビデオAIに特化した著作権関連の進行中の訴訟に関与している」ことを挙げています。彼らの表明している立場は、この制限が「まだではない、決してではない」を意味するということです。

重要な区別: これはウェイトを制限するものであり、ホスト型APIではありません。APIはグローバルに利用可能です。なぜなら、MiniMaxがサービスインフラを管理し、そこでセーフガードを適用できるからです。除外地域にいる場合でも、fal, Runway, Leonardo, ComfyUIのパートナーノード、そしてHailuo自体はすべて利用可能です。ダウンロードしたモデルを自分で合法的に実行することはできません。

落とし穴2:「ネイティブ2K」は2段階のプロセス

リリース時のメッセージではネイティブ2Kが強調されていましたが、リポジトリはより正確です。モデルカードより:

Output resolution: Supports various resolution dimensions. The shorter side is set to 768 pixels by default. 2K generation can be achieved with H3-Regenerate-2K.

H3は実際には3つのモジュールシステムです:

  • H3-Context-IR — 乱雑なマルチモーダル入力を受け取り、ジェネレーターが消費する「Context Intermediate Representation」に洗練します。
  • H3-Base — 768pでオーディオとビデオを生成します。
  • H3-Regenerate-2K — 768pの結果に元のコンテキストを加えてH3にフィードバックし、2Kで再生成します。

したがって、2Kはベースモデルのネイティブな出力モードではなく、再生成パスです。これは悪い設計ではありません — 元のコンテキストを利用して再生成することで、アップスケーリングよりも優れた詳細が得られます — しかし、2Kを望む場合、ローカルパイプラインは1回の生成パスではなく、2回の生成パスを意味します。

その他の確認された仕様:4~15秒の出力、24 FPS、32 kHzステレオオーディオ、21:9から9:16までのアスペクト比、そして11言語(アラビア語、中国語、英語、フランス語、ドイツ語、イタリア語、日本語、韓国語、ポルトガル語、ロシア語、スペイン語)での安定した対話サポート。

落とし穴3:非常に大きい

リリース前、<a href="https://x.com/cheatyyyy/status/2083863807211049110" rel="nofollow" target="_blank">cheatyyyy</a>はComfyUIとdiffusersにH3サポートを追加する公開PRを読み、「メインのDiTに33B、剪定された20bバリアント」と報告し、「これが3090で動くか分からない」と締めくくりました。

33Bという数字は確認できます — transformerフォルダは66.3GBで、bf16で33Bパラメータに相当します。剪定された20Bバリアントはリリースされたリポジトリには含まれていません。 今後登場するかもしれませんが、初日には出荷されませんでした。

リポジトリは、共有コンポーネントに加えて2つの完全なバンドル(FL2VAとRef2VA)が含まれているため、合計で約499GBになります。単一の利用可能なパイプラインは概ね以下の通りです:

コンポーネントサイズ (bf16)
Text encoder (Qwen3-VL-32B)66.7GB
Transformer (DiT, 33B)66.3GB
Video VAE10.4GB
Audio VAE0.6GB
合計約144GB

したがって、「3090で動くか」という問いに対する答えは、bf16では無理であり、全く近づきません。コミュニティによる量子化が興味深い点です — リリース前のステージングリポジトリでは、ウェイトが公開される前からテキストエンコーダーのint8バージョンが出荷されており、これがどこにプレッシャーがあるかを示しています。

2つのバリアント

リリースでは、異なる入力モードを持つ2つのベースモデルが出荷されています:

  • H3-Base-FL2VA (first-and-last-frame):画像なしでテキストからビデオを生成し、画像1枚で最初のフレームまたは最後のフレームの条件付けを行い、画像2枚でそれらの間のトランジションを生成します。
  • H3-Base-Ref2VA (omni-reference):最大9枚の画像、3つのビデオクリップ、3つのオーディオクリップに対応し、合計ファイル数は12に厳しく制限されています。各ビデオまたはオーディオクリップは2~15秒である必要があり、合計持続時間は15秒を超えてはなりません。オーディオは単独の入力にはできません — 画像またはビデオを伴う必要があります。

これらの参照上限は、falがリリース時に公開したものと一致しており、それが最初の週にクリエイターにとってマルチキャラクターの一貫性が非常にうまく機能した理由です。

プロンプト作成で最も重要な部分

モデルカードに、真剣に受け止めるべき一文が埋もれています。

H3-Context-IR is critical to the quality of the final output, so we strongly recommend incorporating it into your generation pipeline or following the "Prompting Guidance" to build your own context-processing system.

言い換えれば、MiniMaxは、出力品質の大部分が、ジェネレーターが実行される前に、入力がどのように構造化されたContextに前処理されるかによって決まると述べています。彼らはまさにこの目的のために、リポジトリに2つのプロンプト作成ガイド(docs/VIDEO_PROMPT_WRITING_GUIDE_base_en.md..._ref_en.md)を同梱しています。

これは、アーキテクチャを知らずに最初の週にクリエイターたちが到達した結論を裏付けています。効果的だったプロンプトは、リクエストを事前に構造化したものでした。つまり、明示的なカメラシーケンス、名前付きの最終フレーム、スタイルとライティングのためのラベル付きブロックなどです。私たちは、クリエイター間で広まった連続ショットテンプレートを含め、それらのパターンをMiniMax H3ローンチプロンプトの解説で詳しく分析しました。このモデルファミリーへの書き込みのベースライン構造は、Hailuo H3プロンプトガイドにあります。

ライセンスを考慮すると、多くの読者がそうであるように、ホスト型APIをまだ使用している場合、<a href="https://x.com/sidharth_raja/status/2084063524452753424" rel="nofollow" target="_blank">sidharth_raja</a>はプロバイダー間で実際の価格差があることを指摘しました。falは$0.26/秒に対し、OpenRouterは$0.13/秒です。15秒のクリップでは、$3.90対$1.95になります。

クリエイターが実行しているものを追跡する

私たちはXからAIビデオプロンプトを継続的に収集し、モデルごとに分類しています。そのため、H3とHailuoの例は人々が公開するにつれて蓄積されます。トレンドプロンプトでそれらを参照してください。

もし逆の方向へ進み、見たクリップの背後にあるプロンプトを復元したい場合は、私たちのビデオからプロンプトへツールがそれを実行します。リンクを貼り付けるかビデオをアップロードすると、シーン、モーション、カメラワークをカバーする構造化されたプロンプトが返されます。