- AI動画プロンプトブログ - チュートリアル・ヒント・ガイド
- MiniMax H3 Open Weightsが公開 — 3つの注意点
MiniMax H3 Open Weightsが公開 — 3つの注意点
待望の時が来ました。MiniMaxAI/MiniMax-H3は、カウントダウンがリリースなしで終了してから約1日後の2026年8月3日にHugging Faceで公開されました。数時間で1,400以上の「いいね」を獲得しました。
私たちは発表スレッドからではなく、直接リポジトリを確認しましたが、その内容にはローンチが宣伝された方法と大きく異なる点が3つありました。H3をローカルで実行する予定がある場合は、まずライセンスのセクションを読んでください。多くの読者にとって、それは決定的な情報となるでしょう。
2026年8月4日時点のステータス
| 項目 | ステータス |
|---|---|
| ホスト型API経由のH3 (fal, ComfyUI, Runway, Leonardo, Topview) | ✅ 7月31日から稼働中、グローバルで利用可能 |
| Hugging Faceでの公式オープンウェイト | ✅ 8月3日公開 |
| 米国 / 英国 / EU / 韓国でのライセンスに基づく利用 | ❌ 除外 — 以下参照 |
| ベースモデルの出力解像度 | ⚠️ 768p; 2Kには2回目のパスが必要 |
注意点1:ライセンスは米国、英国、EU、韓国を除外
これは最も重要であり、最も報じられていない詳細です。H3はApacheやMITではなく、MiniMax H3 Community License Agreementの下で提供されます。その許諾は「適用地域」に限定されており、以下のように定義されています。
"Applicable Territory" means worldwide, excluding the Excluded Territories. "Excluded Territories" means the European Union, the United Kingdom, the Republic of Korea and the United States of America.
したがって、米国、英国、EU、または韓国にいる場合、コミュニティライセンスはウェイトを使用、複製、配布、または変更する権利を付与しません。MiniMaxは、これらの地域のユーザーに対し、「堅牢な管理とガードレールに基づいて付与される」別のライセンスについて問い合わせるよう求めています。
MiniMaxは、その理由を説明するdocs/QA-about-License.mdを公開しており、彼らの功績として、それは直接的に述べられています。
Regions such as the EU, UK, South Korea, and the US are currently developing or enforcing AI-related regulations that may have specific implications for generative video models, especially around areas such as likeness generation, copyright, content safety, and responsible deployment.
彼らは、EU AI Actの施行、英国と韓国における規制の不確実性、そして特筆すべきことに、MiniMaxが米国で「生成ビデオAIに特化した著作権関連の進行中の訴訟に関与している」ことを挙げています。彼らの表明している立場は、この制限が「まだではない、決してではない」を意味するということです。
重要な区別: これはウェイトを制限するものであり、ホスト型APIではありません。APIはグローバルに利用可能です。なぜなら、MiniMaxがサービスインフラを管理し、そこでセーフガードを適用できるからです。除外地域にいる場合でも、fal, Runway, Leonardo, ComfyUIのパートナーノード、そしてHailuo自体はすべて利用可能です。ダウンロードしたモデルを自分で合法的に実行することはできません。
落とし穴2:「ネイティブ2K」は2段階のプロセス
リリース時のメッセージではネイティブ2Kが強調されていましたが、リポジトリはより正確です。モデルカードより:
Output resolution: Supports various resolution dimensions. The shorter side is set to 768 pixels by default. 2K generation can be achieved with H3-Regenerate-2K.
H3は実際には3つのモジュールシステムです:
- H3-Context-IR — 乱雑なマルチモーダル入力を受け取り、ジェネレーターが消費する「Context Intermediate Representation」に洗練します。
- H3-Base — 768pでオーディオとビデオを生成します。
- H3-Regenerate-2K — 768pの結果に元のコンテキストを加えてH3にフィードバックし、2Kで再生成します。
したがって、2Kはベースモデルのネイティブな出力モードではなく、再生成パスです。これは悪い設計ではありません — 元のコンテキストを利用して再生成することで、アップスケーリングよりも優れた詳細が得られます — しかし、2Kを望む場合、ローカルパイプラインは1回の生成パスではなく、2回の生成パスを意味します。
その他の確認された仕様:4~15秒の出力、24 FPS、32 kHzステレオオーディオ、21:9から9:16までのアスペクト比、そして11言語(アラビア語、中国語、英語、フランス語、ドイツ語、イタリア語、日本語、韓国語、ポルトガル語、ロシア語、スペイン語)での安定した対話サポート。
落とし穴3:非常に大きい
リリース前、<a href="https://x.com/cheatyyyy/status/2083863807211049110" rel="nofollow" target="_blank">cheatyyyy</a>はComfyUIとdiffusersにH3サポートを追加する公開PRを読み、「メインのDiTに33B、剪定された20bバリアント」と報告し、「これが3090で動くか分からない」と締めくくりました。
33Bという数字は確認できます — transformerフォルダは66.3GBで、bf16で33Bパラメータに相当します。剪定された20Bバリアントはリリースされたリポジトリには含まれていません。 今後登場するかもしれませんが、初日には出荷されませんでした。
リポジトリは、共有コンポーネントに加えて2つの完全なバンドル(FL2VAとRef2VA)が含まれているため、合計で約499GBになります。単一の利用可能なパイプラインは概ね以下の通りです:
| コンポーネント | サイズ (bf16) |
|---|---|
| Text encoder (Qwen3-VL-32B) | 66.7GB |
| Transformer (DiT, 33B) | 66.3GB |
| Video VAE | 10.4GB |
| Audio VAE | 0.6GB |
| 合計 | 約144GB |
したがって、「3090で動くか」という問いに対する答えは、bf16では無理であり、全く近づきません。コミュニティによる量子化が興味深い点です — リリース前のステージングリポジトリでは、ウェイトが公開される前からテキストエンコーダーのint8バージョンが出荷されており、これがどこにプレッシャーがあるかを示しています。
2つのバリアント
リリースでは、異なる入力モードを持つ2つのベースモデルが出荷されています:
- H3-Base-FL2VA (first-and-last-frame):画像なしでテキストからビデオを生成し、画像1枚で最初のフレームまたは最後のフレームの条件付けを行い、画像2枚でそれらの間のトランジションを生成します。
- H3-Base-Ref2VA (omni-reference):最大9枚の画像、3つのビデオクリップ、3つのオーディオクリップに対応し、合計ファイル数は12に厳しく制限されています。各ビデオまたはオーディオクリップは2~15秒である必要があり、合計持続時間は15秒を超えてはなりません。オーディオは単独の入力にはできません — 画像またはビデオを伴う必要があります。
これらの参照上限は、falがリリース時に公開したものと一致しており、それが最初の週にクリエイターにとってマルチキャラクターの一貫性が非常にうまく機能した理由です。
プロンプト作成で最も重要な部分
モデルカードに、真剣に受け止めるべき一文が埋もれています。
H3-Context-IR is critical to the quality of the final output, so we strongly recommend incorporating it into your generation pipeline or following the "Prompting Guidance" to build your own context-processing system.
言い換えれば、MiniMaxは、出力品質の大部分が、ジェネレーターが実行される前に、入力がどのように構造化されたContextに前処理されるかによって決まると述べています。彼らはまさにこの目的のために、リポジトリに2つのプロンプト作成ガイド(docs/VIDEO_PROMPT_WRITING_GUIDE_base_en.md と ..._ref_en.md)を同梱しています。
これは、アーキテクチャを知らずに最初の週にクリエイターたちが到達した結論を裏付けています。効果的だったプロンプトは、リクエストを事前に構造化したものでした。つまり、明示的なカメラシーケンス、名前付きの最終フレーム、スタイルとライティングのためのラベル付きブロックなどです。私たちは、クリエイター間で広まった連続ショットテンプレートを含め、それらのパターンをMiniMax H3ローンチプロンプトの解説で詳しく分析しました。このモデルファミリーへの書き込みのベースライン構造は、Hailuo H3プロンプトガイドにあります。
ライセンスを考慮すると、多くの読者がそうであるように、ホスト型APIをまだ使用している場合、<a href="https://x.com/sidharth_raja/status/2084063524452753424" rel="nofollow" target="_blank">sidharth_raja</a>はプロバイダー間で実際の価格差があることを指摘しました。falは$0.26/秒に対し、OpenRouterは$0.13/秒です。15秒のクリップでは、$3.90対$1.95になります。
クリエイターが実行しているものを追跡する
私たちはXからAIビデオプロンプトを継続的に収集し、モデルごとに分類しています。そのため、H3とHailuoの例は人々が公開するにつれて蓄積されます。トレンドプロンプトでそれらを参照してください。
もし逆の方向へ進み、見たクリップの背後にあるプロンプトを復元したい場合は、私たちのビデオからプロンプトへツールがそれを実行します。リンクを貼り付けるかビデオをアップロードすると、シーン、モーション、カメラワークをカバーする構造化されたプロンプトが返されます。
Related Articles
MiniMax H3が登場:Promptingに何が変わったか、実際の初週の5つのPrompt付き
Hailuo H3は2026年7月29日に、ネイティブ2K、15-second clips、そしてvideoと同時に生成されるaudioを搭載してリリースされました。クリエイターが初週に実際に機能させたものと、その完全なPromptsをここに紹介します。
今週トレンドのAIビデオプロンプト トップ7 (2026年7月)
今週Xで最も「いいね」されたAIビデオプロンプト7選。Seedance、Kling、Hailuoの完全なプロンプトテキストと、それぞれの違いも解説します。
Hailuo H3 Prompt ガイド: MiniMax の新しい Video Model 向け Prompt の書き方 (事例付き)
実践的な Hailuo H3 Prompting: MiniMax の新しい Video Model のための 5 つの Principle、さまざまな Niches で使える 6 つのコピペ可能 Example Prompt、そして、H3 Prompting が Kling や Sora とどう違うか。
