- AI動画プロンプトブログ - チュートリアル・ヒント・ガイド
- MiniMax H3 GGUF を 12GB RTX 3060 で動かす: 量子化サイズ・実測VRAM・6つの落とし穴
MiniMax H3 GGUF を 12GB RTX 3060 で動かす: 量子化サイズ・実測VRAM・6つの落とし穴
短い答え:はい、MiniMax H3は12GB RTX 3060で動作します。驚くべきことに、VRAMはボトルネックではありませんでした。ピークVRAMは12GB中4.7GBでした。システムRAMが常に制約となっていました。
コストは時間です。5秒間の832x480クリップの生成には25分24秒かかりました。このため、ローカルH3は無制限の無料実験には優れていますが、完成品の制作には実用的ではありません。
以下は、RTX 3060 12GB、i5-12490F、16GB DDR4、DRAMレスのKingston NVMe、WSL2を搭載したWindowsという1台のマシンでの実際の実行結果です。
まずお読みください:ライセンスは米国、英国、EU、韓国を除外します
35GBをダウンロードする前に、使用が許可されているか確認してください。H3はApacheやMITではなく、MiniMax H3 Community License Agreementの下で提供されています。第5条では次のように定義されています。
"Excluded Territories" means the European Union, the United Kingdom, the Republic of Korea and the United States of America.
そして、第IV.4条はほとんどの人が予想する以上に踏み込んでおり、ウェイトだけでなく、それらを使って作成したものも対象となります。
You may not use, reproduce, modify, distribute, or display the MiniMax H3 Works or any of their Outputs or results outside the Applicable Territory.
したがって、これら4つの地域では、モデルファイルだけでなく、生成された動画自体も対象となります。MiniMaxは、<a href="https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/QA-about-License.md" rel="nofollow" target="_blank">Q&Aドキュメント</a>でその理由を説明しています。EU AI Actが施行されており、英国と韓国は規制上の不確実性があり、米国ではMiniMaxが生成ビデオに関する著作権訴訟を抱えています。彼らの言葉は「まだではないが、決してないわけではない」であり、これらの地域のユーザーには別途ライセンスについて問い合わせるよう促しています。
ホスト型APIは制限されていません。MiniMaxがそのインフラストラクチャを運用し、セーフガードを適用できるため、グローバルに利用可能です。除外地域にいる場合、以下のAPIルートが利用可能です。詳細については、オープンウェイトで実際に何が出荷されたかの分析をご覧ください。
動作したスタック
ネイティブのComfyUIではありません。このクラスのハードウェア向けに構築された<a href="https://github.com/deepbeepmeep/Wan2GP" rel="nofollow" target="_blank">WanGP (Wan2GP) v12.41+</a>を、uvで作成したvenv内のPython 3.11.5とtorch 2.10.0+cu130で使用しました。
torchのバージョンは必須です。トラップ1を参照してください。WanGPのRTX 30シリーズ向けガイダンスは、Python 3.11.xとPyTorch 2.10およびCUDA 13.0であり、そのドキュメントでは2.8.0(モデル切り替え時のメモリリーク)と2.9.0(VAE VRAMを爆発させる3D畳み込みの問題)を明示的に警告しています。
最小限の動作モデルセットは約35GBで、すべて公式のものではなく、コミュニティの<a href="https://huggingface.co/DeepBeepMeep/MiniMax-H3" rel="nofollow" target="_blank">DeepBeepMeep/MiniMax-H3</a>リポジトリからのものです。
| ファイル | サイズ | 役割 |
|---|---|---|
MiniMax-H3-FL2VA-pruned_rank8_int8_convrot.safetensors | 21GB | DiT, pruned to ~20B, int8 |
qwen3vl-32B-MiniMax-H3-Q2_K.gguf | 8.0GB | Text encoder |
MiniMax-H3-video_vae_fp16.safetensors | 4.9GB | Video VAE |
MiniMax-H3-audio_vae_fp32.safetensors | 578MB | Audio VAE |
参考までに:公式のbf16 DiTは66.28GB(33Bパラメータ)で、完全なMiniMaxAI/MiniMax-H3リポジトリは約498GBです。ComfyUIの公式バンドルは57GBです。コミュニティによるプルーニングと量子化が、これを適合させるための鍵です。
起動フラグ(3つすべて必須):
--profile 5 --perc-reserved-mem-max 0.1 --attention sdpa
6つの落とし穴
これらはそれぞれ、ドキュメントを読むのではなく、エラーに遭遇することで発見されました。
1. torchはcu128ではなくcu130である必要があります。 cu128では、int8カーネルはサイレントにeager executionにフォールバックします。コミュニティの測定によると、サンプリングは1.92 s/itではなく6.12 s/itとなり、エラーメッセージを出さない間違いに対して3.19倍のペナルティが発生します。起動時にこの行を探して、動作したことを確認してください。
[Quanto][INT8] Injected int8 kernels ACTIVE (backend=triton)
2. デフォルトのプロファイル4は直接CUDA OOMになります。 --profile 5が必要です。WanGPはプロファイル5を「VerylowRAM_LowVRAM (Fail safe): 少なくとも24 GBのRAMと10 GBのVRAM」と説明しています。つまり、16GBのRAMは提示された最低要件を下回っています。それでもNVMeページファイルを頼りに動作します。そのため、DRAMレスSSDがここでは不利になります。
3. RTX 30シリーズでは、SageAttentionがH3で完全に失敗します。 Sage 1.0.6はAssertionError: varlen only support head_dim [64, 128]をスローします。RTX 30xxはSage 2を使用できないため、唯一の選択肢は--attention sdpaです。40シリーズおよび50シリーズでは、Sage 2.2が動作し、コミュニティの報告では約30%の節約になるとされています。
4. hf_xetは大きなダウンロードをゼロバイトで停止させます。 ビデオVAEは8分間0バイトのままでした。HF_HUB_DISABLE_XET=1を設定すると、すぐに18MB/sに回復しました。
5. GGUF llama.cpp CUDAカーネルが利用できません — ログには[GGUF][llama.cpp CUDA] kernels unavailable, using fallbackと表示されます。したがって、GGUF DiTではなくint8_convrot DiTを使用してください。GGUFは、Q2_Kが多くのRAMを節約するtext encoderには依然として適切な選択です。
6. システムプロキシがlocalhostを傍受します そしてGradioは503エラーで停止します: Couldn't start the app because 'http://localhost:7860/gradio_api/startup-events' failed。NO_PROXY=localhost,127.0.0.1を設定してください。アウトバウンドトラフィックは引き続きプロキシを経由します。
おまけ、Cドライブの容量が少ない場合: 開始する前にUV_CACHE_DIR、TMP、TEMP、HF_HOMEを別のドライブにリダイレクトしてください。
測定されたパフォーマンス
すべて同じ3060で、20ステップでの結果:
| 解像度 / フレーム数 | クリップあたりの時間 | 1ステップあたり |
|---|---|---|
| 608x352 / 73 frames (3.0s) | 19分50秒 | — |
| 832x480 / 124 frames (5.2s) | 25分24秒 | 71.8秒 |
| 864x480 / 124 frames (5.2s) | 28分38秒 | 84秒 |
| 1280x736 / 192 frames (8s) | ~3 時間 (推定、未実行) | — |
ピークVRAM: 12GB中4.7~4.8GB。空きシステムRAM: 0.2GB。これが全てです — マシンがスワップしている間、GPUはアイドル状態です。
最初の行は注目に値します。73フレームで608x352に落とすと、トークン数は864x480実行時の約30%に減少しますが、時間は28.6分から19.8分にしか減少しません — 全く比例していません。その理由は、16GBのマシンでは、各ステップで21GBのウェイトがNVMeから再ストリームされ、そのオーバーヘッドは解像度に関係なく固定されているためです。したがって、RAMが制限されている場合、「ただ小さくレンダリングする」だけではほとんど役に立ちません。 RAMを追加するのが解決策であり、キャンバスを縮小することではありません。
それを証明する比較: ComfyUIチームは、同じ3060と32GBのRAMで480p/5sを約9分と測定しました。システムメモリを2倍にすると、ここでは約2.8倍の価値があります。アップグレードするものを選択するなら、より大きなGPUではなくRAMを購入してください。
ffprobeで出力検証済み: h264ビデオとAACステレオ32kHz — 後から追加されたものではなく、同じパスで生成された純正ネイティブオーディオ — 24fps、124フレーム = 5.167秒。
プロンプトで回避できない制約
- ローカルでは2Kは不可。 オープンウェイトは短辺768のキャンバスでレンダリングされ、最大768x1344です。宣伝されている2Kは、API側のIn-Context Regeneration passから得られます。
- フレーム数は17k+5: 73, 124, 175, 192である必要があります。
- 両方の寸法は32の倍数である必要があります。 これが、720pが1280x736と表記される理由です — 720は32で割り切れません。
- 持続時間はうまくスケールしません。 コミュニティからの5090の数値: 5s = 168s、7s = 282s、一方15sはチューニングによって7分から50分の間で実行されます。8秒のクリップ3本は、15秒のクリップ1本よりもはるかに安価です。
まだdistilledまたはlightning LoRAはありません。そのため、15~20ステップが最低ラインです。8月8日更新: これはもはや真実ではありません。Distilled LoRAは8月7日に出荷され(約5倍の高速化で6ステップ)、カーネルレベルの作業 — Sol-Attnとキャッシング — は、再トレーニングなしでストックチェックポイントで3〜4.5倍を報告しています。ComfyUIもネイティブH3サポートを獲得しました。数値と品質のトレードオフについては、MiniMax H3が3〜5倍高速化をご覧ください。量子化ビルドも引き続き登場しています — 19.86GBのGGUF Q4_K_M、15.57GBのQ3_K_M、さらにNVFP4およびINT4バリアントです。
コミュニティレポートによるその他のハードウェア: SageAttentionを搭載した5090は1280x736/5sを168秒で実行し(なしでは242秒)、SM120 sparse attentionとEasyCacheを使用すると、15秒が55分から約7分に短縮されます。チューニングされた4090は362フレームを9.6分で実行します。RTX PRO 5000は、オフロードなしで最大46.5GBに達します。
ローカル、レンタル、それともAPI?
8秒のクリップの場合:
| 経路 | クリップあたりのコスト | 100クリップ |
|---|---|---|
| MiniMax API, 768p ($0.09/s) | $0.72 | $72 |
| MiniMax API, 2K ($0.13/s) | $1.04 | $104 |
| Rented 5090 (~$0.21–0.54/h, ~5.5 min/clip) | ~$0.023 | ~$2–5 |
| Local 3060 | electricity only | ~3 h each |
レンタルは、解像度とカードによってAPIよりも15倍から50倍安価です — これはワークフローを再編成するのに十分な大きな差です。賢明な使い分け: 失敗したテイクはコストがかからず、プロンプトの調整はほとんどが失敗したテイクであるため、ローカルで実行して反復する。最終レンダリングには5090をレンタルする。2Kが必要な場合、またはライセンスによってweightsが選択肢にならない場合はAPIを使用する。
25分を費やす前にプロンプトを正しく設定する
1テイク25分かかるため、プロンプトの品質は他のどこよりもローカルで重要になります。H3で機能する構造 — 明示的なカメラシーケンス、名前付きの終了フレーム、画像と同じくらい意図的に記述されたサウンド — は、当社のH3ローンチプロンプト分析で詳しく解説されています。
また、トレンドプロンプトで、クリエイターが実際に実行しているものをモデル別にソートして閲覧することもできます。
そして、推測するのではなくリバースエンジニアリングしたいクリップがある場合は、当社のビデオからプロンプトへツールがそのためにあります。リンクを貼り付けるかファイルをアップロードすると、シーン、モーション、カメラワークをカバーする構造化されたプロンプトが返されます — それをH3にローカルで、無料で、好きなだけ何度でも入力できます。
Related Articles
MiniMax H3が3〜5倍高速化:1週間で何が変わったのか
Open weightsが8月3日に公開され、local clipsは25〜45分かかりました。6日後:distilled LoRAs、Sol-Attn、native ComfyUI。今、実際に何が機能するのか。
MiniMax H3 Open Weights が公開されました — そして、3つの注意点があります
H3のウェイトは2026年8月3日にHugging Faceで公開されました。ライセンスは米国、英国、EU、韓国を除外しており、ベースモデルは2Kではなく768pを出力し、そして、1つのパイプラインは約144GBです。実際に提供された内容はこちらです。
MiniMax H3が登場:Promptingに何が変わったか、実際の初週の5つのPrompt付き
Hailuo H3は2026年7月29日に、ネイティブ2K、15-second clips、そしてvideoと同時に生成されるaudioを搭載してリリースされました。クリエイターが初週に実際に機能させたものと、その完全なPromptsをここに紹介します。
