MiniMax H3 GGUF を 12GB RTX 3060 で動かす: 量子化サイズ・実測VRAM・6つの落とし穴

VideoToPrompton 14 days ago10 min read

短い答え:はい、MiniMax H3は12GB RTX 3060で動作します。驚くべきことに、VRAMはボトルネックではありませんでした。ピークVRAMは12GB中4.7GBでした。システムRAMが常に制約となっていました。

コストは時間です。5秒間の832x480クリップの生成には25分24秒かかりました。このため、ローカルH3は無制限の無料実験には優れていますが、完成品の制作には実用的ではありません。

以下は、RTX 3060 12GB、i5-12490F、16GB DDR4、DRAMレスのKingston NVMe、WSL2を搭載したWindowsという1台のマシンでの実際の実行結果です。

まずお読みください:ライセンスは米国、英国、EU、韓国を除外します

35GBをダウンロードする前に、使用が許可されているか確認してください。H3はApacheやMITではなく、MiniMax H3 Community License Agreementの下で提供されています。第5条では次のように定義されています。

"Excluded Territories" means the European Union, the United Kingdom, the Republic of Korea and the United States of America.

そして、第IV.4条はほとんどの人が予想する以上に踏み込んでおり、ウェイトだけでなく、それらを使って作成したものも対象となります。

You may not use, reproduce, modify, distribute, or display the MiniMax H3 Works or any of their Outputs or results outside the Applicable Territory.

したがって、これら4つの地域では、モデルファイルだけでなく、生成された動画自体も対象となります。MiniMaxは、<a href="https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/QA-about-License.md" rel="nofollow" target="_blank">Q&Aドキュメント</a>でその理由を説明しています。EU AI Actが施行されており、英国と韓国は規制上の不確実性があり、米国ではMiniMaxが生成ビデオに関する著作権訴訟を抱えています。彼らの言葉は「まだではないが、決してないわけではない」であり、これらの地域のユーザーには別途ライセンスについて問い合わせるよう促しています。

ホスト型APIは制限されていません。MiniMaxがそのインフラストラクチャを運用し、セーフガードを適用できるため、グローバルに利用可能です。除外地域にいる場合、以下のAPIルートが利用可能です。詳細については、オープンウェイトで実際に何が出荷されたかの分析をご覧ください。

動作したスタック

ネイティブのComfyUIではありません。このクラスのハードウェア向けに構築された<a href="https://github.com/deepbeepmeep/Wan2GP" rel="nofollow" target="_blank">WanGP (Wan2GP) v12.41+</a>を、uvで作成したvenv内のPython 3.11.5とtorch 2.10.0+cu130で使用しました。

torchのバージョンは必須です。トラップ1を参照してください。WanGPのRTX 30シリーズ向けガイダンスは、Python 3.11.xとPyTorch 2.10およびCUDA 13.0であり、そのドキュメントでは2.8.0(モデル切り替え時のメモリリーク)と2.9.0(VAE VRAMを爆発させる3D畳み込みの問題)を明示的に警告しています。

最小限の動作モデルセットは約35GBで、すべて公式のものではなく、コミュニティの<a href="https://huggingface.co/DeepBeepMeep/MiniMax-H3" rel="nofollow" target="_blank">DeepBeepMeep/MiniMax-H3</a>リポジトリからのものです。

ファイルサイズ役割
MiniMax-H3-FL2VA-pruned_rank8_int8_convrot.safetensors21GBDiT, pruned to ~20B, int8
qwen3vl-32B-MiniMax-H3-Q2_K.gguf8.0GBText encoder
MiniMax-H3-video_vae_fp16.safetensors4.9GBVideo VAE
MiniMax-H3-audio_vae_fp32.safetensors578MBAudio VAE

参考までに:公式のbf16 DiTは66.28GB(33Bパラメータ)で、完全なMiniMaxAI/MiniMax-H3リポジトリは約498GBです。ComfyUIの公式バンドルは57GBです。コミュニティによるプルーニングと量子化が、これを適合させるための鍵です。

起動フラグ(3つすべて必須):

--profile 5 --perc-reserved-mem-max 0.1 --attention sdpa

6つの落とし穴

これらはそれぞれ、ドキュメントを読むのではなく、エラーに遭遇することで発見されました。

1. torchはcu128ではなくcu130である必要があります。 cu128では、int8カーネルはサイレントにeager executionにフォールバックします。コミュニティの測定によると、サンプリングは1.92 s/itではなく6.12 s/itとなり、エラーメッセージを出さない間違いに対して3.19倍のペナルティが発生します。起動時にこの行を探して、動作したことを確認してください。

[Quanto][INT8] Injected int8 kernels ACTIVE (backend=triton)

2. デフォルトのプロファイル4は直接CUDA OOMになります。 --profile 5が必要です。WanGPはプロファイル5を「VerylowRAM_LowVRAM (Fail safe): 少なくとも24 GBのRAMと10 GBのVRAM」と説明しています。つまり、16GBのRAMは提示された最低要件を下回っています。それでもNVMeページファイルを頼りに動作します。そのため、DRAMレスSSDがここでは不利になります。

3. RTX 30シリーズでは、SageAttentionがH3で完全に失敗します。 Sage 1.0.6はAssertionError: varlen only support head_dim [64, 128]をスローします。RTX 30xxはSage 2を使用できないため、唯一の選択肢は--attention sdpaです。40シリーズおよび50シリーズでは、Sage 2.2が動作し、コミュニティの報告では約30%の節約になるとされています。

4. hf_xetは大きなダウンロードをゼロバイトで停止させます。 ビデオVAEは8分間0バイトのままでした。HF_HUB_DISABLE_XET=1を設定すると、すぐに18MB/sに回復しました。

5. GGUF llama.cpp CUDAカーネルが利用できません — ログには[GGUF][llama.cpp CUDA] kernels unavailable, using fallbackと表示されます。したがって、GGUF DiTではなくint8_convrot DiTを使用してください。GGUFは、Q2_Kが多くのRAMを節約するtext encoderには依然として適切な選択です。

6. システムプロキシがlocalhostを傍受します そしてGradioは503エラーで停止します: Couldn't start the app because 'http://localhost:7860/gradio_api/startup-events' failedNO_PROXY=localhost,127.0.0.1を設定してください。アウトバウンドトラフィックは引き続きプロキシを経由します。

おまけ、Cドライブの容量が少ない場合: 開始する前にUV_CACHE_DIRTMPTEMPHF_HOMEを別のドライブにリダイレクトしてください。

測定されたパフォーマンス

すべて同じ3060で、20ステップでの結果:

解像度 / フレーム数クリップあたりの時間1ステップあたり
608x352 / 73 frames (3.0s)19分50秒
832x480 / 124 frames (5.2s)25分24秒71.8秒
864x480 / 124 frames (5.2s)28分38秒84秒
1280x736 / 192 frames (8s)~3 時間 (推定、未実行)

ピークVRAM: 12GB中4.7~4.8GB。空きシステムRAM: 0.2GB。これが全てです — マシンがスワップしている間、GPUはアイドル状態です。

最初の行は注目に値します。73フレームで608x352に落とすと、トークン数は864x480実行時の約30%に減少しますが、時間は28.6分から19.8分にしか減少しません — 全く比例していません。その理由は、16GBのマシンでは、各ステップで21GBのウェイトがNVMeから再ストリームされ、そのオーバーヘッドは解像度に関係なく固定されているためです。したがって、RAMが制限されている場合、「ただ小さくレンダリングする」だけではほとんど役に立ちません。 RAMを追加するのが解決策であり、キャンバスを縮小することではありません。

それを証明する比較: ComfyUIチームは、同じ3060と32GBのRAMで480p/5sを約9分と測定しました。システムメモリを2倍にすると、ここでは約2.8倍の価値があります。アップグレードするものを選択するなら、より大きなGPUではなくRAMを購入してください。

ffprobeで出力検証済み: h264ビデオとAACステレオ32kHz — 後から追加されたものではなく、同じパスで生成された純正ネイティブオーディオ — 24fps、124フレーム = 5.167秒。

プロンプトで回避できない制約

  • ローカルでは2Kは不可。 オープンウェイトは短辺768のキャンバスでレンダリングされ、最大768x1344です。宣伝されている2Kは、API側のIn-Context Regeneration passから得られます。
  • フレーム数は17k+5: 73, 124, 175, 192である必要があります。
  • 両方の寸法は32の倍数である必要があります。 これが、720pが1280x736と表記される理由です — 720は32で割り切れません。
  • 持続時間はうまくスケールしません。 コミュニティからの5090の数値: 5s = 168s、7s = 282s、一方15sはチューニングによって7分から50分の間で実行されます。8秒のクリップ3本は、15秒のクリップ1本よりもはるかに安価です。
  • まだdistilledまたはlightning LoRAはありません。そのため、15~20ステップが最低ラインです。 8月8日更新: これはもはや真実ではありません。Distilled LoRAは8月7日に出荷され(約5倍の高速化で6ステップ)、カーネルレベルの作業 — Sol-Attnとキャッシング — は、再トレーニングなしでストックチェックポイントで3〜4.5倍を報告しています。ComfyUIもネイティブH3サポートを獲得しました。数値と品質のトレードオフについては、MiniMax H3が3〜5倍高速化をご覧ください。量子化ビルドも引き続き登場しています — 19.86GBのGGUF Q4_K_M、15.57GBのQ3_K_M、さらにNVFP4およびINT4バリアントです。

コミュニティレポートによるその他のハードウェア: SageAttentionを搭載した5090は1280x736/5sを168秒で実行し(なしでは242秒)、SM120 sparse attentionとEasyCacheを使用すると、15秒が55分から約7分に短縮されます。チューニングされた4090は362フレームを9.6分で実行します。RTX PRO 5000は、オフロードなしで最大46.5GBに達します。

ローカル、レンタル、それともAPI?

8秒のクリップの場合:

経路クリップあたりのコスト100クリップ
MiniMax API, 768p ($0.09/s)$0.72$72
MiniMax API, 2K ($0.13/s)$1.04$104
Rented 5090 (~$0.21–0.54/h, ~5.5 min/clip)~$0.023~$2–5
Local 3060electricity only~3 h each

レンタルは、解像度とカードによってAPIよりも15倍から50倍安価です — これはワークフローを再編成するのに十分な大きな差です。賢明な使い分け: 失敗したテイクはコストがかからず、プロンプトの調整はほとんどが失敗したテイクであるため、ローカルで実行して反復する最終レンダリングには5090をレンタルする。2Kが必要な場合、またはライセンスによってweightsが選択肢にならない場合はAPIを使用する

25分を費やす前にプロンプトを正しく設定する

1テイク25分かかるため、プロンプトの品質は他のどこよりもローカルで重要になります。H3で機能する構造 — 明示的なカメラシーケンス、名前付きの終了フレーム、画像と同じくらい意図的に記述されたサウンド — は、当社のH3ローンチプロンプト分析で詳しく解説されています。

また、トレンドプロンプトで、クリエイターが実際に実行しているものをモデル別にソートして閲覧することもできます。

そして、推測するのではなくリバースエンジニアリングしたいクリップがある場合は、当社のビデオからプロンプトへツールがそのためにあります。リンクを貼り付けるかファイルをアップロードすると、シーン、モーション、カメラワークをカバーする構造化されたプロンプトが返されます — それをH3にローカルで、無料で、好きなだけ何度でも入力できます。