MiniMax H3 GGUF en una RTX 3060 de 12GB: Tamaños de Cuantización, VRAM Real, Seis Trampas

VideoToPrompton 14 days ago9 min read

Versión corta: sí, MiniMax H3 funciona en una RTX 3060 de 12GB, y la sorpresa es que la VRAM no es el cuello de botella. El pico de VRAM fue de 4.7GB de 12GB. La RAM del sistema fue la limitación en todo momento.

El costo es el tiempo. Un clip de 5 segundos de 832x480 tardó 25 minutos 24 segundos. Esto hace que H3 local sea excelente para la experimentación gratuita ilimitada e impracticable para producir trabajo terminado.

Todo lo siguiente proviene de una ejecución real en una máquina: RTX 3060 12GB, i5-12490F, 16GB DDR4, un Kingston NVMe sin DRAM, Windows con WSL2.

Lea Esto Primero: La Licencia Excluye a EE. UU., Reino Unido, UE y Corea del Sur

Antes de descargar 35GB, verifique si tiene permiso para usarlo. H3 se distribuye bajo el MiniMax H3 Community License Agreement, no Apache o MIT. La cláusula 5 define:

"Excluded Territories" means the European Union, the United Kingdom, the Republic of Korea and the United States of America.

Y la cláusula IV.4 va más allá de lo que la mayoría de la gente espera: cubre no solo los pesos, sino también lo que se produce con ellos:

You may not use, reproduce, modify, distribute, or display the MiniMax H3 Works or any of their Outputs or results outside the Applicable Territory.

Así que en esas cuatro regiones, los propios videos generados están cubiertos, no solo los archivos del modelo. MiniMax explica el razonamiento en <a href="https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/QA-about-License.md" rel="nofollow" target="_blank">un documento de preguntas y respuestas</a>: la Ley de IA de la UE está en vigor, el Reino Unido y Corea del Sur son incógnitas regulatorias, y en EE. UU. MiniMax está en litigio de derechos de autor en curso específicamente sobre video generativo. Su redacción es "todavía no, no nunca", e invitan a las personas en esas regiones a contactarlos para una licencia separada.

La API alojada no está restringida — está disponible globalmente, porque MiniMax opera esa infraestructura y puede aplicar salvaguardias en ella. Si se encuentra en un territorio excluido, la ruta de la API a continuación es la que está abierta para usted. Más detalles en nuestro desglose de lo que realmente se envió con los pesos abiertos.

La Pila Que Funcionó

No es ComfyUI nativo. Usamos <a href="https://github.com/deepbeepmeep/Wan2GP" rel="nofollow" target="_blank">WanGP (Wan2GP) v12.41+</a>, que está construido exactamente para esta clase de hardware, con Python 3.11.5 en un venv creado con uv y torch 2.10.0+cu130.

La versión de torch no es opcional — vea la trampa 1. La propia guía de WanGP para la serie RTX 30 es Python 3.11.x con PyTorch 2.10 y CUDA 13.0, y su documentación advierte explícitamente contra 2.8.0 (fuga de memoria al cambiar modelos) y 2.9.0 (un problema de convolución 3D que dispara la VRAM del VAE).

El conjunto mínimo de modelos funcionales es de aproximadamente 35GB, todo del repositorio de la comunidad <a href="https://huggingface.co/DeepBeepMeep/MiniMax-H3" rel="nofollow" target="_blank">DeepBeepMeep/MiniMax-H3</a> — no el oficial:

ArchivoTamañoRol
MiniMax-H3-FL2VA-pruned_rank8_int8_convrot.safetensors21GBDiT, pruned to ~20B, int8
qwen3vl-32B-MiniMax-H3-Q2_K.gguf8.0GBText encoder
MiniMax-H3-video_vae_fp16.safetensors4.9GBVideo VAE
MiniMax-H3-audio_vae_fp32.safetensors578MBAudio VAE

Para contextualizar: el DiT oficial bf16 es de 66.28GB (33B parámetros) y el repositorio completo MiniMaxAI/MiniMax-H3 es de aproximadamente 498GB. El paquete oficial de ComfyUI es de 57GB. La poda y cuantificación de la comunidad es lo que permite que esto quepa.

Banderas de lanzamiento, las tres requeridas:

--profile 5 --perc-reserved-mem-max 0.1 --attention sdpa

Seis Trampas

Cada una de estas trampas fue descubierta al encontrar el error, no leyendo la documentación.

1. torch debe ser cu130, no cu128. En cu128, los int8 kernels silenciosamente recurren a la eager execution. Las mediciones de la comunidad sitúan el muestreo en 6.12 s/it en lugar de 1.92 s/it — una penalización de 3.19× por un error que no produce ningún error message. Confirma que funcionó buscando esta línea al inicio:

[Quanto][INT8] Injected int8 kernels ACTIVE (backend=triton)

2. El profile 4 predeterminado va directamente a CUDA OOM. Necesitas --profile 5. WanGP describe el profile 5 como "VerylowRAM_LowVRAM (Fail safe): at least 24 GB of RAM and 10 GB of VRAM" — así que 16GB de RAM está por debajo del mínimo establecido. Aun así, funciona, gracias al archivo de paginación NVMe. Esa es también la razón por la que un DRAM-less SSD perjudica aquí.

3. SageAttention falla por completo en H3 para la serie RTX 30. Sage 1.0.6 lanza AssertionError: varlen only support head_dim [64, 128]. Las RTX 30xx no pueden usar Sage 2, por lo que la única opción es --attention sdpa. En las series 40 y 50, Sage 2.2 funciona y los informes de la comunidad sitúan el ahorro en torno al 30%.

4. hf_xet detiene las descargas grandes en cero bytes. El video VAE se quedó en 0 durante ocho minutos. Establecer HF_HUB_DISABLE_XET=1 lo restauró a 18MB/s inmediatamente.

5. Los GGUF llama.cpp CUDA kernels no están disponibles — el registro dice [GGUF][llama.cpp CUDA] kernels unavailable, using fallback. Así que usa el int8_convrot DiT en lugar de un GGUF DiT. GGUF sigue siendo la opción correcta para el text encoder, donde Q2_K ahorra mucha RAM.

6. Un system proxy interceptará localhost y Gradio muere con un 503: Couldn't start the app because 'http://localhost:7860/gradio_api/startup-events' failed. Establece NO_PROXY=localhost,127.0.0.1; el tráfico saliente seguirá pasando por el proxy.

Extra, si tu C drive tiene poco espacio: redirige UV_CACHE_DIR, TMP, TEMP y HF_HOME a otra unidad antes de empezar.

Rendimiento Medido

Todo en la misma 3060, 20 pasos:

Resolución / fotogramasTiempo por clipPor paso
608x352 / 73 frames (3.0s)19 min 50 s
832x480 / 124 frames (5.2s)25 min 24 s71.8 s
864x480 / 124 frames (5.2s)28 min 38 s84 s
1280x736 / 192 frames (8s)~3 h (estimado, no ejecutado)

Peak VRAM: 4.7–4.8GB de 12GB. Free system RAM: 0.2GB. Esa es toda la historia — la GPU está inactiva mientras la máquina swaps.

La primera fila es la que vale la pena observar. Bajar a 608x352 con 73 frames reduce el token count a aproximadamente el 30% de la ejecución de 864x480, y sin embargo, el tiempo solo disminuye de 28.6 minutos a 19.8 — ni de lejos proporcional. La razón es que en una 16GB machine cada paso retransmite los 21GB de weights desde NVMe, y ese overhead es fijo independientemente de la resolution. Así que "simplemente renderizar más pequeño" apenas ayuda cuando estás RAM-limited. Añadir RAM es la solución; reducir el canvas no lo es.

La comparación que lo demuestra: el equipo de ComfyUI midió 480p/5s en aproximadamente 9 minutos en la misma 3060 con 32GB de RAM. Duplicar la system memory vale aproximadamente 2.8× aquí. Si estás eligiendo qué actualizar, compra RAM, no una GPU más grande.

Salida verificada con ffprobe: h264 video más AAC stereo at 32kHz — audio nativo genuino generado en la misma pasada, no añadido después — 24fps, 124 frames = 5.167 segundos.

Restricciones que no puedes evitar con prompts

  • No 2K localmente. Los pesos abiertos renderizan en un lienzo de lado corto de 768, máximo 768x1344. El 2K anunciado proviene de un pase de In-Context Regeneration del lado de la API.
  • Los recuentos de fotogramas deben ser 17k+5: 73, 124, 175, 192.
  • Ambas dimensiones deben ser múltiplos de 32. Por eso 720p se escribe 1280x736 — 720 no es divisible por 32.
  • La duración escala mal. Números de la comunidad de una 5090: 5s = 168s, 7s = 282s, mientras que 15s se ejecuta en cualquier lugar de 7 a 50 minutos dependiendo del ajuste. Tres clips de 8 segundos son mucho más baratos que un clip de 15 segundos.
  • Aún no hay LoRA destilado o lightning, por lo que 15–20 pasos es el mínimo. Actualizado el 8 de agosto: esto ya no es cierto. Los LoRA destilados se lanzaron el 7 de agosto (6 pasos con una aceleración de aproximadamente 5×), y el trabajo a nivel de kernel — Sol-Attn más caching — reporta 3–4.5× en el stock checkpoint sin reentrenamiento. ComfyUI también obtuvo soporte nativo para H3. Consulta MiniMax H3 just got 3-5x faster para ver los números y las compensaciones de calidad. Las compilaciones cuantificadas también siguen llegando — GGUF Q4_K_M a 19.86GB, Q3_K_M a 15.57GB, además de las variantes NVFP4 e INT4.

Otro hardware, según informes de la comunidad: una 5090 con SageAttention hace 1280x736/5s en 168s (242s sin), y con SM120 sparse attention más EasyCache, 15 segundos bajan de 55 minutos a unos 7. Una 4090 ajustada hace 362 fotogramas en 9.6 minutos. Una RTX PRO 5000 alcanza un pico de 46.5GB sin ninguna descarga.

¿Local, Alquilado o API?

Para un clip de 8 segundos:

RutaCosto por clip100 clips
API de MiniMax, 768p ($0.09/s)$0.72$72
API de MiniMax, 2K ($0.13/s)$1.04$104
5090 alquilada (~$0.21–0.54/h, ~5.5 min/clip)~$0.023~$2–5
3060 localsolo electricidad~3 h cada uno

Alquilar es de 15× a 50× más barato que la API dependiendo de la resolución y la tarjeta — una brecha lo suficientemente grande como para reorganizar un flujo de trabajo. La división sensata: ejecutar localmente para iterar, porque las tomas fallidas no cuestan nada y el refinamiento de prompts son en su mayoría tomas fallidas; alquilar una 5090 para renderizar finales; usar la API cuando necesites 2K, o cuando la licencia signifique que los pesos no son una opción para ti.

Haz bien tus prompts antes de gastar 25 minutos

A 25 minutos por toma, la calidad del prompt importa más localmente que en cualquier otro lugar. Las estructuras que funcionan en H3 — secuenciación explícita de la cámara, un fotograma de cierre nombrado, sonido descrito tan deliberadamente como la imagen — se desglosan en nuestro análisis de prompts de lanzamiento de H3.

También puedes explorar lo que los creadores están ejecutando realmente, ordenado por modelo, en trending prompts.

Y si tienes un clip que quieres aplicar ingeniería inversa en lugar de adivinar, para eso sirve nuestra herramienta video to prompt : pega un enlace o sube el archivo y te devolverá un prompt estructurado que cubre la escena, el movimiento y el trabajo de cámara — el cual podrás alimentar a H3 localmente, de forma gratuita, tantas veces como quieras.