MiniMax H3 Open Weights Ya Están Disponibles — Y Hay Tres Inconvenientes

VideoToPrompton a day ago8 min read

La espera ha terminado. MiniMaxAI/MiniMax-H3 se lanzó en Hugging Face el 3 de agosto de 2026, aproximadamente un día después de que la cuenta regresiva expirara sin un lanzamiento. Obtuvo más de 1.400 'me gusta' en cuestión de horas.

Revisamos el repositorio directamente en lugar de basarnos en los hilos de anuncios, y tres cosas en él difieren drásticamente de cómo se comercializó el lanzamiento. Si planeas ejecutar H3 localmente, lee primero la sección de la licencia; para muchos lectores, es decisiva.

Estado a 4 de agosto de 2026

ElementoEstado
H3 a través de API alojada (fal, ComfyUI, Runway, Leonardo, Topview)✅ En vivo desde el 31 de julio, disponible globalmente
Pesos abiertos oficiales en Hugging FacePublicado el 3 de agosto
Utilizable bajo la licencia en EE. UU. / Reino Unido / UE / Corea del SurExcluido — ver abajo
Resolución de salida del modelo base⚠️ 768p; 2K necesita una segunda pasada

Punto 1: La licencia excluye a EE. UU., Reino Unido, UE y Corea del Sur

Este es el detalle más importante y menos reportado. H3 se distribuye bajo el MiniMax H3 Community License Agreement, no Apache o MIT. La concesión está limitada a un "Territorio Aplicable", definido como:

"Territorio Aplicable" significa a nivel mundial, excluyendo los Territorios Excluidos. "Territorios Excluidos" significa la Unión Europea, el Reino Unido, la República de Corea y los Estados Unidos de América.

Así que, si estás en EE. UU., Reino Unido, UE o Corea del Sur, la licencia comunitaria no te otorga el derecho de usar, reproducir, distribuir o modificar los weights. MiniMax invita a las personas en esas regiones a contactarlos para obtener una licencia separada "otorgada en base a controles y salvaguardas robustos".

MiniMax publicó un docs/QA-about-License.md explicando el razonamiento, y hay que reconocer que es directo al respecto:

Regiones como la UE, el Reino Unido, Corea del Sur y EE. UU. están actualmente desarrollando o aplicando regulaciones relacionadas con la AI que pueden tener implicaciones específicas para los modelos de video generativos, especialmente en áreas como la generación de likeness, los derechos de autor, la seguridad del contenido y el despliegue responsable.

Citan la aplicación de la EU AI Act, la incertidumbre regulatoria en el Reino Unido y Corea del Sur, y — notablemente — que MiniMax está "involucrado en procedimientos legales en curso relacionados con derechos de autor específicamente concernientes a la AI de video generativa" en EE. UU. Su posición declarada es que la limitación significa "todavía no, no nunca".

Distinción importante: esto restringe los weights, no la API alojada. La API sigue estando disponible globalmente, porque MiniMax controla la infraestructura de servicio y puede aplicar salvaguardas allí. Si te encuentras en un territorio excluido, fal, Runway, Leonardo, los nodos asociados de ComfyUI y el propio Hailuo siguen estando abiertos para ti. Simplemente no puedes ejecutar legalmente el model descargado por ti mismo.

Problema 2: "2K Nativo" Es un Proceso de Dos Etapas

El mensaje de lanzamiento enfatizó el 2K nativo. El repositorio es más preciso. De la tarjeta del modelo:

Resolución de salida: Admite varias dimensiones de resolución. El lado más corto se establece en 768 píxeles por defecto. La generación 2K se puede lograr con H3-Regenerate-2K.

H3 es en realidad un sistema de tres módulos:

  • H3-Context-IR — toma tu entrada multimodal desordenada y la refina en una "Representación Intermedia de Contexto" que el generador consume.
  • H3-Base — genera audio y video a 768p.
  • H3-Regenerate-2K — reintroduce el resultado de 768p más el contexto original a través de H3 para regenerar a 2K.

Así que 2K es un pase de regeneración, no un modo de salida nativo del modelo base. Ese no es un mal diseño — regenerar con el contexto original disponible produce un mejor detalle que el escalado — pero significa que tu pipeline local son dos pases de generación, no uno, si quieres 2K.

El resto de las especificaciones confirmadas: salidas de 4 a 15 segundos, 24 FPS, audio estéreo de 32 kHz, relaciones de aspecto de 21:9 a 9:16, y soporte de diálogo estable en 11 idiomas (árabe, chino, inglés, francés, alemán, italiano, japonés, coreano, portugués, ruso, español).

Problema 3: Es Muy Grande

Antes del lanzamiento, <a href="https://x.com/cheatyyyy/status/2083863807211049110" rel="nofollow" target="_blank">cheatyyyy</a> leyó los PRs abiertos que añadían soporte H3 a ComfyUI y diffusers, e informó de "33B for the main DiT and a pruned 20b variant", terminando con "idk if this is going to run on a 3090 bros".

La cifra de 33B cuadra — la carpeta transformer es de 66.3GB, lo que equivale a 33B parámetros en bf16. La variante podada de 20B no está en el repositorio publicado. Puede que aún llegue; no se envió el primer día.

El repositorio totaliza aproximadamente 499GB, porque contiene dos paquetes completos (FL2VA y Ref2VA) junto con los componentes compartidos. Un único pipeline utilizable es aproximadamente:

ComponenteTamaño (bf16)
Text encoder (Qwen3-VL-32B)66.7GB
Transformer (DiT, 33B)66.3GB
Video VAE10.4GB
Audio VAE0.6GB
Total~144GB

Así que la respuesta a "¿funcionará en una 3090?" es no, no en bf16, y ni de cerca. La cuantificación de la comunidad es donde esto se pone interesante — el repositorio de pre-lanzamiento ya estaba enviando una versión int8 del codificador de texto antes de que se publicaran los pesos, lo que te dice dónde está la presión.

Las Dos Variantes

El lanzamiento incluye dos modelos base con diferentes modos de entrada:

  • H3-Base-FL2VA (primer y último fotograma): cero imágenes da texto a video, una imagen da condicionamiento de primer o último fotograma, dos imágenes generan la transición entre ellas.
  • H3-Base-Ref2VA (omni-referencia): hasta 9 imágenes, 3 clips de video y 3 clips de audio, con un límite estricto de 12 archivos en total. Cada clip de video o audio debe durar entre 2 y 15 segundos, y la duración total no puede exceder los 15 segundos. El audio no puede ser la única entrada — debe acompañar a una imagen o video.

Esos límites de referencia coinciden con lo que fal publicó en el lanzamiento, y son la razón por la que la consistencia de múltiples personajes funcionó tan bien para los creadores en la primera semana.

La parte más importante para el prompting

Enterrada en la tarjeta del modelo hay una línea que vale la pena tomar en serio:

H3-Context-IR is critical to the quality of the final output, so we strongly recommend incorporating it into your generation pipeline or following the "Prompting Guidance" to build your own context-processing system.

En otras palabras, MiniMax está diciendo que una gran parte de la calidad de la salida proviene de cómo se preprocesa la entrada en un contexto estructurado, antes de que el generador se ejecute. Envían dos guías de escritura de prompts en el repositorio (docs/VIDEO_PROMPT_WRITING_GUIDE_base_en.md y ..._ref_en.md) precisamente para esto.

Esto valida lo que los creadores acordaron en la primera semana sin conocer la arquitectura: los prompts que funcionaron fueron aquellos que preestructuraron la solicitud —secuenciación explícita de la cámara, un fotograma final nombrado, bloques etiquetados para estilo e iluminación. Desglosamos esos patrones, incluyendo una plantilla de toma continua que se difundió entre los creadores, en nuestro artículo sobre los prompts de lanzamiento de MiniMax H3. La estructura base para escribir a esta familia de modelos se encuentra en la guía de prompts de Hailuo H3.

Si todavía estás usando la API alojada —lo cual, dada la licencia, muchos lectores harán— <a href="https://x.com/sidharth_raja/status/2084063524452753424" rel="nofollow" target="_blank">sidharth_raja</a> señaló una diferencia de precio real entre proveedores: fal a $0.26/segundo frente a OpenRouter a $0.13/segundo. En un clip de 15 segundos, eso es $3.90 contra $1.95.

Mantente al tanto de lo que están usando los creadores

Recopilamos continuamente prompts de video de IA de X y los clasificamos por modelo, por lo que los ejemplos de H3 y Hailuo se acumulan a medida que la gente los publica —explóralos en trending prompts.

Si quieres ir en la otra dirección y recuperar el prompt detrás de un clip que has visto, eso es lo que hace nuestra herramienta video to prompt: pega un enlace o sube el video y te devolverá un prompt estructurado que cubre la escena, el movimiento y el trabajo de cámara.