- Blog de Prompts de Video IA - Tutoriales, Consejos y Guías
- MiniMax H3 Open Weights Ya Están Disponibles — Y Hay Tres Pegas
MiniMax H3 Open Weights Ya Están Disponibles — Y Hay Tres Pegas
La espera ha terminado. MiniMaxAI/MiniMax-H3 se lanzó en Hugging Face el 3 de agosto de 2026, aproximadamente un día después de que la cuenta regresiva expirara sin un lanzamiento. Obtuvo más de 1.400 'me gusta' en cuestión de horas.
Revisamos el repositorio directamente en lugar de basarnos en los hilos de anuncios, y tres cosas en él difieren drásticamente de cómo se comercializó el lanzamiento. Si planeas ejecutar H3 localmente, lee primero la sección de la licencia; para muchos lectores es decisiva.
Estado a 4 de agosto de 2026
| Elemento | Estado |
|---|---|
| H3 vía API alojada (fal, ComfyUI, Runway, Leonardo, Topview) | ✅ En vivo desde el 31 de julio, disponible globalmente |
| Pesos oficiales abiertos en Hugging Face | ✅ Publicado el 3 de agosto |
| Utilizable bajo la licencia en EE. UU. / Reino Unido / UE / Corea del Sur | ❌ Excluido — ver abajo |
| Resolución de salida del modelo base | ⚠️ 768p; 2K necesita una segunda pasada |
Punto 1: La licencia excluye a EE. UU., Reino Unido, UE y Corea del Sur
Este es el detalle más importante y menos reportado. H3 se distribuye bajo el MiniMax H3 Community License Agreement, no Apache ni MIT. La concesión está limitada a un "Territorio Aplicable", definido como:
"Applicable Territory" means worldwide, excluding the Excluded Territories. "Excluded Territories" means the European Union, the United Kingdom, the Republic of Korea and the United States of America.
Así que, si te encuentras en EE. UU., Reino Unido, UE o Corea del Sur, la licencia comunitaria no te otorga el derecho de usar, reproducir, distribuir o modificar los pesos. MiniMax invita a las personas en esas regiones a contactarlos para obtener una licencia separada "otorgada basada en controles y salvaguardas robustos".
MiniMax publicó un docs/QA-about-License.md explicando el razonamiento, y hay que reconocer que es directo al respecto:
Regions such as the EU, UK, South Korea, and the US are currently developing or enforcing AI-related regulations that may have specific implications for generative video models, especially around areas such as likeness generation, copyright, content safety, and responsible deployment.
Citan la aplicación de la EU AI Act, la incertidumbre regulatoria en el Reino Unido y Corea del Sur, y — notablemente — que MiniMax está "involucrado en procedimientos legales en curso relacionados con derechos de autor específicamente concernientes a la IA de video generativa" en EE. UU. Su posición declarada es que la limitación significa "todavía no, no nunca".
Distinción importante: esto restringe los pesos, no la API alojada. La API permanece disponible globalmente, porque MiniMax controla la infraestructura de servicio y puede aplicar salvaguardas allí. Si te encuentras en un territorio excluido, fal, Runway, Leonardo, los nodos asociados de ComfyUI y el propio Hailuo siguen estando a tu disposición. Simplemente no puedes ejecutar legalmente el modelo descargado por ti mismo.
Problema 2: "2K Nativo" Es un Proceso de Dos Etapas
El mensaje de lanzamiento enfatizó el 2K nativo. El repositorio es más preciso. De la tarjeta del modelo:
Output resolution: Supports various resolution dimensions. The shorter side is set to 768 pixels by default. 2K generation can be achieved with H3-Regenerate-2K.
H3 es en realidad un sistema de tres módulos:
- H3-Context-IR — toma tu entrada multimodal desordenada y la refina en una "Context Intermediate Representation" que el generador consume.
- H3-Base — genera audio y video a 768p.
- H3-Regenerate-2K — alimenta el resultado de 768p más el contexto original de nuevo a través de H3 para regenerar a 2K.
Así que 2K es un pase de regeneración, no un modo de salida nativo del modelo base. Ese no es un mal diseño —regenerar con el contexto original disponible produce mejor detalle que el escalado— pero significa que tu pipeline local son dos pases de generación, no uno, si quieres 2K.
El resto de las especificaciones confirmadas: salidas de 4 a 15 segundos, 24 FPS, audio estéreo de 32 kHz, relaciones de aspecto desde 21:9 hasta 9:16, y soporte de diálogo estable en 11 idiomas (árabe, chino, inglés, francés, alemán, italiano, japonés, coreano, portugués, ruso, español).
Problema 3: Es Muy Grande
Antes del lanzamiento, <a href="https://x.com/cheatyyyy/status/2083863807211049110" rel="nofollow" target="_blank">cheatyyyy</a> leyó los PRs abiertos que añadían soporte H3 a ComfyUI y diffusers, e informó "33B for the main DiT and a pruned 20b variant", terminando con "idk if this is going to run on a 3090 bros".
La cifra de 33B concuerda — la carpeta transformer es de 66.3GB, lo que equivale a 33B parámetros en bf16. La variante podada de 20B no está en el repositorio publicado. Puede que aún llegue; no se envió el primer día.
El repositorio totaliza aproximadamente 499GB, porque contiene dos paquetes completos (FL2VA y Ref2VA) junto con los componentes compartidos. Un único pipeline utilizable es aproximadamente:
| Component | Size (bf16) |
|---|---|
| Text encoder (Qwen3-VL-32B) | 66.7GB |
| Transformer (DiT, 33B) | 66.3GB |
| Video VAE | 10.4GB |
| Audio VAE | 0.6GB |
| Total | ~144GB |
Así que la respuesta a "funcionará en una 3090" es no, no en bf16, y ni de cerca.
Actualización: la cuantificación de la comunidad cerró esa brecha en cuestión de días. El repositorio DeepBeepMeep/MiniMax-H3 ahora distribuye compilaciones int8 podadas de ~20B de alrededor de 21GB junto con codificadores de texto GGUF, reduciendo un conjunto de trabajo mínimo a aproximadamente 35GB. Lo probamos de principio a fin en una RTX 3060 de 12GB — funciona, a 25 minutos por clip de 5 segundos, con la VRAM alcanzando un máximo de solo 4.7GB, porque el verdadero cuello de botella resulta ser la RAM del sistema en lugar de la GPU. Guía completa y los seis errores que encontrarás en el camino: running MiniMax H3 locally on an RTX 3060.
Las Dos Variantes
El lanzamiento incluye dos modelos base con diferentes modos de entrada:
- H3-Base-FL2VA (first-and-last-frame): zero images gives text-to-video, one image gives first- or last-frame conditioning, two images generates the transition between them.
- H3-Base-Ref2VA (omni-reference): up to 9 images, 3 video clips and 3 audio clips, with a hard cap of 12 files total. Each video or audio clip must be 2–15 seconds, and total duration cannot exceed 15 seconds. Audio cannot be the sole input — it must accompany an image or video.
Esos límites de referencia coinciden con lo que fal publicó en el lanzamiento, y son la razón por la que la consistencia de múltiples personajes funcionó tan bien para los creadores en la primera semana.
La Parte Más Importante para el Prompting
Enterrada en la tarjeta del modelo hay una línea que vale la pena tomar en serio:
H3-Context-IR is critical to the quality of the final output, so we strongly recommend incorporating it into your generation pipeline or following the "Prompting Guidance" to build your own context-processing system.
En otras palabras, MiniMax está diciendo que una gran parte de la calidad de la salida proviene de cómo se preprocesa la entrada en un contexto estructurado, antes de que el generador se ejecute. Envían dos guías de escritura de prompts en el repositorio (docs/VIDEO_PROMPT_WRITING_GUIDE_base_en.md y ..._ref_en.md) precisamente para esto.
Esto valida lo que los creadores acordaron en la primera semana sin conocer la arquitectura: los prompts que funcionaron fueron aquellos que preestructuraron la solicitud —secuencias de cámara explícitas, un fotograma final nombrado, bloques etiquetados para estilo e iluminación. Desglosamos esos patrones, incluyendo una plantilla de toma continua que se extendió entre los creadores, en nuestro artículo sobre los prompts de lanzamiento de MiniMax H3. La estructura base para escribir a esta familia de modelos se encuentra en la guía de prompts de Hailuo H3.
Si todavía estás utilizando la API alojada —lo cual, dada la licencia, muchos lectores harán— <a href="https://x.com/sidharth_raja/status/2084063524452753424" rel="nofollow" target="_blank">sidharth_raja</a> señaló una diferencia de precio real entre proveedores: fal a $0.26/seg frente a OpenRouter a $0.13/seg. En un clip de 15 segundos, eso es $3.90 frente a $1.95.
Mantente al Tanto de lo que los Creadores Están Ejecutando
Recopilamos continuamente prompts de video de AI de X y los clasificamos por modelo, por lo que los ejemplos de H3 y Hailuo se acumulan a medida que la gente los publica —explóralos en trending prompts.
Si quieres ir en la otra dirección y recuperar el prompt detrás de un clip que has visto, eso es lo que hace nuestra herramienta de video a prompt : pega un enlace o sube el video y te devolverá un prompt estructurado que cubre la escena, el movimiento y el trabajo de cámara.
Table of Contents
Estado a 4 de agosto de 2026Punto 1: La licencia excluye a EE. UU., Reino Unido, UE y Corea del SurProblema 2: "2K Nativo" Es un Proceso de Dos EtapasProblema 3: Es Muy GrandeLas Dos VariantesLa Parte Más Importante para el PromptingMantente al Tanto de lo que los Creadores Están EjecutandoRelated Articles
MiniMax H3 Ahora es 3-5 veces más rápido: ¿Qué cambió en una semana?
Los open weights llegaron el 3 de agosto y los local clips tardaban 25-45 minutos. Seis días después: distilled LoRAs, Sol-Attn, native ComfyUI. Lo que realmente funciona ahora.
MiniMax H3 GGUF en una RTX 3060 de 12GB: Tamaños de Cuantización, VRAM Real, Seis Trampas
Ejecutamos MiniMax H3 en una RTX 3060 de 12GB con 16GB de RAM. Funciona: 25 minutos por clip de 5 segundos, pico de 4.7GB de VRAM. Incluye tamaños de cuantización GGUF (Q4_K_M 19.86GB, Q3_K_M 15.57GB), los archivos y flags exactos, y seis trampas.
MiniMax H3 ya está aquí: ¿Qué cambió para Prompting, con 5 Prompts reales de la primera semana?
Hailuo H3 se lanzó el 29 de julio de 2026 con 2K nativo, 15-second clips y audio generado junto con video. Aquí está lo que los creadores realmente lograron hacer funcionar en la primera semana, con los full prompts.
