- Blog de Prompts de Video IA - Tutoriales, Consejos y Guías
- MiniMax H3 Ahora es 3-5 veces más rápido: ¿Qué cambió en una semana?
MiniMax H3 Ahora es 3-5 veces más rápido: ¿Qué cambió en una semana?
Cuando los pesos de MiniMax H3 se hicieron públicos el 3 de agosto, el veredicto honesto sobre su ejecución local fue: funciona, y es lento. Nuestra propia prueba en una RTX 3060 tardó 25 minutos 24 segundos para un clip de 5 segundos. <a href="https://x.com/simonw/status/2084719238569435469" rel="nofollow" target="_blank">Simon Willison</a> informó de aproximadamente 45 minutos en un M5 Pro Mac después de una descarga de 115 GB.
Seis días después, esa cifra ha cambiado mucho. No porque MiniMax haya lanzado algo nuevo, sino porque la comunidad lo atacó desde dos direcciones a la vez.
El Deseo y la Concesión, Con Cuatro Días de Diferencia
El 4 de agosto, <a href="https://x.com/deadsun_0/status/2084665247189598695" rel="nofollow" target="_blank">deadsun_0</a> publicó una prueba local de 720p de 5 segundos y escribió:
It took my 3060 33 minutes for these 5 secs at 720p 🤣 Gonna have to use the cloud version of Comfy unless there is a way to make a distilled version of the model for the lower tier cards.
(Esa cifra corrobora independientemente la nuestra — misma tarjeta, mismo rango.)
Para el 7 de agosto, dos personas diferentes habían lanzado distilled LoRAs.
Dos Enfoques Diferentes para el Mismo Problema
Las aceleraciones se dividen en dos categorías, y la distinción es importante porque tienen diferentes costos de calidad.
Categoría 1: Hacer cada paso más barato (sin reentrenamiento)
El 5 de agosto, dos días después de la publicación de los pesos, <a href="https://x.com/xieenze_jr/status/2085060173304156433" rel="nofollow" target="_blank">xieenze_jr</a> anunció los resultados de Sol Engine:
⚡ 3.92× faster on DGX Spark — 480p · 5s · 24 FPS ⚡ 4.52× faster on RTX 5090 — 720p · 5s · 24 FPS Powered by full-stack kernel optimization, Sol-Attn, and cross-step caching — using the stock 33B checkpoint, with no distillation, fine-tuning, LoRA, or offline calibration.
Esa última cláusula es la parte importante. Los mismos pesos, el mismo número de pasos, la misma distribución de salida — la ganancia reside puramente en cómo se programa el cómputo.
Dos días después, <a href="https://x.com/sunbaolong_2001/status/2085689404031672372" rel="nofollow" target="_blank">sunbaolong_2001</a> apiló tres nodos de ComfyUI e informó la versión práctica:
Cut MiniMax H3 render times from 10 mins to 3 mins. I stacked 3 speed nodes: Sol-Attn (dynamic compute focus), SageAttention (GPU-optimized attention), EasyCache (temporal feature reuse). Up to 3.2x faster with zero visual degradation.
Categoría 2: Usar menos pasos (LoRAs destilados)
H3 se lanzó requiriendo entre 15 y 20 pasos de muestreo. La destilación ataca eso directamente.
<a href="https://x.com/blizaine/status/2085554573494657328" rel="nofollow" target="_blank">blizaine</a> lanzó un H3 Distilled LoRA en Maestro v1.6.1 el 7 de agosto — un ejemplo de 6 pasos con aproximadamente una aceleración de 5×, con la honesta advertencia "results a little rough, but it's still early."
El mismo día, <a href="https://x.com/ostrisai/status/2085720799198286149" rel="nofollow" target="_blank">ostrisai</a> estaba impulsando un Turbo Time LoRA hacia un solo paso:
Trying really hard to get my Minimax H3 Turbo Time LoRA down to one step. These are the current 1 step results. 2-8 steps obviously works better. Will probably just release that soon.
La lectura realista: 2–8 pasos es el rango utilizable hoy, 1 paso es una demostración de investigación. Y a diferencia del trabajo de kernel, la destilación sí cambia la salida — ese es el compromiso que estás haciendo.
<a href="https://x.com/TheDarkWebDev/status/2085516269374103830" rel="nofollow" target="_blank">TheDarkWebDev</a>, quien realizó comparaciones entre métodos, llegó a un resumen razonable: mejor calidad con Sol-Attn, con Turbo de 12 pasos como "a great compromise."
Soporte Nativo de ComfyUI Implementado
Cuando H3 se lanzó el 31 de julio, el soporte de ComfyUI era a través de nodos asociados que accedían a la API de MiniMax — no estabas ejecutando nada localmente. El <a href="https://x.com/ComfyUI/status/2085761749438124469" rel="nofollow" target="_blank">7 de agosto eso cambió</a>:
MiniMax H3 is open weights and native in ComfyUI. Text, images, video, and audio in one model, video and stereo audio out in a single pass, running locally or on Comfy Cloud.
Eso elimina la mayor barrera práctica para la mayoría de las personas, quienes anteriormente elegían entre un entorno Python construido a mano y no ejecutarlo en absoluto.
Qué Implica Esto para el Cálculo de Costos
Publicamos una comparación local-versus-alquiler-versus-API hace unos días basada en tiempos previos a la optimización. La ola de optimización lo cambia materialmente. Usando nuestra línea base medida de la 3060 y aplicando los multiplicadores reportados:
| Approach | Clip de 5s, ~480p | Notes |
|---|---|---|
| Stock local (nuestra medición) | 25 min | Baseline, RTX 3060 |
| + node stack (~3.2×) | ~8 min | Si el multiplicador se mantiene en esta tarjeta |
| + distilled LoRA (~5×) | ~5 min | Quality cost, aún temprano |
| Rented 5090 con optimizaciones | bastante menos de un minuto | ~$0.02 por clip |
Trate las filas intermedias como proyecciones, no como mediciones — esos multiplicadores fueron reportados en otro hardware, y una máquina con RAM limitada tiene gastos generales fijos que ningún attention kernel elimina. Pero la dirección es inequívoca, y mueve el H3 local de "experimentar durante la noche" a "iterar durante una sesión de trabajo".
Nuestro completo hardware walkthrough, incluyendo los seis errores que encontrará al instalarlo, está en running MiniMax H3 locally on an RTX 3060.
Mientras Tanto, la Posición en el Benchmark
<a href="https://x.com/DesignArena/status/2084762941891731916" rel="nofollow" target="_blank">DesignArena</a> colocó a H3 en segundo lugar general en Video Arena con un Elo de 1325 — un salto de 209 puntos sobre el anterior Hailuo 2.3 Pro de MiniMax, detrás de Gemini Omni Flash y por delante de Seedance 2.0 Mini.
Más relevante para cualquiera que lea esto: entre los open-weight models ocupa el primer lugar, por delante de LTX 2.3 y Kandinsky 5.0 Pro, que DesignArena calificó como un nuevo state of the art para la open-weight video generation por una brecha sustancial.
Ese es el contexto de todo el esfuerzo de optimización. La gente no está trabajando duro en la inference speed por un mid-tier model; lo están haciendo porque el quality ceiling vale la pena.
Lo Que la Gente Está Creando Realmente
La producción de la semana superó los clips de prueba:
- <a href="https://x.com/banodoco/status/2085448168246739016" rel="nofollow" target="_blank">banodoco</a> demostró reference-based inpainting con H3 — editando metraje existente en lugar de generar desde cero.
- <a href="https://x.com/FellMentKE/status/2084953450916577342" rel="nofollow" target="_blank">FellMentKE</a> produjo una escena de mockumentary estilo Office de 15 segundos con personajes consistentes, que superó las 860,000 vistas.
- <a href="https://x.com/NsitnovSitnov/status/2085467721399959777" rel="nofollow" target="_blank">NsitnovSitnov</a> hizo un cortometraje de 60 segundos con dos personajes completamente localmente en una RTX Pro 6000, manteniendo los rostros consistentes a lo largo de toda la secuencia.
El hilo conductor es la consistency across a sequence — aquello que antes obligaba a la gente a volver a la edición manual.
Una cosa más que vale la pena saber: MiniMax ha <a href="https://x.com/RyanLeeMiniMax/status/2085413361207144738" rel="nofollow" target="_blank">anunciado un AMA</a> con todo el H3 research team en r/StableDiffusion. Si tiene architecture questions que la model card no responde, ahí es donde debe hacerlas.
La Advertencia Que No Ha Cambiado
Nada de esto cambia la licencia. La community licence de H3 todavía excluye a la European Union, the United Kingdom, South Korea y the United States — y la restricción cubre los generated outputs, no solo los weights. La hosted API sigue estando disponible globalmente. Cubrimos los términos completos en what actually shipped with the H3 open weights.
El Prompting Sigue Decidiendo el Resultado
Una iteración más rápida hace que la calidad del prompt sea más valiosa, no menos — simplemente descubres antes si un prompt funciona. Las estructuras que se mantienen en H3 se desglosan en nuestro análisis de prompts de la semana de lanzamiento, y puedes explorar lo que los creadores están ejecutando, ordenado por modelo, en prompts de tendencia.
Si prefieres empezar con un clip que te guste en lugar de una caja en blanco, nuestra herramienta video to prompt toma un enlace o una carga y devuelve un prompt estructurado que cubre la escena, el movimiento y el trabajo de cámara — lo que, a 5 minutos por toma en lugar de 25, ahora puedes permitirte iterar correctamente.
Table of Contents
El Deseo y la Concesión, Con Cuatro Días de DiferenciaDos Enfoques Diferentes para el Mismo ProblemaCategoría 1: Hacer cada paso más barato (sin reentrenamiento)Categoría 2: Usar menos pasos (LoRAs destilados)Soporte Nativo de ComfyUI ImplementadoQué Implica Esto para el Cálculo de CostosMientras Tanto, la Posición en el BenchmarkLo Que la Gente Está Creando RealmenteLa Advertencia Que No Ha CambiadoEl Prompting Sigue Decidiendo el ResultadoRelated Articles
Ejecutar MiniMax H3 Localmente en una RTX 3060: Probado, Seis Trampas
Ejecutamos MiniMax H3 en una 12GB RTX 3060 con solo 16GB de RAM. Funciona: 25 minutes por 5-second clip, 4.7GB VRAM peak. Los exactos files, flags y seis trampas.
MiniMax H3 Open Weights Ya Están Disponibles — Y Hay Tres Pegas
Los H3 weights llegaron a Hugging Face el 3 de agosto de 2026. La licencia excluye a EE. UU., Reino Unido, la UE y Corea del Sur, el modelo base genera 768p en lugar de 2K, y un pipeline es de aproximadamente 144GB. Esto es lo que realmente se lanzó.
MiniMax H3 ya está aquí: ¿Qué cambió para Prompting, con 5 Prompts reales de la primera semana?
Hailuo H3 se lanzó el 29 de julio de 2026 con 2K nativo, 15-second clips y audio generado junto con video. Aquí está lo que los creadores realmente lograron hacer funcionar en la primera semana, con los full prompts.
