La mayoría de los modelos de video están tras un inicio de sesión y un contador de créditos. MiniMax H3 no tiene por qué estarlo. Sus pesos abiertos se ejecutan dentro de ComfyUI en tu propia tarjeta gráfica, y una sola pasada devuelve hasta 15 segundos de video a 24 fps con una pista estéreo ya mezclada: diálogo, efectos de sonido y música juntos. Suena a que funciona sin configurar nada, y en gran medida es así, siempre que elijas los archivos del modelo adecuados, escribas los prompts como los espera H3 y sepas cuándo un LoRA realmente ayuda. Este artículo sigue el flujo de trabajo de MiniMax H3 en ComfyUI en el orden en que te encontrarás cada problema: hardware, archivos, los tres modos de generación, prompts, velocidad, LoRA de personaje y clips más largos.
Qué hace realmente MiniMax H3
H3 es un modelo de video omnimodal. En lugar de generar fotogramas sin sonido y pedirle a otra herramienta que añada el audio, sintetiza imagen, voz, efectos y música en la misma pasada. ComfyUI añadió compatibilidad nativa en la versión 0.30.0, así que las plantillas básicas no necesitan ningún nodo personalizado.
Tres modos en un solo modelo
- Texto a video (T2V): solo un prompt. Describe la escena y el modelo devuelve un clip con audio.
- Imagen a video (I2V): una imagen fija, más un primer y un último fotograma opcionales. El modelo rellena el movimiento entre los dos fotogramas.
- Referencia a video (R2V): un prompt más hasta 9 imágenes de referencia, 3 videos de referencia y 3 clips de audio. Tú decides qué referencia controla la identidad, el estilo, el movimiento, la cámara o la voz.
Los pesos se dividen por la misma línea. T2V e I2V usan los checkpoints FL2VA, mientras que R2V usa los checkpoints Ref2VA, así que planea una descarga aparte si quieres los tres modos.
Las cifras que importan
| Especificación | Valor |
|---|
| Duración del clip | Hasta 15 segundos |
| Fotogramas por segundo | 24 fps |
| Audio | Estéreo nativo de 32 kHz |
| Idiomas de voz | 11: árabe, chino, inglés, francés, alemán, italiano, japonés, coreano, portugués, ruso, español |
| Resolución principal | Hasta 2K |
| Preajustes de plantilla | 960×544, 1152×640, 1216×672 |
| Tamaño mínimo utilizable | 384p (256p falla) |
| Regla de tamaño | Ancho y alto en múltiplos de 32 |
💡 Lee con atención la línea de resolución. "Hasta 2K" es el máximo. Una guía de la comunidad describe un lienzo nativo de unos 768 px en el lado corto, así que toma los preajustes de arriba como tu punto de partida realista y prueba tamaños mayores en tu propia tarjeta.
Hardware y realidad del disco
Antes de descargar nada, comprueba lo que tu equipo puede soportar. H3 es un modelo grande, y la distancia entre "funciona" y "funciona bien" es enorme.

VRAM según la clase de tarjeta
Las cifras siguientes proceden de una prueba de rendimiento de la comunidad, no de una especificación oficial, así que espera variaciones según los drivers, la resolución y la cuantización.
| Clase de tarjeta | Qué esperar |
|---|
| 6 GB (clase RTX 2060) | Funciona, pero con detalle borroso, audio más tosco y unos 10 a 15 minutos por clip |
| 12 a 16 GB (clase RTX 4060) | Unos 6 minutos para un clip de 5 segundos a 480p, más limpio que el nivel de 6 GB |
| 24 GB (clase RTX 4090) | Mayor resolución con menos concesiones, y espacio suficiente para entrenar LoRA |
| 32 GB o más (RTX 5090, RTX 6000) | El nivel recomendado, con clips más largos de 15 segundos a mayor resolución |
| Apple Silicon | Una versión NF4 de 4 bits funciona desde tan solo 8 GB, con una caída de calidad visible en escenas complejas |
Archivos del modelo y espacio en disco
Cada componente viene en tres precisiones, y la elección es un equilibrio entre calidad y memoria. Los archivos de difusión INT8 podados y el codificador de texto nvfp4 son los que recomiendan las notas de la plantilla, porque dejan más margen para el propio video. Pasa a INT8 o BF16 solo si te sobra VRAM y ves una diferencia en tus propias pruebas comparativas.
| Archivo | Tamaño | Función |
|---|
| FL2VA INT8 podado ConvRot | 19,5 GB | Recomendado para T2V e I2V |
| FL2VA INT8 ConvRot | 31,7 GB | Opción INT8 más grande |
| FL2VA BF16 | 61,7 GB | Precisión completa |
| Ref2VA INT8 podado ConvRot | 19,5 GB | Recomendado para R2V |
| Qwen3-VL codificador de texto, nvfp4 AWQ | 14,6 GB | Codificador recomendado |
| Qwen3-VL INT8 ConvRot | 25,3 GB | Opción de codificador más grande |
| Qwen3-VL BF16 | 48,0 GB | Codificador de precisión completa |
| Video VAE FP16 | 4,9 GB | Obligatorio |
| Audio VAE FP32 | 0,6 GB | Obligatorio |
La configuración ligera para T2V e I2V (modelo de difusión INT8 podado, codificador de texto nvfp4 y ambos VAE) suma unos 39,6 GB. Añade otros 19,5 GB si quieres R2V. Guárdalo todo en una unidad NVMe, porque cargar 40 GB desde un disco mecánico es un suplicio.

Instalación local en ComfyUI
Actualiza y abre la plantilla
- Actualiza ComfyUI a 0.30.0 o posterior.
- Abre Workflow, Browse Templates, Video y elige una plantilla de MiniMax H3.
- Coloca los archivos descargados en
models/diffusion_models/, models/text_encoders/ y models/vae/.
- Reinicia ComfyUI para que los cargadores vean los archivos nuevos.
Haz primero una prueba T2V corta y de baja resolución. Una buena primera prueba es un clip a 384p con una sola frase de diálogo y un efecto de sonido evidente, como una puerta que se cierra. Si aparece la imagen pero el audio está en silencio, lo más probable es que el culpable sea la ruta de decodificación de audio y no tu prompt. Si ambas cosas funcionan, tienes una base segura para cambiar un ajuste cada vez.
La salida de audio depende del nodo VAEDecodeAudio, que las plantillas ya incluyen. El nodo de imagen a video es MiniMaxH3ImageToVideo, y expone las entradas first_frame y last_frame.
Ajustes del muestreador que funcionan
La base de las notas de la comunidad es el muestreador res_multistep con el planificador simple en 20 pasos. La calidad baja de forma notable por debajo de unos 15 pasos. Si tu tarjeta lo permite, inicia ComfyUI con --use-sage-attention para generar hasta unas 2 veces más rápido. Para las pruebas, baja a 384p y a una duración corta, y sube el tamaño cuando el movimiento y el audio estén bien.
Una alternativa con un solo grafo
ComfyUI-MiniMaxH3-Easy es un nodo personalizado de la comunidad que reúne T2V, I2V, primer y último fotograma, y R2V en un flujo de trabajo compacto. Instálalo clonando el repositorio en ComfyUI/custom_nodes o buscando su nombre en ComfyUI Manager. La generación no necesita credenciales de API. Las cuentas de OpenAI, Gemini u Ollama solo se usan en su optimizador de prompts opcional, y los muestreadores, los LoRA y los parches de atención siguen siendo conexiones normales de ComfyUI. También admite un modo de humano digital controlado por una sola pista de audio, útil para clips de una persona hablando a cámara.
Escribir prompts para H3 como un director

Primero la escena, después los planos
H3 responde mejor a un prompt que primero describe la escena general (lugar, personaje, qué está pasando) y después divide el clip en planos temporizados. Incluye los movimientos de cámara y el audio que quieres, no solo la imagen.
Prompt de ejemplo: Un mercado nocturno lluvioso en Osaka, un vendedor ambulante con un impermeable amarillo sirviendo caldo en un cuenco de papel. 0 a 4 s: avance lento hacia el vapor que sube de la olla, la lluvia golpea una lona. 4 a 9 s: plano medio mientras el vendedor entrega el cuenco a un cliente y sonríe. 9 a 15 s: seguimiento a mano mientras el cliente se adentra en la multitud. Audio: lluvia, aceite chisporroteando, murmullos lejanos, música suave de shamisen.
Compáralo con un prompt escueto como "un hombre cocina fideos bajo la lluvia". H3 seguirá devolviendo algo que se pueda ver, pero la cámara, el ritmo y la banda sonora serán suposiciones. Detallar los momentos da al modelo una línea de tiempo que seguir, y te da algo concreto que editar cuando un plano falla. Cambia un solo momento por prueba para saber qué edición causó cada resultado.
Una lista de comprobación breve mantiene los prompts coherentes:
- Escena: dónde, cuándo y quién.
- Planos: una línea por momento, con segundos.
- Cámara: avance, seguimiento a mano, órbita o plano fijo.
- Audio: diálogo, efectos y música, cada uno nombrado por separado.

Diálogo y sonido en el prompt
Como el audio se genera junto con la imagen, nómbralo. Di quién habla y qué dice, y luego enumera los efectos y la música en su propia línea para que no se mezclen con la descripción de la imagen. Con 11 idiomas admitidos, puedes escribir el diálogo en el idioma en que debe hablar el personaje. En el nodo Easy, al escribir # se abre un bloque de diálogo que se convierte en tiempo de ejecución en las etiquetas <d>...</d> que espera H3.
Etiquetas de referencia para R2V
En el modo de referencia, menciona cada entrada por su etiqueta, en el orden exacto en que la conectaste: <Picture 1>, <Video 1>, <Audio 1>. Después indica qué referencia controla cada parte del plano:
Usa <Picture 1> para el rostro y el vestuario del personaje, <Video 1> para el movimiento de cámara y <Audio 1> para la voz.
En el nodo Easy, @Image1, @Video1 y @Audio1 se convierten en esas etiquetas por ti.

Control del primer y último fotograma
Dos imágenes fijas suelen dirigir un clip mejor que otras cien palabras de prompt. En el modo I2V, first_frame y last_frame son ambos opcionales, y el modelo genera el movimiento entre ellos.

Crea y ajusta las imágenes fijas de los extremos
Crea los dos fotogramas antes de abrir ComfyUI. PicassoIA Image o Seedream 5 Pro pueden generar la imagen inicial, y un modelo de edición como PicassoIA Image Editor Pro te permite ajustar esa imagen para obtener la final, de modo que el sujeto y la iluminación se mantengan cercanos.
Iguala el carácter del objetivo, la dirección de la luz y la escala del sujeto. Si el primer fotograma es un amanecer y el último un atardecer, H3 tiene que inventar todo un día en 15 segundos. Puede hacerlo, pero el resultado parece un timelapse. Elige extremos que la acción pueda alcanzar de forma realista dentro de la duración del clip.
LoRA: velocidad e identidad
Las afirmaciones sobre los LoRA de H3 se enredan rápido. En realidad hay dos cosas distintas: un LoRA de velocidad que cambia cuántos pasos necesitas, y un LoRA de identidad que entrenas con tus propias imágenes.

El LoRA Turbo para la velocidad
El MiniMax-H3-Turbo-LoRA de la comunidad (Apache 2.0, unos 744 MB en bf16) reduce los pasos de muestreo de unos 20 a tan solo 4.
| Ajuste | Valor |
|---|
| Pasos | 4 a 8, con preferencia por 6 a 8 |
| Intensidad del LoRA | 1.0 |
| Planificador | simple |
| Aceleración | Unas 5 veces en el muestreo |
| Archivo recomendado | minimax_h3_turbo_v4_step600_ema.safetensors |
El efecto práctico está en tu ciclo de iteración. Supón que un clip de prueba a 480p tarda unos 6 minutos con 20 pasos en una tarjeta de 12 a 16 GB. Una aceleración de 5 veces en el muestreo lo dejaría en torno a minuto y medio por prueba. Es un cálculo aproximado y no una medición, y la decodificación sigue llevando tiempo, pero explica por qué la gente usa Turbo para los borradores y la configuración completa de 20 pasos para el render final.
Instala el nodo personalizado ComfyUI-MiniMax-H3-Turbo, coloca el archivo .safetensors en tu carpeta de LoRA e inserta el nodo del LoRA Turbo entre el cargador del modelo y el muestreador de un flujo de trabajo existente.
💡 Límite conocido: con 4 pasos y mucho movimiento, v4 puede mostrar arrastres y fantasmas, y el comportamiento del audio durante las acciones intensas todavía se está mejorando. Usa 4 pasos para planos estáticos o con poco movimiento y de 6 a 8 para la acción.
Entrenar un LoRA de personaje
Un creador entrenó un LoRA de personaje en una RTX 4070 de 12 GB con ai-toolkit, usando un modelo cuantizado y descarga a la CPU. Estas son las cifras que comunicó:
| Ajuste | Valor |
|---|
| Conjunto de datos | 31 a 32 imágenes de 512×512 |
| Rango del LoRA | 16 |
| Pasos | 1000, tamaño de lote 1 |
| VRAM durante el entrenamiento | Unos 11,7 de 12 GB |
| RAM del sistema | Unos 32 a 37 GB |
| Tiempo | Entre 6 y 7 horas aproximadamente |
| Configuración imprescindible | num_frames: 1 y auto_frame_count: false |
Dos detalles deciden si esto funciona. Primero, si auto_frame_count está activado, un conjunto de datos de imágenes fijas se trata como video y el entrenamiento informa de que no se encontraron imágenes. Segundo, las tomas mixtas de cuerpo entero dieron malos resultados. El creador pasó a un conjunto centrado en el rostro, donde la cara ocupa la mayor parte del encuadre, con una descripción sencilla formada por una palabra desencadenante más una breve etiqueta del sujeto. El LoRA terminado se carga mediante el nodo LoraLoaderModelOnly.

💡 Evita el LoRA de H3 cuando baste una imagen fija. Si solo necesitas un personaje coherente como primer fotograma o imagen de referencia, entrena en cambio un LoRA de imagen. P Image Trainer en PicassoIA crea un LoRA para el modelo p-image a partir de un zip de al menos 10 imágenes, con 1000 pasos por defecto.
Los LoRA de video son otra historia. El mismo creador señaló que entrenar con clips de video probablemente queda fuera del alcance de 12 GB, y las pruebas de la comunidad apuntan a 20 GB o más para un entrenamiento de video práctico. En la mayoría de los casos la división sensata es sencilla: un LoRA de identidad o imágenes de referencia para el personaje, y el LoRA Turbo cuando el tiempo de render es el cuello de botella.
Clips más largos y soluciones comunes
Encadena clips con contexto de movimiento
Quince segundos es el máximo de una sola pasada. ComfyUI MiniMax H3 Extender encadena varios clips manteniendo la continuidad. Cuando apruebas un clip, su latente se guarda en caché en disco y se convierte en el contexto de movimiento del siguiente, de modo que el nuevo plano continúa desde los últimos fotogramas del clip anterior.
- Prompts, semillas y duraciones por clip
- Modos de semilla: Randomize, Fixed, Increment, Decrement
- Los mismos límites de referencia: 9 imágenes, 3 videos, 3 pistas de audio
- Exportación en H.264, H.265/HEVC o FFV1
Instálalo desde ComfyUI Manager o clonándolo en ComfyUI/custom_nodes. Planifica toda la secuencia en papel primero: una línea por clip, con las referencias de personaje compartidas listadas una sola vez, para que cada segmento herede la misma identidad en lugar de desviarse de un clip a otro.

Soluciones a errores frecuentes
| Síntoma | Causa probable | Solución |
|---|
| Una ejecución a 256p falla por completo | Por debajo del tamaño mínimo | Usa 384p o más, en múltiplos de 32 |
| El video se renderiza sin sonido | Falta la decodificación de audio | Añade VAEDecodeAudio y carga el VAE de audio |
| Detalle blando y borroso | Muy pocos pasos | Usa 20 pasos y evita bajar de unos 15 |
| Fantasmas en movimientos rápidos con Turbo | Ajuste de 4 pasos | Sube a entre 6 y 8 pasos |
| El entrenamiento del LoRA no encuentra imágenes | auto_frame_count está activado | Desactívalo y pon num_frames en 1 |
| Renders lentos en una tarjeta capaz | Atención por defecto | Inicia con --use-sage-attention |
Pruébalo en PicassoIA
MiniMax H3 no está en el catálogo de PicassoIA en el momento de escribir esto, pero las mismas tareas que maneja en ComfyUI tienen alternativas cercanas que puedes ejecutar en el navegador, sin una descarga de 40 GB ni un presupuesto de VRAM que gestionar.
| Si necesitas | Prueba este modelo |
|---|
| Imágenes o clips de referencia que mantengan un sujeto coherente | Wan 2.7 R2V, que genera en 720p o 1080p |
| Una sola foto convertida en movimiento | Wan 2.7 I2V |
| La familia de video propia de MiniMax | Hailuo 2.3 para texto a video cinematográfico |
| Iteraciones rápidas mientras pruebas prompts | LTX 2.5 Fast |
| Clips gratuitos e ilimitados | Seedance 2.5 Lite o PicassoIA Video |
Un ciclo práctico funciona bien: crea tus imágenes de los extremos y las referencias de personaje en PicassoIA, haz allí algunas pruebas baratas para fijar el lenguaje de escena y de cámara, y luego lleva el prompt ganador a tu grafo local de H3 para el render final con audio nativo. Elige una imagen de tu última prueba en ComfyUI, colócala en Wan 2.7 I2V y compara el movimiento con tu clip de H3. La forma más rápida de descubrir lo que pueden hacer tus prompts es crear algo hoy, así que abre PicassoIA y crea tus primeras imágenes y videos.