Flujo de trabajo de MiniMax H3 en ComfyUI: prompts, LoRA e instalación local

MiniMax H3 genera hasta 15 segundos de video a 24 fps con audio estéreo nativo, y se ejecuta en local en ComfyUI. Consulta los archivos del modelo y el espacio en disco que necesitas, los niveles de VRAM según la GPU, cómo escribir prompts con planos temporizados y diálogos, cómo funcionan los LoRA Turbo y de personaje, y cómo encadenar clips más largos.

Flujo de trabajo de MiniMax H3 en ComfyUI: prompts, LoRA e instalación local
Cristian Da Conceicao
Fundador de Picasso IA

La mayoría de los modelos de video están tras un inicio de sesión y un contador de créditos. MiniMax H3 no tiene por qué estarlo. Sus pesos abiertos se ejecutan dentro de ComfyUI en tu propia tarjeta gráfica, y una sola pasada devuelve hasta 15 segundos de video a 24 fps con una pista estéreo ya mezclada: diálogo, efectos de sonido y música juntos. Suena a que funciona sin configurar nada, y en gran medida es así, siempre que elijas los archivos del modelo adecuados, escribas los prompts como los espera H3 y sepas cuándo un LoRA realmente ayuda. Este artículo sigue el flujo de trabajo de MiniMax H3 en ComfyUI en el orden en que te encontrarás cada problema: hardware, archivos, los tres modos de generación, prompts, velocidad, LoRA de personaje y clips más largos.

Qué hace realmente MiniMax H3

H3 es un modelo de video omnimodal. En lugar de generar fotogramas sin sonido y pedirle a otra herramienta que añada el audio, sintetiza imagen, voz, efectos y música en la misma pasada. ComfyUI añadió compatibilidad nativa en la versión 0.30.0, así que las plantillas básicas no necesitan ningún nodo personalizado.

Tres modos en un solo modelo

  • Texto a video (T2V): solo un prompt. Describe la escena y el modelo devuelve un clip con audio.
  • Imagen a video (I2V): una imagen fija, más un primer y un último fotograma opcionales. El modelo rellena el movimiento entre los dos fotogramas.
  • Referencia a video (R2V): un prompt más hasta 9 imágenes de referencia, 3 videos de referencia y 3 clips de audio. Tú decides qué referencia controla la identidad, el estilo, el movimiento, la cámara o la voz.

Los pesos se dividen por la misma línea. T2V e I2V usan los checkpoints FL2VA, mientras que R2V usa los checkpoints Ref2VA, así que planea una descarga aparte si quieres los tres modos.

Las cifras que importan

EspecificaciónValor
Duración del clipHasta 15 segundos
Fotogramas por segundo24 fps
AudioEstéreo nativo de 32 kHz
Idiomas de voz11: árabe, chino, inglés, francés, alemán, italiano, japonés, coreano, portugués, ruso, español
Resolución principalHasta 2K
Preajustes de plantilla960×544, 1152×640, 1216×672
Tamaño mínimo utilizable384p (256p falla)
Regla de tamañoAncho y alto en múltiplos de 32

💡 Lee con atención la línea de resolución. "Hasta 2K" es el máximo. Una guía de la comunidad describe un lienzo nativo de unos 768 px en el lado corto, así que toma los preajustes de arriba como tu punto de partida realista y prueba tamaños mayores en tu propia tarjeta.

Hardware y realidad del disco

Antes de descargar nada, comprueba lo que tu equipo puede soportar. H3 es un modelo grande, y la distancia entre "funciona" y "funciona bien" es enorme.

Tarjeta gráfica con tres ventiladores negros instalada en una torre de PC abierta

VRAM según la clase de tarjeta

Las cifras siguientes proceden de una prueba de rendimiento de la comunidad, no de una especificación oficial, así que espera variaciones según los drivers, la resolución y la cuantización.

Clase de tarjetaQué esperar
6 GB (clase RTX 2060)Funciona, pero con detalle borroso, audio más tosco y unos 10 a 15 minutos por clip
12 a 16 GB (clase RTX 4060)Unos 6 minutos para un clip de 5 segundos a 480p, más limpio que el nivel de 6 GB
24 GB (clase RTX 4090)Mayor resolución con menos concesiones, y espacio suficiente para entrenar LoRA
32 GB o más (RTX 5090, RTX 6000)El nivel recomendado, con clips más largos de 15 segundos a mayor resolución
Apple SiliconUna versión NF4 de 4 bits funciona desde tan solo 8 GB, con una caída de calidad visible en escenas complejas

Archivos del modelo y espacio en disco

Cada componente viene en tres precisiones, y la elección es un equilibrio entre calidad y memoria. Los archivos de difusión INT8 podados y el codificador de texto nvfp4 son los que recomiendan las notas de la plantilla, porque dejan más margen para el propio video. Pasa a INT8 o BF16 solo si te sobra VRAM y ves una diferencia en tus propias pruebas comparativas.

ArchivoTamañoFunción
FL2VA INT8 podado ConvRot19,5 GBRecomendado para T2V e I2V
FL2VA INT8 ConvRot31,7 GBOpción INT8 más grande
FL2VA BF1661,7 GBPrecisión completa
Ref2VA INT8 podado ConvRot19,5 GBRecomendado para R2V
Qwen3-VL codificador de texto, nvfp4 AWQ14,6 GBCodificador recomendado
Qwen3-VL INT8 ConvRot25,3 GBOpción de codificador más grande
Qwen3-VL BF1648,0 GBCodificador de precisión completa
Video VAE FP164,9 GBObligatorio
Audio VAE FP320,6 GBObligatorio

La configuración ligera para T2V e I2V (modelo de difusión INT8 podado, codificador de texto nvfp4 y ambos VAE) suma unos 39,6 GB. Añade otros 19,5 GB si quieres R2V. Guárdalo todo en una unidad NVMe, porque cargar 40 GB desde un disco mecánico es un suplicio.

Unidad NVMe delgada sobre un escritorio de nogal junto a un equipo portátil y una taza de café

Instalación local en ComfyUI

Actualiza y abre la plantilla

  1. Actualiza ComfyUI a 0.30.0 o posterior.
  2. Abre Workflow, Browse Templates, Video y elige una plantilla de MiniMax H3.
  3. Coloca los archivos descargados en models/diffusion_models/, models/text_encoders/ y models/vae/.
  4. Reinicia ComfyUI para que los cargadores vean los archivos nuevos.

Haz primero una prueba T2V corta y de baja resolución. Una buena primera prueba es un clip a 384p con una sola frase de diálogo y un efecto de sonido evidente, como una puerta que se cierra. Si aparece la imagen pero el audio está en silencio, lo más probable es que el culpable sea la ruta de decodificación de audio y no tu prompt. Si ambas cosas funcionan, tienes una base segura para cambiar un ajuste cada vez.

La salida de audio depende del nodo VAEDecodeAudio, que las plantillas ya incluyen. El nodo de imagen a video es MiniMaxH3ImageToVideo, y expone las entradas first_frame y last_frame.

Ajustes del muestreador que funcionan

La base de las notas de la comunidad es el muestreador res_multistep con el planificador simple en 20 pasos. La calidad baja de forma notable por debajo de unos 15 pasos. Si tu tarjeta lo permite, inicia ComfyUI con --use-sage-attention para generar hasta unas 2 veces más rápido. Para las pruebas, baja a 384p y a una duración corta, y sube el tamaño cuando el movimiento y el audio estén bien.

Una alternativa con un solo grafo

ComfyUI-MiniMaxH3-Easy es un nodo personalizado de la comunidad que reúne T2V, I2V, primer y último fotograma, y R2V en un flujo de trabajo compacto. Instálalo clonando el repositorio en ComfyUI/custom_nodes o buscando su nombre en ComfyUI Manager. La generación no necesita credenciales de API. Las cuentas de OpenAI, Gemini u Ollama solo se usan en su optimizador de prompts opcional, y los muestreadores, los LoRA y los parches de atención siguen siendo conexiones normales de ComfyUI. También admite un modo de humano digital controlado por una sola pista de audio, útil para clips de una persona hablando a cámara.

Escribir prompts para H3 como un director

Mano fijando una ficha en un tablero de corcho lleno de tarjetas de planos

Primero la escena, después los planos

H3 responde mejor a un prompt que primero describe la escena general (lugar, personaje, qué está pasando) y después divide el clip en planos temporizados. Incluye los movimientos de cámara y el audio que quieres, no solo la imagen.

Prompt de ejemplo: Un mercado nocturno lluvioso en Osaka, un vendedor ambulante con un impermeable amarillo sirviendo caldo en un cuenco de papel. 0 a 4 s: avance lento hacia el vapor que sube de la olla, la lluvia golpea una lona. 4 a 9 s: plano medio mientras el vendedor entrega el cuenco a un cliente y sonríe. 9 a 15 s: seguimiento a mano mientras el cliente se adentra en la multitud. Audio: lluvia, aceite chisporroteando, murmullos lejanos, música suave de shamisen.

Compáralo con un prompt escueto como "un hombre cocina fideos bajo la lluvia". H3 seguirá devolviendo algo que se pueda ver, pero la cámara, el ritmo y la banda sonora serán suposiciones. Detallar los momentos da al modelo una línea de tiempo que seguir, y te da algo concreto que editar cuando un plano falla. Cambia un solo momento por prueba para saber qué edición causó cada resultado.

Una lista de comprobación breve mantiene los prompts coherentes:

  • Escena: dónde, cuándo y quién.
  • Planos: una línea por momento, con segundos.
  • Cámara: avance, seguimiento a mano, órbita o plano fijo.
  • Audio: diálogo, efectos y música, cada uno nombrado por separado.

Micrófono de condensador y auriculares de estudio en una sala de locución

Diálogo y sonido en el prompt

Como el audio se genera junto con la imagen, nómbralo. Di quién habla y qué dice, y luego enumera los efectos y la música en su propia línea para que no se mezclen con la descripción de la imagen. Con 11 idiomas admitidos, puedes escribir el diálogo en el idioma en que debe hablar el personaje. En el nodo Easy, al escribir # se abre un bloque de diálogo que se convierte en tiempo de ejecución en las etiquetas <d>...</d> que espera H3.

Etiquetas de referencia para R2V

En el modo de referencia, menciona cada entrada por su etiqueta, en el orden exacto en que la conectaste: <Picture 1>, <Video 1>, <Audio 1>. Después indica qué referencia controla cada parte del plano:

Usa <Picture 1> para el rostro y el vestuario del personaje, <Video 1> para el movimiento de cámara y <Audio 1> para la voz.

En el nodo Easy, @Image1, @Video1 y @Audio1 se convierten en esas etiquetas por ti.

Hoja de contactos con retratos de un hombre desde varios ángulos

Control del primer y último fotograma

Dos imágenes fijas suelen dirigir un clip mejor que otras cien palabras de prompt. En el modo I2V, first_frame y last_frame son ambos opcionales, y el modelo genera el movimiento entre ellos.

Dos fotografías impresas de la misma carretera al amanecer y al atardecer

Crea y ajusta las imágenes fijas de los extremos

Crea los dos fotogramas antes de abrir ComfyUI. PicassoIA Image o Seedream 5 Pro pueden generar la imagen inicial, y un modelo de edición como PicassoIA Image Editor Pro te permite ajustar esa imagen para obtener la final, de modo que el sujeto y la iluminación se mantengan cercanos.

Iguala el carácter del objetivo, la dirección de la luz y la escala del sujeto. Si el primer fotograma es un amanecer y el último un atardecer, H3 tiene que inventar todo un día en 15 segundos. Puede hacerlo, pero el resultado parece un timelapse. Elige extremos que la acción pueda alcanzar de forma realista dentro de la duración del clip.

LoRA: velocidad e identidad

Las afirmaciones sobre los LoRA de H3 se enredan rápido. En realidad hay dos cosas distintas: un LoRA de velocidad que cambia cuántos pasos necesitas, y un LoRA de identidad que entrenas con tus propias imágenes.

Cronómetro de latón sobre un escritorio de nogal junto a un monitor

El LoRA Turbo para la velocidad

El MiniMax-H3-Turbo-LoRA de la comunidad (Apache 2.0, unos 744 MB en bf16) reduce los pasos de muestreo de unos 20 a tan solo 4.

AjusteValor
Pasos4 a 8, con preferencia por 6 a 8
Intensidad del LoRA1.0
Planificadorsimple
AceleraciónUnas 5 veces en el muestreo
Archivo recomendadominimax_h3_turbo_v4_step600_ema.safetensors

El efecto práctico está en tu ciclo de iteración. Supón que un clip de prueba a 480p tarda unos 6 minutos con 20 pasos en una tarjeta de 12 a 16 GB. Una aceleración de 5 veces en el muestreo lo dejaría en torno a minuto y medio por prueba. Es un cálculo aproximado y no una medición, y la decodificación sigue llevando tiempo, pero explica por qué la gente usa Turbo para los borradores y la configuración completa de 20 pasos para el render final.

Instala el nodo personalizado ComfyUI-MiniMax-H3-Turbo, coloca el archivo .safetensors en tu carpeta de LoRA e inserta el nodo del LoRA Turbo entre el cargador del modelo y el muestreador de un flujo de trabajo existente.

💡 Límite conocido: con 4 pasos y mucho movimiento, v4 puede mostrar arrastres y fantasmas, y el comportamiento del audio durante las acciones intensas todavía se está mejorando. Usa 4 pasos para planos estáticos o con poco movimiento y de 6 a 8 para la acción.

Entrenar un LoRA de personaje

Un creador entrenó un LoRA de personaje en una RTX 4070 de 12 GB con ai-toolkit, usando un modelo cuantizado y descarga a la CPU. Estas son las cifras que comunicó:

AjusteValor
Conjunto de datos31 a 32 imágenes de 512×512
Rango del LoRA16
Pasos1000, tamaño de lote 1
VRAM durante el entrenamientoUnos 11,7 de 12 GB
RAM del sistemaUnos 32 a 37 GB
TiempoEntre 6 y 7 horas aproximadamente
Configuración imprescindiblenum_frames: 1 y auto_frame_count: false

Dos detalles deciden si esto funciona. Primero, si auto_frame_count está activado, un conjunto de datos de imágenes fijas se trata como video y el entrenamiento informa de que no se encontraron imágenes. Segundo, las tomas mixtas de cuerpo entero dieron malos resultados. El creador pasó a un conjunto centrado en el rostro, donde la cara ocupa la mayor parte del encuadre, con una descripción sencilla formada por una palabra desencadenante más una breve etiqueta del sujeto. El LoRA terminado se carga mediante el nodo LoraLoaderModelOnly.

Cuadrícula de treinta y dos copias de retratos pegadas en una pared blanca

💡 Evita el LoRA de H3 cuando baste una imagen fija. Si solo necesitas un personaje coherente como primer fotograma o imagen de referencia, entrena en cambio un LoRA de imagen. P Image Trainer en PicassoIA crea un LoRA para el modelo p-image a partir de un zip de al menos 10 imágenes, con 1000 pasos por defecto.

Los LoRA de video son otra historia. El mismo creador señaló que entrenar con clips de video probablemente queda fuera del alcance de 12 GB, y las pruebas de la comunidad apuntan a 20 GB o más para un entrenamiento de video práctico. En la mayoría de los casos la división sensata es sencilla: un LoRA de identidad o imágenes de referencia para el personaje, y el LoRA Turbo cuando el tiempo de render es el cuello de botella.

Clips más largos y soluciones comunes

Encadena clips con contexto de movimiento

Quince segundos es el máximo de una sola pasada. ComfyUI MiniMax H3 Extender encadena varios clips manteniendo la continuidad. Cuando apruebas un clip, su latente se guarda en caché en disco y se convierte en el contexto de movimiento del siguiente, de modo que el nuevo plano continúa desde los últimos fotogramas del clip anterior.

  • Prompts, semillas y duraciones por clip
  • Modos de semilla: Randomize, Fixed, Increment, Decrement
  • Los mismos límites de referencia: 9 imágenes, 3 videos, 3 pistas de audio
  • Exportación en H.264, H.265/HEVC o FFV1

Instálalo desde ComfyUI Manager o clonándolo en ComfyUI/custom_nodes. Planifica toda la secuencia en papel primero: una línea por clip, con las referencias de personaje compartidas listadas una sola vez, para que cada segmento herede la misma identidad en lugar de desviarse de un clip a otro.

Manos enguantadas de blanco alineando tiras de película de 35 mm sobre una mesa de luz

Soluciones a errores frecuentes

SíntomaCausa probableSolución
Una ejecución a 256p falla por completoPor debajo del tamaño mínimoUsa 384p o más, en múltiplos de 32
El video se renderiza sin sonidoFalta la decodificación de audioAñade VAEDecodeAudio y carga el VAE de audio
Detalle blando y borrosoMuy pocos pasosUsa 20 pasos y evita bajar de unos 15
Fantasmas en movimientos rápidos con TurboAjuste de 4 pasosSube a entre 6 y 8 pasos
El entrenamiento del LoRA no encuentra imágenesauto_frame_count está activadoDesactívalo y pon num_frames en 1
Renders lentos en una tarjeta capazAtención por defectoInicia con --use-sage-attention

Pruébalo en PicassoIA

MiniMax H3 no está en el catálogo de PicassoIA en el momento de escribir esto, pero las mismas tareas que maneja en ComfyUI tienen alternativas cercanas que puedes ejecutar en el navegador, sin una descarga de 40 GB ni un presupuesto de VRAM que gestionar.

Si necesitasPrueba este modelo
Imágenes o clips de referencia que mantengan un sujeto coherenteWan 2.7 R2V, que genera en 720p o 1080p
Una sola foto convertida en movimientoWan 2.7 I2V
La familia de video propia de MiniMaxHailuo 2.3 para texto a video cinematográfico
Iteraciones rápidas mientras pruebas promptsLTX 2.5 Fast
Clips gratuitos e ilimitadosSeedance 2.5 Lite o PicassoIA Video

Un ciclo práctico funciona bien: crea tus imágenes de los extremos y las referencias de personaje en PicassoIA, haz allí algunas pruebas baratas para fijar el lenguaje de escena y de cámara, y luego lleva el prompt ganador a tu grafo local de H3 para el render final con audio nativo. Elige una imagen de tu última prueba en ComfyUI, colócala en Wan 2.7 I2V y compara el movimiento con tu clip de H3. La forma más rápida de descubrir lo que pueden hacer tus prompts es crear algo hoy, así que abre PicassoIA y crea tus primeras imágenes y videos.

Compartir este artículo

Elige tu idioma