Dos modelos de video con pesos descargables llegaron con diez días de diferencia este verano, y desde entonces los creadores no dejan de debatir sobre ellos. MiniMax anunció H3 el 31 de julio de 2026 como producto de API y publicó los pesos el 3 de agosto. Lightricks lanzó LTX 2.5 el 11 de agosto. Ambos generan imagen y sonido en una sola pasada. Los dos prometen resultados cinematográficos. Sin embargo, la letra pequeña de las licencias hace que la elección sea mucho menos obvia de lo que sugieren las fichas técnicas.
Esta comparativa se centra en lo que importa cuando tienes una fecha límite: resolución, duración de los clips, audio, velocidad, precio, hardware local y quién tiene realmente permiso para usar los pesos. No hice un benchmark de laboratorio, así que todas las cifras de abajo proceden de especificaciones publicadas e informes de lanzamiento, y señalo los números que son afirmaciones del proveedor.
💡 Veredicto rápido: LTX 2.5 es la opción abierta más segura para la mayoría de las personas. MiniMax H3 ofrece salida en 2K y entradas de referencia más ricas a través de su API, pero los pesos que realmente puedes descargar son más limitados de lo que sugiere el titular.

La respuesta corta
Quién gana, en una línea
Si quieres ejecutar un modelo de video en tu propio equipo, integrarlo en un pipeline o ajustarlo con ajuste fino, LTX 2.5 gana para la mayoría de los lectores. Sus pesos están en Hugging Face, funcionó en ComfyUI desde el primer día, y su licencia comunitaria es gratuita para organizaciones con menos de 10 millones de dólares en ingresos recurrentes anuales. Si quieres salida en 2K con diálogos y mucho control por referencias, y no te importa pagar por segundo a través de una API, MiniMax H3 merece una prueba.
La respuesta honesta a "el mejor modelo de video abierto" depende de cuánto peso le des a la palabra abierto.
| Necesidad | Mejor opción | Por qué |
|---|
| Alojamiento propio con pocas dudas legales | LTX 2.5 | Pesos abiertos y una licencia comunitaria gratuita para empresas con menos de $10M de ARR |
| Clip individual más largo | LTX 2.5 | Hasta 20 segundos en el nivel Fast |
| Mayor resolución publicada | LTX 2.5 | Hasta 4K, frente a 2K de H3 |
| Dirección con muchas referencias | MiniMax H3 | Hasta 9 imágenes, 3 clips de video y 3 clips de audio como entrada |
| Diálogo multilingüe | MiniMax H3 | Sincronización labial informada en 11 idiomas |
| Menor costo por clip | LTX 2.5 | $0.09 por segundo en el nivel Fast |
Qué significa "abierto" aquí
Pesos abiertos no equivale a código abierto, ni significa gratis para todo el mundo. Significa que los archivos del modelo se pueden descargar y ejecutar en tu propio hardware. Después, la licencia decide qué puedes hacer con ellos. Tres preguntas lo aclaran:
- Derechos de descarga: ¿puedes obtener los archivos?
- Derechos de uso: ¿puedes entregar trabajo de cliente de pago con ellos?
- Derechos territoriales: ¿tienes permiso para ejecutarlos donde vives?
Ambos proveedores usan licencias comunitarias propias con umbrales de ingresos, así que lee el texto antes de construir un producto sobre cualquiera de las dos.

LTX 2.5 de un vistazo
Especificaciones que conviene conocer
Lightricks diseñó LTX 2.5 como un modelo de audio y video de 22B de parámetros que genera imagen y sonido juntos. La función estrella es la generación multiplano nativa. Pides un plano general, un plano medio y un primer plano, y el modelo los renderiza como una sola secuencia que mantiene estables el personaje, la iluminación y la voz de un corte a otro, en lugar de unir clips separados.
Otras novedades que merece la pena señalar:
- Duración automática: el modelo calcula la duración del clip a partir de la acción que describes.
- Salida 4K HDR: video de alta resolución y alto rango dinámico para trabajos de acabado.
- Flujo RAW: una vía pensada para flujos de color profesionales.
- Beta de edición: un modo para revisar metraje existente en lugar de volver a generarlo.
En cuanto a velocidad, Lightricks afirma que un clip de 10 segundos se genera en 6,8 segundos en dos superchips NVIDIA GB200. Es una cifra del proveedor sobre hardware muy caro, así que tómala como un techo, no como una promesa para tu escritorio. A través de la API gestionada, el mismo trabajo habría tardado según los informes 23,7 segundos en 1080p, lo cual sigue siendo rápido.
Licencia y ecosistema
Los pesos están en Hugging Face en varias versiones: el checkpoint dev completo, una versión destilada para ganar velocidad, y cuantizaciones int8 y NVFP4 para presupuestos de memoria más ajustados. El soporte para ComfyUI estaba listo el día del lanzamiento, con plantillas oficiales de flujo de trabajo para texto a video e imagen a video.
La LTX-2.x Community License permite el ajuste fino y el alojamiento propio, y no cuesta nada a las organizaciones con menos de 10 millones de dólares en ingresos recurrentes anuales. Prohíbe construir con el modelo un sistema de IA que compita con él, y prohíbe el uso militar sin un acuerdo aparte.

MiniMax H3 de un vistazo
Lo que aporta H3
H3 es el modelo de video omnimodal de MiniMax, sucesor de la línea Hailuo 2.3. Genera de 4 a 15 segundos de video a 24 fps, hasta 2K, con sonido estéreo nativo (diálogos, efectos y ambiente de sala) producido en la misma pasada. Los informes de lanzamiento también indican diálogos con sincronización labial en 11 idiomas, y se informa que el modelo base tiene 33,1B de parámetros.
Donde H3 destaca es en la flexibilidad de entrada. Según los informes, la API acepta hasta 9 imágenes de referencia, 3 clips de video de referencia (15 segundos en total) y 3 clips de audio, 12 archivos en total, más un prompt de hasta 7.000 caracteres. Las referencias de audio no pueden enviarse solas. Para la coherencia de personajes entre planos, eso es mucho control de dirección.
El precio de la API en la semana de lanzamiento se informó en 0,13 $ por segundo de video en 2K, o 7,80 $ por minuto, con las cinco primeras imágenes de referencia gratis y 0,04 $ por cada una adicional. Consulta la tarifa actual de MiniMax antes de presupuestar.

La letra pequeña de la licencia
H3 empezó como un producto solo de API. Los pesos llegaron el 3 de agosto bajo la MiniMax H3 Community License, y tres detalles importan:
- Solo se publicó H3-Base. Los dos checkpoints, FL2VA y Ref2VA, están ambos destilados con CFG.
- La etapa 2K quedó cerrada. La generación local funciona con un lado corto de 768 píxeles. El módulo H3-Regenerate-2K no se publicó como código abierto, y la API ejecuta la canalización 2K completa.
- Límites territoriales. Varios análisis de la licencia, incluidos los desgloses de proveedores de alojamiento, afirman que la licencia excluye Estados Unidos, la Unión Europea, el Reino Unido y Corea del Sur, según se informa incluso para usar los resultados del modelo dentro de esas regiones. También se ha informado de un umbral de ingresos de 20 millones de dólares.
💡 Lee tú mismo el texto de la licencia antes de fiarte de cualquier resumen de terceros, incluido este. Si las exclusiones territoriales afectan a donde vives, los pesos abiertos quedan descartados, por muy buena que sea la ficha técnica.
Comparativa cara a cara
Resolución y duración del clip
| Característica | LTX 2.5 | MiniMax H3 |
|---|
| Lanzamiento | 11 de agosto de 2026 | API el 31 de julio, pesos el 3 de agosto de 2026 |
| Tamaño del modelo | 22B parámetros | 33,1B parámetros |
| Pesos abiertos | Dev completo, destilado, int8, NVFP4 | Solo H3-Base (FL2VA, Ref2VA) |
| Resolución máxima | Hasta 4K HDR | 2K por API, lado corto de 768p en local |
| Duración del clip | Hasta 20 segundos (nivel Fast) | De 4 a 15 segundos |
| Audio | Audio y video conjuntos | Estéreo nativo, diálogos en 11 idiomas |
| Multiplano | Secuencias multiplano nativas | Varios planos dentro de una misma generación |
| Entradas de referencia | Imagen a video, primer y último fotograma | 9 imágenes, 3 videos, 3 clips de audio |
| Licencia | LTX-2.x Community, gratuita por debajo de 10 M$ de ARR | MiniMax H3 Community, límites territoriales informados |
Sobre el papel, LTX 2.5 tiene más margen: hasta 4K y hasta 20 segundos. Los clips largos tienen su contrapartida, ya que el límite de 20 segundos se aplica solo a 1080p o menos. H3 llega a 2K y 15 segundos a través de la API, y a 768p en local. Pero la resolución no es calidad. Un clip de 1080p limpio con un movimiento creíble supera a un clip de 4K con manos que se deforman.
Rostros, movimiento y audio
Los primeros planos exponen todas las debilidades de un modelo de video: la textura de la piel, el parpadeo, los mechones de pelo, la forma de los labios. H3 promociona la coherencia basada en referencias y la sincronización labial multilingüe, lo que sugiere que MiniMax apunta a escenas centradas en el diálogo. LTX 2.5 persigue el mismo objetivo con la generación conjunta de audio y video y secuencias multiplano que mantienen una voz estable entre cortes.
No puedo clasificar con honestidad sus rostros solo con las fichas técnicas, y nadie más puede hacerlo sin renders comparados lado a lado. Prueba con tu propio material: un rostro, una línea de diálogo, un movimiento de cámara.

El sonido es la otra mitad de la imagen:
- LTX 2.5: el audio se genera junto con el video, y en LTX 2.5 Fast puede activarse o desactivarse en cada render.
- H3: salida estéreo a 32 kHz, según una ficha técnica, con diálogos, efectos y ambiente de sala en la misma pasada.

Velocidad y costo
El precio por segundo facilita las cuentas. Estos son los precios de API de la semana de lanzamiento según se informaron, y las resoluciones son distintas (H3 en 2K, LTX en hasta 1080p), así que no es una comparación equilibrada.
| Duración del clip | LTX 2.5 Fast (0,09 $/s) | LTX 2.5 Pro (0,12 $/s) | H3 en 2K (0,13 $/s) |
|---|
| 5 segundos | 0,45 $ | 0,60 $ | 0,65 $ |
| 10 segundos | 0,90 $ | 1,20 $ | 1,30 $ |
| 15 segundos | 1,35 $ | No disponible (límite de 10 s) | 1,95 $ |
| 20 segundos | 1,80 $ | No disponible (límite de 10 s) | No disponible (límite de 15 s) |
El nivel Fast es la forma más barata de iterar. El nivel Pro se posiciona en torno a la adherencia al prompt, los rostros y la tipografía, así que tiene sentido para el render final una vez que los borradores Fast tengan buen aspecto.

Ejecutarlos en tu propio hardware
LTX 2.5 en una estación de trabajo
Lightricks publica un checkpoint destilado para ganar velocidad y versiones cuantizadas para presupuestos de memoria más ajustados. Las versiones NVFP4 apuntan a la arquitectura más nueva de NVIDIA, así que las tarjetas antiguas probablemente rindan mejor con int8. No encontré una cifra firme de VRAM mínima en los informes de lanzamiento, así que consulta la ficha del modelo para tu GPU exacta.
Una primera prueba sensata: carga el checkpoint destilado en ComfyUI, renderiza un clip de 10 segundos en 1080p y solo entonces pasa a 4K o a duraciones más largas.

Límites locales de H3
El repositorio de H3 es grande. Un recorrido de un proveedor de alojamiento describe la descarga completa, con todas las cuantizaciones incluidas, en unos 600 GB. El modelo base tiene 33,1B de parámetros densos frente a los 22B de LTX 2.5, así que espera una carga mayor en tu GPU. ComfyUI añadió cuatro nodos de H3: EmptyMiniMaxH3LatentAV, MiniMaxH3ImageToVideo, MiniMaxH3ReferenceToVideo y MiniMaxH3SigmaShift.
Lo que obtienes en local es el resultado base de 768p. El pulido en 2K que llena las páginas de marketing viene de la API.
Cómo usar LTX 2.5 en PicassoIA
No necesitas una GPU para probar este modelo. LTX 2.5 Fast funciona en PicassoIA y acepta un prompt de texto o una sola foto. Al escribir esto, H3 no está en el catálogo. Los modelos de MiniMax más recientes allí son Hailuo 2.3 y Hailuo 2.3 Fast, lo que sirve como comparación razonable con el estilo MiniMax.
Paso a paso
- Abre la página de LTX 2.5 Fast en la colección de texto a video.
- Elige tu entrada. Escribe solo un prompt, o sube una foto como primer fotograma para imagen a video.
- Opcional: añade una imagen de último fotograma y el modelo generará una transición entre las dos.
- Define la relación de aspecto, la resolución, la duración y los fotogramas por segundo (consulta la tabla de abajo).
- Deja activado Generate Audio si quieres sonido sincronizado.
- Genera, previsualiza el clip y descárgalo, o ajusta el prompt y vuelve a generar.
Ajustes y consejos para el prompt
| Ajuste | Opciones | Notas |
|---|
| Relación de aspecto | 16:9, 9:16 | Horizontal para web, vertical para redes sociales |
| Resolución | 720p, 1080p, 2K, 4K | Por defecto es 1080p; las resoluciones más altas limitan la duración |
| Duración | De 2 a 20 segundos | Más de 10 segundos solo en 720p o 1080p con 24 o 25 fps |
| Fotogramas por segundo | 24, 25, 48, 50 | 48 y 50 fps limitan a 10 segundos |
| Generar audio | Activado o desactivado | Activado por defecto |
Para los primeros fotogramas, crea la imagen fija con un modelo de imagen como Seedream 5 Pro y luego introdúcela en el modelo de video. Controlas la composición antes de añadir cualquier movimiento.
Escribe los prompts en el orden en que ocurren las cosas: sujeto, acción, movimiento de cámara, luz y, después, sonido. Por ejemplo:
Un pescador tira de una cuerda en un pequeño barco de madera al amanecer. Travelling lento de acercamiento desde la popa, neblina marina que se desplaza sobre el agua, luz ámbar tenue sobre las tablas mojadas. Crujido de madera, olas suaves y gaviotas a lo lejos.

¿Cuál deberías elegir?
Elige LTX 2.5 cuando
- Quieres alojarlo tú mismo o hacer ajuste fino sin complicaciones regionales.
- Te importan los clips de más de 15 segundos.
- Iteras mucho y necesitas el menor costo por borrador.
- Trabajas en ComfyUI y quieres plantillas de flujo de trabajo desde el primer día.
- Necesitas 4K HDR para un flujo de postproducción.
Elige H3 cuando
- Diriges con muchas referencias: rostros, metraje y clips de voz en una sola petición.
- Tus escenas dependen de diálogos multilingües.
- No te importa usar la API, y la salida en 2K pesa más que el control local.
- Has confirmado que la licencia permite tu ubicación y tu franja de ingresos.
Si ninguno encaja, prueba el mismo prompt con Kling v3 Video o Veo 3.1 para una tercera opinión.
Haz tu propia comparativa
Las especificaciones solo llegan hasta cierto punto. La forma más rápida de resolverlo es renderizar la misma toma dos veces y verla con el sonido activado. Abre LTX 2.5 Fast en PicassoIA, pega un prompt y renderízalo en 1080p y luego en 4K. Después, lleva la misma descripción a Hailuo 2.3 y compara rostros, movimiento y audio lado a lado.
¿Quieres un primer fotograma personalizado? Genéralo con los modelos de imagen de PicassoIA, súbelo como imagen de inicio y deja que el modelo de video tome el relevo. Unos cuantos experimentos te dirán más que cualquier tabla de especificaciones, incluida esta.