LTX 2.5 frente a MiniMax H3: ¿el mejor modelo de video abierto?

Dos modelos de video con pesos abiertos llegaron en agosto de 2026: Lightricks LTX 2.5 y MiniMax H3. Esta comparativa cara a cara analiza especificaciones, salida en 4K frente a 2K, duración de los clips, audio, precios de API, requisitos de hardware local y restricciones de licencia, para que elijas el adecuado para tus proyectos.

LTX 2.5 frente a MiniMax H3: ¿el mejor modelo de video abierto?
Cristian Da Conceicao
Fundador de Picasso IA

Dos modelos de video con pesos descargables llegaron con diez días de diferencia este verano, y desde entonces los creadores no dejan de debatir sobre ellos. MiniMax anunció H3 el 31 de julio de 2026 como producto de API y publicó los pesos el 3 de agosto. Lightricks lanzó LTX 2.5 el 11 de agosto. Ambos generan imagen y sonido en una sola pasada. Los dos prometen resultados cinematográficos. Sin embargo, la letra pequeña de las licencias hace que la elección sea mucho menos obvia de lo que sugieren las fichas técnicas.

Esta comparativa se centra en lo que importa cuando tienes una fecha límite: resolución, duración de los clips, audio, velocidad, precio, hardware local y quién tiene realmente permiso para usar los pesos. No hice un benchmark de laboratorio, así que todas las cifras de abajo proceden de especificaciones publicadas e informes de lanzamiento, y señalo los números que son afirmaciones del proveedor.

💡 Veredicto rápido: LTX 2.5 es la opción abierta más segura para la mayoría de las personas. MiniMax H3 ofrece salida en 2K y entradas de referencia más ricas a través de su API, pero los pesos que realmente puedes descargar son más limitados de lo que sugiere el titular.

Editor de video comparando dos clips pausados en un escritorio con doble monitor en un estudio tipo loft luminoso

La respuesta corta

Quién gana, en una línea

Si quieres ejecutar un modelo de video en tu propio equipo, integrarlo en un pipeline o ajustarlo con ajuste fino, LTX 2.5 gana para la mayoría de los lectores. Sus pesos están en Hugging Face, funcionó en ComfyUI desde el primer día, y su licencia comunitaria es gratuita para organizaciones con menos de 10 millones de dólares en ingresos recurrentes anuales. Si quieres salida en 2K con diálogos y mucho control por referencias, y no te importa pagar por segundo a través de una API, MiniMax H3 merece una prueba.

La respuesta honesta a "el mejor modelo de video abierto" depende de cuánto peso le des a la palabra abierto.

NecesidadMejor opciónPor qué
Alojamiento propio con pocas dudas legalesLTX 2.5Pesos abiertos y una licencia comunitaria gratuita para empresas con menos de $10M de ARR
Clip individual más largoLTX 2.5Hasta 20 segundos en el nivel Fast
Mayor resolución publicadaLTX 2.5Hasta 4K, frente a 2K de H3
Dirección con muchas referenciasMiniMax H3Hasta 9 imágenes, 3 clips de video y 3 clips de audio como entrada
Diálogo multilingüeMiniMax H3Sincronización labial informada en 11 idiomas
Menor costo por clipLTX 2.5$0.09 por segundo en el nivel Fast

Qué significa "abierto" aquí

Pesos abiertos no equivale a código abierto, ni significa gratis para todo el mundo. Significa que los archivos del modelo se pueden descargar y ejecutar en tu propio hardware. Después, la licencia decide qué puedes hacer con ellos. Tres preguntas lo aclaran:

  • Derechos de descarga: ¿puedes obtener los archivos?
  • Derechos de uso: ¿puedes entregar trabajo de cliente de pago con ellos?
  • Derechos territoriales: ¿tienes permiso para ejecutarlos donde vives?

Ambos proveedores usan licencias comunitarias propias con umbrales de ingresos, así que lee el texto antes de construir un producto sobre cualquiera de las dos.

Manos de un técnico levantando una tarjeta gráfica de una torre de PC abierta sobre una mesa de trabajo de acero

LTX 2.5 de un vistazo

Especificaciones que conviene conocer

Lightricks diseñó LTX 2.5 como un modelo de audio y video de 22B de parámetros que genera imagen y sonido juntos. La función estrella es la generación multiplano nativa. Pides un plano general, un plano medio y un primer plano, y el modelo los renderiza como una sola secuencia que mantiene estables el personaje, la iluminación y la voz de un corte a otro, en lugar de unir clips separados.

Otras novedades que merece la pena señalar:

  • Duración automática: el modelo calcula la duración del clip a partir de la acción que describes.
  • Salida 4K HDR: video de alta resolución y alto rango dinámico para trabajos de acabado.
  • Flujo RAW: una vía pensada para flujos de color profesionales.
  • Beta de edición: un modo para revisar metraje existente en lugar de volver a generarlo.

En cuanto a velocidad, Lightricks afirma que un clip de 10 segundos se genera en 6,8 segundos en dos superchips NVIDIA GB200. Es una cifra del proveedor sobre hardware muy caro, así que tómala como un techo, no como una promesa para tu escritorio. A través de la API gestionada, el mismo trabajo habría tardado según los informes 23,7 segundos en 1080p, lo cual sigue siendo rápido.

Licencia y ecosistema

Los pesos están en Hugging Face en varias versiones: el checkpoint dev completo, una versión destilada para ganar velocidad, y cuantizaciones int8 y NVFP4 para presupuestos de memoria más ajustados. El soporte para ComfyUI estaba listo el día del lanzamiento, con plantillas oficiales de flujo de trabajo para texto a video e imagen a video.

La LTX-2.x Community License permite el ajuste fino y el alojamiento propio, y no cuesta nada a las organizaciones con menos de 10 millones de dólares en ingresos recurrentes anuales. Prohíbe construir con el modelo un sistema de IA que compita con él, y prohíbe el uso militar sin un acuerdo aparte.

Director de fotografía ajustando una cámara de cine sobre un trípode en un acantilado costero durante la hora dorada

MiniMax H3 de un vistazo

Lo que aporta H3

H3 es el modelo de video omnimodal de MiniMax, sucesor de la línea Hailuo 2.3. Genera de 4 a 15 segundos de video a 24 fps, hasta 2K, con sonido estéreo nativo (diálogos, efectos y ambiente de sala) producido en la misma pasada. Los informes de lanzamiento también indican diálogos con sincronización labial en 11 idiomas, y se informa que el modelo base tiene 33,1B de parámetros.

Donde H3 destaca es en la flexibilidad de entrada. Según los informes, la API acepta hasta 9 imágenes de referencia, 3 clips de video de referencia (15 segundos en total) y 3 clips de audio, 12 archivos en total, más un prompt de hasta 7.000 caracteres. Las referencias de audio no pueden enviarse solas. Para la coherencia de personajes entre planos, eso es mucho control de dirección.

El precio de la API en la semana de lanzamiento se informó en 0,13 $ por segundo de video en 2K, o 7,80 $ por minuto, con las cinco primeras imágenes de referencia gratis y 0,04 $ por cada una adicional. Consulta la tarifa actual de MiniMax antes de presupuestar.

Equipo de colegas revisando metraje pausado en una gran pantalla de pared en una sala de reuniones de cristal

La letra pequeña de la licencia

H3 empezó como un producto solo de API. Los pesos llegaron el 3 de agosto bajo la MiniMax H3 Community License, y tres detalles importan:

  • Solo se publicó H3-Base. Los dos checkpoints, FL2VA y Ref2VA, están ambos destilados con CFG.
  • La etapa 2K quedó cerrada. La generación local funciona con un lado corto de 768 píxeles. El módulo H3-Regenerate-2K no se publicó como código abierto, y la API ejecuta la canalización 2K completa.
  • Límites territoriales. Varios análisis de la licencia, incluidos los desgloses de proveedores de alojamiento, afirman que la licencia excluye Estados Unidos, la Unión Europea, el Reino Unido y Corea del Sur, según se informa incluso para usar los resultados del modelo dentro de esas regiones. También se ha informado de un umbral de ingresos de 20 millones de dólares.

💡 Lee tú mismo el texto de la licencia antes de fiarte de cualquier resumen de terceros, incluido este. Si las exclusiones territoriales afectan a donde vives, los pesos abiertos quedan descartados, por muy buena que sea la ficha técnica.

Comparativa cara a cara

Resolución y duración del clip

CaracterísticaLTX 2.5MiniMax H3
Lanzamiento11 de agosto de 2026API el 31 de julio, pesos el 3 de agosto de 2026
Tamaño del modelo22B parámetros33,1B parámetros
Pesos abiertosDev completo, destilado, int8, NVFP4Solo H3-Base (FL2VA, Ref2VA)
Resolución máximaHasta 4K HDR2K por API, lado corto de 768p en local
Duración del clipHasta 20 segundos (nivel Fast)De 4 a 15 segundos
AudioAudio y video conjuntosEstéreo nativo, diálogos en 11 idiomas
MultiplanoSecuencias multiplano nativasVarios planos dentro de una misma generación
Entradas de referenciaImagen a video, primer y último fotograma9 imágenes, 3 videos, 3 clips de audio
LicenciaLTX-2.x Community, gratuita por debajo de 10 M$ de ARRMiniMax H3 Community, límites territoriales informados

Sobre el papel, LTX 2.5 tiene más margen: hasta 4K y hasta 20 segundos. Los clips largos tienen su contrapartida, ya que el límite de 20 segundos se aplica solo a 1080p o menos. H3 llega a 2K y 15 segundos a través de la API, y a 768p en local. Pero la resolución no es calidad. Un clip de 1080p limpio con un movimiento creíble supera a un clip de 4K con manos que se deforman.

Rostros, movimiento y audio

Los primeros planos exponen todas las debilidades de un modelo de video: la textura de la piel, el parpadeo, los mechones de pelo, la forma de los labios. H3 promociona la coherencia basada en referencias y la sincronización labial multilingüe, lo que sugiere que MiniMax apunta a escenas centradas en el diálogo. LTX 2.5 persigue el mismo objetivo con la generación conjunta de audio y video y secuencias multiplano que mantienen una voz estable entre cortes.

No puedo clasificar con honestidad sus rostros solo con las fichas técnicas, y nadie más puede hacerlo sin renders comparados lado a lado. Prueba con tu propio material: un rostro, una línea de diálogo, un movimiento de cámara.

Retrato en primer plano que muestra la textura de la piel y el pelo fino junto a una ventana

El sonido es la otra mitad de la imagen:

  • LTX 2.5: el audio se genera junto con el video, y en LTX 2.5 Fast puede activarse o desactivarse en cada render.
  • H3: salida estéreo a 32 kHz, según una ficha técnica, con diálogos, efectos y ambiente de sala en la misma pasada.

Ingeniero de sonido con auriculares frente a una mesa de mezclas en una sala de grabación acondicionada

Velocidad y costo

El precio por segundo facilita las cuentas. Estos son los precios de API de la semana de lanzamiento según se informaron, y las resoluciones son distintas (H3 en 2K, LTX en hasta 1080p), así que no es una comparación equilibrada.

Duración del clipLTX 2.5 Fast (0,09 $/s)LTX 2.5 Pro (0,12 $/s)H3 en 2K (0,13 $/s)
5 segundos0,45 $0,60 $0,65 $
10 segundos0,90 $1,20 $1,30 $
15 segundos1,35 $No disponible (límite de 10 s)1,95 $
20 segundos1,80 $No disponible (límite de 10 s)No disponible (límite de 15 s)

El nivel Fast es la forma más barata de iterar. El nivel Pro se posiciona en torno a la adherencia al prompt, los rostros y la tipografía, así que tiene sentido para el render final una vez que los borradores Fast tengan buen aspecto.

Vista cenital de un escritorio con una libreta, un cronómetro, una calculadora y una taza de café

Ejecutarlos en tu propio hardware

LTX 2.5 en una estación de trabajo

Lightricks publica un checkpoint destilado para ganar velocidad y versiones cuantizadas para presupuestos de memoria más ajustados. Las versiones NVFP4 apuntan a la arquitectura más nueva de NVIDIA, así que las tarjetas antiguas probablemente rindan mejor con int8. No encontré una cifra firme de VRAM mínima en los informes de lanzamiento, así que consulta la ficha del modelo para tu GPU exacta.

Una primera prueba sensata: carga el checkpoint destilado en ComfyUI, renderiza un clip de 10 segundos en 1080p y solo entonces pasa a 4K o a duraciones más largas.

Torre de estación de trabajo con el panel lateral retirado sobre un banco de taller de garaje

Límites locales de H3

El repositorio de H3 es grande. Un recorrido de un proveedor de alojamiento describe la descarga completa, con todas las cuantizaciones incluidas, en unos 600 GB. El modelo base tiene 33,1B de parámetros densos frente a los 22B de LTX 2.5, así que espera una carga mayor en tu GPU. ComfyUI añadió cuatro nodos de H3: EmptyMiniMaxH3LatentAV, MiniMaxH3ImageToVideo, MiniMaxH3ReferenceToVideo y MiniMaxH3SigmaShift.

Lo que obtienes en local es el resultado base de 768p. El pulido en 2K que llena las páginas de marketing viene de la API.

Cómo usar LTX 2.5 en PicassoIA

No necesitas una GPU para probar este modelo. LTX 2.5 Fast funciona en PicassoIA y acepta un prompt de texto o una sola foto. Al escribir esto, H3 no está en el catálogo. Los modelos de MiniMax más recientes allí son Hailuo 2.3 y Hailuo 2.3 Fast, lo que sirve como comparación razonable con el estilo MiniMax.

Paso a paso

  1. Abre la página de LTX 2.5 Fast en la colección de texto a video.
  2. Elige tu entrada. Escribe solo un prompt, o sube una foto como primer fotograma para imagen a video.
  3. Opcional: añade una imagen de último fotograma y el modelo generará una transición entre las dos.
  4. Define la relación de aspecto, la resolución, la duración y los fotogramas por segundo (consulta la tabla de abajo).
  5. Deja activado Generate Audio si quieres sonido sincronizado.
  6. Genera, previsualiza el clip y descárgalo, o ajusta el prompt y vuelve a generar.

Ajustes y consejos para el prompt

AjusteOpcionesNotas
Relación de aspecto16:9, 9:16Horizontal para web, vertical para redes sociales
Resolución720p, 1080p, 2K, 4KPor defecto es 1080p; las resoluciones más altas limitan la duración
DuraciónDe 2 a 20 segundosMás de 10 segundos solo en 720p o 1080p con 24 o 25 fps
Fotogramas por segundo24, 25, 48, 5048 y 50 fps limitan a 10 segundos
Generar audioActivado o desactivadoActivado por defecto

Para los primeros fotogramas, crea la imagen fija con un modelo de imagen como Seedream 5 Pro y luego introdúcela en el modelo de video. Controlas la composición antes de añadir cualquier movimiento.

Escribe los prompts en el orden en que ocurren las cosas: sujeto, acción, movimiento de cámara, luz y, después, sonido. Por ejemplo:

Un pescador tira de una cuerda en un pequeño barco de madera al amanecer. Travelling lento de acercamiento desde la popa, neblina marina que se desplaza sobre el agua, luz ámbar tenue sobre las tablas mojadas. Crujido de madera, olas suaves y gaviotas a lo lejos.

Guionista escribiendo prompts en un equipo portátil en una mesa de cafetería junto a una ventana con gotas de lluvia

¿Cuál deberías elegir?

Elige LTX 2.5 cuando

  • Quieres alojarlo tú mismo o hacer ajuste fino sin complicaciones regionales.
  • Te importan los clips de más de 15 segundos.
  • Iteras mucho y necesitas el menor costo por borrador.
  • Trabajas en ComfyUI y quieres plantillas de flujo de trabajo desde el primer día.
  • Necesitas 4K HDR para un flujo de postproducción.

Elige H3 cuando

  • Diriges con muchas referencias: rostros, metraje y clips de voz en una sola petición.
  • Tus escenas dependen de diálogos multilingües.
  • No te importa usar la API, y la salida en 2K pesa más que el control local.
  • Has confirmado que la licencia permite tu ubicación y tu franja de ingresos.

Si ninguno encaja, prueba el mismo prompt con Kling v3 Video o Veo 3.1 para una tercera opinión.

Haz tu propia comparativa

Las especificaciones solo llegan hasta cierto punto. La forma más rápida de resolverlo es renderizar la misma toma dos veces y verla con el sonido activado. Abre LTX 2.5 Fast en PicassoIA, pega un prompt y renderízalo en 1080p y luego en 4K. Después, lleva la misma descripción a Hailuo 2.3 y compara rostros, movimiento y audio lado a lado.

¿Quieres un primer fotograma personalizado? Genéralo con los modelos de imagen de PicassoIA, súbelo como imagen de inicio y deja que el modelo de video tome el relevo. Unos cuantos experimentos te dirán más que cualquier tabla de especificaciones, incluida esta.

Compartir este artículo

Elige tu idioma