LTX 2.5 ou MiniMax H3: qual é o melhor modelo de vídeo aberto?

Dois modelos de vídeo de pesos abertos chegaram em agosto de 2026: o LTX 2.5, da Lightricks, e o MiniMax H3. Esta comparação lado a lado analisa especificações, saída em 4K versus 2K, duração do clipe, áudio, preços da API, requisitos de hardware local e restrições de licença, para você escolher o melhor para seus projetos.

LTX 2.5 ou MiniMax H3: qual é o melhor modelo de vídeo aberto?
Cristian Da Conceicao
Fundador do Picasso IA

Dois modelos de vídeo com pesos disponíveis para download foram lançados com dez dias de diferença neste verão, e os criadores não param de discutir sobre eles. A MiniMax anunciou o H3 em 31 de julho de 2026 como produto de API e, depois, liberou os pesos em 3 de agosto. A Lightricks respondeu em 11 de agosto com o LTX 2.5. Os dois geram imagem e som em uma única passagem. Os dois prometem resultados cinematográficos. Já as letras miúdas da licença tornam a escolha bem menos óbvia do que as fichas técnicas sugerem.

Esta comparação se concentra no que importa quando você tem um prazo: resolução, duração do clipe, áudio, velocidade, preço, hardware local e quem realmente tem permissão para usar os pesos. Não rodei um benchmark de laboratório, então todos os números abaixo vêm de especificações publicadas e relatos de lançamento, e eu sinalizo os valores que são afirmações dos fornecedores.

💡 Veredito rápido: o LTX 2.5 é a escolha aberta mais segura para a maioria das pessoas. O MiniMax H3 oferece saída em 2K e entradas de referência mais ricas pela API, mas os pesos que você pode baixar de fato são mais limitados do que a manchete sugere.

Editor de vídeo comparando dois clipes pausados em uma mesa com dois monitores em um loft iluminado

A resposta curta

Quem vence em uma linha

Se você quer rodar um modelo de vídeo na sua própria máquina, integrá-lo a um pipeline ou fazer fine-tuning, o LTX 2.5 vence para a maioria dos leitores. Seus pesos estão no Hugging Face, ele funcionou no ComfyUI desde o primeiro dia, e a licença comunitária é gratuita para organizações com menos de US$ 10 milhões em receita recorrente anual. Se você quer saída em 2K com diálogo e controle forte por referências, e não se importa em pagar por segundo por meio de uma API, vale a pena testar o MiniMax H3.

A resposta honesta para "melhor modelo de vídeo aberto" depende de quanto peso você dá à palavra aberto.

NecessidadeMelhor escolhaPor quê
Hospedagem própria com poucas questões legaisLTX 2.5Pesos abertos e licença comunitária gratuita abaixo de US$ 10 mi de ARR
Clipe único mais longoLTX 2.5Até 20 segundos na versão Fast
Maior resolução divulgadaLTX 2.5Até 4K, contra 2K do H3
Direção com muitas referênciasMiniMax H3Até 9 imagens, 3 clipes de vídeo e 3 clipes de áudio como entrada
Diálogo multilíngueMiniMax H3Sincronização labial relatada em 11 idiomas
Menor custo por clipeLTX 2.5US$ 0,09 por segundo na versão Fast

O que "aberto" significa aqui

Ter pesos abertos não significa código aberto, e não significa ser gratuito para todo mundo. Significa que os arquivos do modelo podem ser baixados e executados no seu próprio hardware. A licença decide o que você pode fazer com eles. Três perguntas esclarecem a questão:

  • Direitos de download: você consegue obter os arquivos?
  • Direitos de uso: você pode entregar trabalhos pagos para clientes com eles?
  • Direitos regionais: você tem permissão para executá-los onde mora?

Os dois fornecedores usam licenças comunitárias próprias com limites de receita, então leia o texto antes de construir um produto em cima de qualquer um deles.

Mãos de um técnico retirando uma placa de vídeo de um gabinete de PC aberto sobre uma bancada de aço

LTX 2.5 em resumo

Especificações que valem a pena conhecer

A Lightricks construiu o LTX 2.5 como um modelo de áudio e vídeo com 22B de parâmetros que gera imagem e som juntos. O grande diferencial é a geração multiplano nativa. Peça um plano geral, um plano médio e um close, e o modelo os renderiza como uma sequência única, mantendo personagem, iluminação e voz estáveis de um corte para o outro, em vez de costurar clipes separados.

Outras novidades que merecem atenção:

  • Duração automática: o modelo prevê a duração do clipe a partir da ação que você descreve.
  • Saída 4K HDR: vídeo em alta resolução e alta faixa dinâmica para trabalhos de finalização.
  • Fluxo RAW: um caminho pensado para pipelines profissionais de cor.
  • Beta de edição: um modo para revisar vídeos existentes em vez de gerá-los de novo.

Sobre velocidade, a Lightricks afirma que um clipe de 10 segundos fica pronto em 6,8 segundos em dois superchips NVIDIA GB200. Esse é um número do fornecedor em hardware muito caro, então trate-o como um teto, não como promessa para a sua mesa. Pela API gerenciada, o mesmo trabalho levou, segundo relatos, 23,7 segundos em 1080p, o que ainda é rápido.

Licença e ecossistema

Os pesos estão no Hugging Face em várias versões: o checkpoint completo de desenvolvimento, uma versão destilada para velocidade e quantizações int8 e NVFP4 para orçamentos menores de memória. O suporte no ComfyUI estava pronto no dia do lançamento, com modelos oficiais de fluxo de trabalho para texto para vídeo e imagem para vídeo.

A LTX-2.x Community License permite fine-tuning e hospedagem própria e não custa nada para organizações com menos de US$ 10 milhões em receita recorrente anual. Ela proíbe usar o modelo para construir um sistema de IA concorrente e veda o uso militar sem um acordo separado.

Diretor de fotografia ajustando uma câmera de cinema em um tripé em um penhasco à beira-mar durante a hora dourada

MiniMax H3 em resumo

O que o H3 traz

O H3 é o modelo de vídeo omnimodal da MiniMax, sucessor da linha Hailuo 2.3. Ele gera de 4 a 15 segundos de vídeo a 24 fps, até 2K, com som estéreo nativo (diálogo, efeitos e ambiente) produzido na mesma passagem. Os relatos de lançamento também citam diálogo com sincronização labial em 11 idiomas, e o modelo base aparece com 33,1B de parâmetros.

O ponto forte do H3 é a flexibilidade de entrada. A API, segundo relatos, aceita até 9 imagens de referência, 3 clipes de vídeo de referência (15 segundos no total) e 3 clipes de áudio, 12 arquivos no total, além de um prompt de até 7.000 caracteres. Referências de áudio não podem ser enviadas sozinhas. Para consistência de personagem entre planos, isso é muito controle de direção.

O preço da API na semana do lançamento foi relatado em US$ 0,13 por segundo de vídeo em 2K, ou US$ 7,80 por minuto, com as cinco primeiras imagens de referência gratuitas e US$ 0,04 para cada uma depois disso. Confira a tabela de preços atual da MiniMax antes de montar seu orçamento.

Equipe de colegas revisando imagens pausadas em um grande painel de parede em uma sala de reuniões de vidro

A pegadinha da licença

O H3 começou como produto somente de API. Os pesos chegaram em 3 de agosto sob a MiniMax H3 Community License, e três detalhes importam:

  • Só o H3-Base foi liberado. Os dois checkpoints, FL2VA e Ref2VA, são ambos destilados para CFG.
  • A etapa 2K ficou fechada. A geração local funciona com lado curto de 768 pixels. O módulo H3-Regenerate-2K não foi liberado como código aberto, e a API executa o pipeline 2K completo.
  • Limites territoriais. Várias análises da licença, incluindo levantamentos de provedores de hospedagem, dizem que ela exclui os Estados Unidos, a União Europeia, o Reino Unido e a Coreia do Sul, segundo relatos até para usar as saídas do modelo dentro dessas regiões. Também foi relatado um limite de receita de US$ 20 milhões.

💡 Leia você mesmo o texto da licença antes de confiar em qualquer resumo de terceiros, inclusive este. Se as exclusões territoriais valem para onde você mora, os pesos abertos estão fora de cogitação, por melhor que a ficha técnica pareça.

Comparação frente a frente

Resolução e duração do clipe

RecursoLTX 2.5MiniMax H3
Lançamento11 de agosto de 2026API em 31 de julho, pesos em 3 de agosto de 2026
Tamanho do modelo22B de parâmetros33,1B de parâmetros
Pesos abertosDev completo, destilado, int8, NVFP4Somente H3-Base (FL2VA, Ref2VA)
Resolução máximaAté 4K HDR2K pela API, lado curto de 768p localmente
Duração do clipeAté 20 segundos (versão Fast)4 a 15 segundos
ÁudioÁudio e vídeo conjuntosEstéreo nativo, diálogo em 11 idiomas
MultiplanoSequências multiplano nativasVários planos dentro de uma geração
Entradas de referênciaImagem para vídeo, primeiro e último quadro9 imagens, 3 vídeos, 3 clipes de áudio
LicençaLTX-2.x Community, gratuita abaixo de US$ 10 mi de ARRMiniMax H3 Community, limites regionais relatados

No papel, o LTX 2.5 tem mais margem: até 4K e até 20 segundos. Clipes longos vêm com uma contrapartida, já que o teto de 20 segundos vale apenas em 1080p ou abaixo. O H3 chega a 2K e 15 segundos pela API e a 768p localmente. Resolução, porém, não é qualidade. Um clipe limpo em 1080p com movimento convincente vence um clipe em 4K com mãos derretidas.

Rostos, movimento e áudio

Close-ups expõem todas as fraquezas de um modelo de vídeo: textura da pele, piscadas, fios de cabelo, formato dos lábios. O H3 destaca a consistência baseada em referências e a sincronização labial multilíngue, o que sugere que a MiniMax mira cenas guiadas por diálogo. O LTX 2.5 mira o mesmo alvo com geração conjunta de áudio e vídeo e sequências multiplano que mantêm uma voz estável entre cortes.

Sinceramente, não consigo ranquear os rostos deles só pelas fichas técnicas, e ninguém mais consegue sem renderizações lado a lado. Teste com o seu próprio material: um rosto, uma linha de diálogo, um movimento de câmera.

Retrato em close mostrando textura da pele e detalhes finos de cabelo perto de uma janela

O som é a outra metade da história:

  • LTX 2.5: o áudio é gerado junto com o vídeo, e no LTX 2.5 Fast ele pode ser ligado ou desligado em cada renderização.
  • H3: saída estéreo a 32 kHz, segundo uma ficha técnica, com diálogo, efeitos e ambiente na mesma passagem.

Técnico de som de fones de ouvido em uma mesa de mixagem em uma sala de gravação tratada acusticamente

Velocidade e custo

O preço por segundo facilita a conta. Estes são preços de API da semana de lançamento, conforme relatados, e as resoluções são diferentes (H3 em 2K, LTX em até 1080p), então este não é um teste de comparação direta.

Duração do clipeLTX 2.5 Fast (US$ 0,09/s)LTX 2.5 Pro (US$ 0,12/s)H3 em 2K (US$ 0,13/s)
5 segundosUS$ 0,45US$ 0,60US$ 0,65
10 segundosUS$ 0,90US$ 1,20US$ 1,30
15 segundosUS$ 1,35Indisponível (limite de 10 s)US$ 1,95
20 segundosUS$ 1,80Indisponível (limite de 10 s)Indisponível (limite de 15 s)

A versão Fast é a forma mais barata de iterar. A versão Pro é posicionada em torno da aderência ao prompt, rostos e tipografia, então faz sentido para a renderização final quando os rascunhos Fast já estiverem certos.

Vista de cima de uma mesa com um caderno, cronômetro, calculadora e xícara de café

Rodando no seu próprio hardware

LTX 2.5 em uma estação de trabalho

A Lightricks disponibiliza um checkpoint destilado para velocidade e versões quantizadas para orçamentos de memória mais apertados. As versões NVFP4 são voltadas à arquitetura mais recente da NVIDIA, então placas mais antigas provavelmente terão melhor desempenho com int8. Não encontrei um mínimo firme de VRAM nos relatos de lançamento, então confira o cartão do modelo para sua GPU exata.

Uma primeira execução sensata: carregue o checkpoint destilado no ComfyUI, renderize um clipe de 10 segundos em 1080p e só então avance para 4K ou durações maiores.

Torre de computador de estação de trabalho com a lateral removida sobre uma bancada de garagem

Limites locais do H3

O repositório do H3 é grande. Um passo a passo de um provedor de hospedagem descreve o download completo, com todas as quantizações incluídas, em cerca de 600 GB. O modelo base tem 33,1B de parâmetros densos contra 22B do LTX 2.5, então espere uma carga mais pesada na sua GPU. O ComfyUI ganhou quatro nós do H3: EmptyMiniMaxH3LatentAV, MiniMaxH3ImageToVideo, MiniMaxH3ReferenceToVideo e MiniMaxH3SigmaShift.

O que você obtém localmente é o resultado base em 768p. O acabamento em 2K que enche as páginas de marketing vem da API.

Como usar o LTX 2.5 na PicassoIA

Você não precisa de GPU para testar este modelo. O LTX 2.5 Fast roda na PicassoIA e aceita um prompt de texto ou uma única foto. No momento em que escrevo, o próprio H3 não está no catálogo. Os modelos mais recentes da MiniMax por lá são o Hailuo 2.3 e o Hailuo 2.3 Fast, o que faz um teste paralelo justo para o estilo MiniMax.

Passo a passo

  1. Abra a página do LTX 2.5 Fast na coleção de texto para vídeo.
  2. Escolha sua entrada. Escreva apenas um prompt ou envie uma foto de primeiro quadro para imagem para vídeo.
  3. Opcional: adicione uma imagem de último quadro e o modelo vai interpolar uma transição entre as duas.
  4. Defina a proporção, a resolução, a duração e a taxa de quadros (veja a tabela abaixo).
  5. Deixe Generate Audio ligado se quiser som sincronizado.
  6. Gere, visualize o clipe e depois baixe-o ou ajuste o prompt e rode de novo.

Configurações e dicas de prompt

ConfiguraçãoOpçõesObservações
Proporção16:9, 9:16Paisagem para a web, retrato para redes sociais
Resolução720p, 1080p, 2K, 4KO padrão é 1080p; resoluções maiores limitam a duração
Duração2 a 20 segundosAcima de 10 segundos só em 720p ou 1080p com 24 ou 25 fps
Taxa de quadros24, 25, 48, 5048 e 50 fps limitam a 10 segundos
Gerar áudioLigado ou desligadoLigado por padrão

Para os primeiros quadros, crie a imagem fixa com um modelo de imagem como o Seedream 5 Pro e depois envie para o modelo de vídeo. Você controla a composição antes de qualquer movimento ser adicionado.

Escreva os prompts na ordem em que as coisas acontecem: sujeito, ação, movimento de câmera, luz e depois som. Por exemplo:

Um pescador puxa uma corda em um pequeno barco de madeira ao amanhecer. Travelling lento em direção ao casco, névoa do mar se espalhando sobre a água, luz âmbar baixa sobre as tábuas molhadas. Madeira rangendo, ondas suaves e gaivotas ao longe.

Roteirista digitando prompts em um notebook sobre a mesa de um café ao lado de uma janela riscada pela chuva

Qual você deve escolher?

Escolha o LTX 2.5 quando

  • Você quer hospedar por conta própria ou fazer fine-tuning sem questões regionais.
  • Clipes com mais de 15 segundos são importantes para você.
  • Você itera muito e precisa do menor custo por rascunho.
  • Você trabalha no ComfyUI e quer modelos de fluxo de trabalho desde o primeiro dia.
  • Você precisa de 4K HDR para um pipeline de finalização.

Escolha o H3 quando

  • Você dirige com muitas referências: rostos, vídeos e clipes de voz em uma única solicitação.
  • Suas cenas dependem de diálogo multilíngue.
  • Você aceita usar a API e a saída em 2K importa mais do que o controle local.
  • Você confirmou que a licença permite a sua localização e a sua faixa de receita.

Se nenhum dos dois encaixar, rode o mesmo prompt no Kling v3 Video ou no Veo 3.1 para uma terceira opinião.

Faça sua própria comparação

Especificações só vão até certo ponto. A forma mais rápida de resolver isso é renderizar a mesma cena duas vezes e assistir com o som ligado. Abra o LTX 2.5 Fast na PicassoIA, cole um prompt e renderize em 1080p e depois em 4K. Em seguida, rode a mesma descrição no Hailuo 2.3 e compare rostos, movimento e áudio lado a lado.

Quer um primeiro quadro personalizado? Gere-o com os modelos de imagem da PicassoIA, envie como imagem inicial e deixe o modelo de vídeo assumir. Alguns experimentos vão te dizer mais do que qualquer tabela de especificações, inclusive esta.

Compartilhe este artigo

Escolha seu idioma