Dois modelos de vídeo com pesos disponíveis para download foram lançados com dez dias de diferença neste verão, e os criadores não param de discutir sobre eles. A MiniMax anunciou o H3 em 31 de julho de 2026 como produto de API e, depois, liberou os pesos em 3 de agosto. A Lightricks respondeu em 11 de agosto com o LTX 2.5. Os dois geram imagem e som em uma única passagem. Os dois prometem resultados cinematográficos. Já as letras miúdas da licença tornam a escolha bem menos óbvia do que as fichas técnicas sugerem.
Esta comparação se concentra no que importa quando você tem um prazo: resolução, duração do clipe, áudio, velocidade, preço, hardware local e quem realmente tem permissão para usar os pesos. Não rodei um benchmark de laboratório, então todos os números abaixo vêm de especificações publicadas e relatos de lançamento, e eu sinalizo os valores que são afirmações dos fornecedores.
💡 Veredito rápido: o LTX 2.5 é a escolha aberta mais segura para a maioria das pessoas. O MiniMax H3 oferece saída em 2K e entradas de referência mais ricas pela API, mas os pesos que você pode baixar de fato são mais limitados do que a manchete sugere.

A resposta curta
Quem vence em uma linha
Se você quer rodar um modelo de vídeo na sua própria máquina, integrá-lo a um pipeline ou fazer fine-tuning, o LTX 2.5 vence para a maioria dos leitores. Seus pesos estão no Hugging Face, ele funcionou no ComfyUI desde o primeiro dia, e a licença comunitária é gratuita para organizações com menos de US$ 10 milhões em receita recorrente anual. Se você quer saída em 2K com diálogo e controle forte por referências, e não se importa em pagar por segundo por meio de uma API, vale a pena testar o MiniMax H3.
A resposta honesta para "melhor modelo de vídeo aberto" depende de quanto peso você dá à palavra aberto.
| Necessidade | Melhor escolha | Por quê |
|---|
| Hospedagem própria com poucas questões legais | LTX 2.5 | Pesos abertos e licença comunitária gratuita abaixo de US$ 10 mi de ARR |
| Clipe único mais longo | LTX 2.5 | Até 20 segundos na versão Fast |
| Maior resolução divulgada | LTX 2.5 | Até 4K, contra 2K do H3 |
| Direção com muitas referências | MiniMax H3 | Até 9 imagens, 3 clipes de vídeo e 3 clipes de áudio como entrada |
| Diálogo multilíngue | MiniMax H3 | Sincronização labial relatada em 11 idiomas |
| Menor custo por clipe | LTX 2.5 | US$ 0,09 por segundo na versão Fast |
O que "aberto" significa aqui
Ter pesos abertos não significa código aberto, e não significa ser gratuito para todo mundo. Significa que os arquivos do modelo podem ser baixados e executados no seu próprio hardware. A licença decide o que você pode fazer com eles. Três perguntas esclarecem a questão:
- Direitos de download: você consegue obter os arquivos?
- Direitos de uso: você pode entregar trabalhos pagos para clientes com eles?
- Direitos regionais: você tem permissão para executá-los onde mora?
Os dois fornecedores usam licenças comunitárias próprias com limites de receita, então leia o texto antes de construir um produto em cima de qualquer um deles.

LTX 2.5 em resumo
Especificações que valem a pena conhecer
A Lightricks construiu o LTX 2.5 como um modelo de áudio e vídeo com 22B de parâmetros que gera imagem e som juntos. O grande diferencial é a geração multiplano nativa. Peça um plano geral, um plano médio e um close, e o modelo os renderiza como uma sequência única, mantendo personagem, iluminação e voz estáveis de um corte para o outro, em vez de costurar clipes separados.
Outras novidades que merecem atenção:
- Duração automática: o modelo prevê a duração do clipe a partir da ação que você descreve.
- Saída 4K HDR: vídeo em alta resolução e alta faixa dinâmica para trabalhos de finalização.
- Fluxo RAW: um caminho pensado para pipelines profissionais de cor.
- Beta de edição: um modo para revisar vídeos existentes em vez de gerá-los de novo.
Sobre velocidade, a Lightricks afirma que um clipe de 10 segundos fica pronto em 6,8 segundos em dois superchips NVIDIA GB200. Esse é um número do fornecedor em hardware muito caro, então trate-o como um teto, não como promessa para a sua mesa. Pela API gerenciada, o mesmo trabalho levou, segundo relatos, 23,7 segundos em 1080p, o que ainda é rápido.
Licença e ecossistema
Os pesos estão no Hugging Face em várias versões: o checkpoint completo de desenvolvimento, uma versão destilada para velocidade e quantizações int8 e NVFP4 para orçamentos menores de memória. O suporte no ComfyUI estava pronto no dia do lançamento, com modelos oficiais de fluxo de trabalho para texto para vídeo e imagem para vídeo.
A LTX-2.x Community License permite fine-tuning e hospedagem própria e não custa nada para organizações com menos de US$ 10 milhões em receita recorrente anual. Ela proíbe usar o modelo para construir um sistema de IA concorrente e veda o uso militar sem um acordo separado.

MiniMax H3 em resumo
O que o H3 traz
O H3 é o modelo de vídeo omnimodal da MiniMax, sucessor da linha Hailuo 2.3. Ele gera de 4 a 15 segundos de vídeo a 24 fps, até 2K, com som estéreo nativo (diálogo, efeitos e ambiente) produzido na mesma passagem. Os relatos de lançamento também citam diálogo com sincronização labial em 11 idiomas, e o modelo base aparece com 33,1B de parâmetros.
O ponto forte do H3 é a flexibilidade de entrada. A API, segundo relatos, aceita até 9 imagens de referência, 3 clipes de vídeo de referência (15 segundos no total) e 3 clipes de áudio, 12 arquivos no total, além de um prompt de até 7.000 caracteres. Referências de áudio não podem ser enviadas sozinhas. Para consistência de personagem entre planos, isso é muito controle de direção.
O preço da API na semana do lançamento foi relatado em US$ 0,13 por segundo de vídeo em 2K, ou US$ 7,80 por minuto, com as cinco primeiras imagens de referência gratuitas e US$ 0,04 para cada uma depois disso. Confira a tabela de preços atual da MiniMax antes de montar seu orçamento.

A pegadinha da licença
O H3 começou como produto somente de API. Os pesos chegaram em 3 de agosto sob a MiniMax H3 Community License, e três detalhes importam:
- Só o H3-Base foi liberado. Os dois checkpoints, FL2VA e Ref2VA, são ambos destilados para CFG.
- A etapa 2K ficou fechada. A geração local funciona com lado curto de 768 pixels. O módulo H3-Regenerate-2K não foi liberado como código aberto, e a API executa o pipeline 2K completo.
- Limites territoriais. Várias análises da licença, incluindo levantamentos de provedores de hospedagem, dizem que ela exclui os Estados Unidos, a União Europeia, o Reino Unido e a Coreia do Sul, segundo relatos até para usar as saídas do modelo dentro dessas regiões. Também foi relatado um limite de receita de US$ 20 milhões.
💡 Leia você mesmo o texto da licença antes de confiar em qualquer resumo de terceiros, inclusive este. Se as exclusões territoriais valem para onde você mora, os pesos abertos estão fora de cogitação, por melhor que a ficha técnica pareça.
Comparação frente a frente
Resolução e duração do clipe
| Recurso | LTX 2.5 | MiniMax H3 |
|---|
| Lançamento | 11 de agosto de 2026 | API em 31 de julho, pesos em 3 de agosto de 2026 |
| Tamanho do modelo | 22B de parâmetros | 33,1B de parâmetros |
| Pesos abertos | Dev completo, destilado, int8, NVFP4 | Somente H3-Base (FL2VA, Ref2VA) |
| Resolução máxima | Até 4K HDR | 2K pela API, lado curto de 768p localmente |
| Duração do clipe | Até 20 segundos (versão Fast) | 4 a 15 segundos |
| Áudio | Áudio e vídeo conjuntos | Estéreo nativo, diálogo em 11 idiomas |
| Multiplano | Sequências multiplano nativas | Vários planos dentro de uma geração |
| Entradas de referência | Imagem para vídeo, primeiro e último quadro | 9 imagens, 3 vídeos, 3 clipes de áudio |
| Licença | LTX-2.x Community, gratuita abaixo de US$ 10 mi de ARR | MiniMax H3 Community, limites regionais relatados |
No papel, o LTX 2.5 tem mais margem: até 4K e até 20 segundos. Clipes longos vêm com uma contrapartida, já que o teto de 20 segundos vale apenas em 1080p ou abaixo. O H3 chega a 2K e 15 segundos pela API e a 768p localmente. Resolução, porém, não é qualidade. Um clipe limpo em 1080p com movimento convincente vence um clipe em 4K com mãos derretidas.
Rostos, movimento e áudio
Close-ups expõem todas as fraquezas de um modelo de vídeo: textura da pele, piscadas, fios de cabelo, formato dos lábios. O H3 destaca a consistência baseada em referências e a sincronização labial multilíngue, o que sugere que a MiniMax mira cenas guiadas por diálogo. O LTX 2.5 mira o mesmo alvo com geração conjunta de áudio e vídeo e sequências multiplano que mantêm uma voz estável entre cortes.
Sinceramente, não consigo ranquear os rostos deles só pelas fichas técnicas, e ninguém mais consegue sem renderizações lado a lado. Teste com o seu próprio material: um rosto, uma linha de diálogo, um movimento de câmera.

O som é a outra metade da história:
- LTX 2.5: o áudio é gerado junto com o vídeo, e no LTX 2.5 Fast ele pode ser ligado ou desligado em cada renderização.
- H3: saída estéreo a 32 kHz, segundo uma ficha técnica, com diálogo, efeitos e ambiente na mesma passagem.

Velocidade e custo
O preço por segundo facilita a conta. Estes são preços de API da semana de lançamento, conforme relatados, e as resoluções são diferentes (H3 em 2K, LTX em até 1080p), então este não é um teste de comparação direta.
| Duração do clipe | LTX 2.5 Fast (US$ 0,09/s) | LTX 2.5 Pro (US$ 0,12/s) | H3 em 2K (US$ 0,13/s) |
|---|
| 5 segundos | US$ 0,45 | US$ 0,60 | US$ 0,65 |
| 10 segundos | US$ 0,90 | US$ 1,20 | US$ 1,30 |
| 15 segundos | US$ 1,35 | Indisponível (limite de 10 s) | US$ 1,95 |
| 20 segundos | US$ 1,80 | Indisponível (limite de 10 s) | Indisponível (limite de 15 s) |
A versão Fast é a forma mais barata de iterar. A versão Pro é posicionada em torno da aderência ao prompt, rostos e tipografia, então faz sentido para a renderização final quando os rascunhos Fast já estiverem certos.

Rodando no seu próprio hardware
LTX 2.5 em uma estação de trabalho
A Lightricks disponibiliza um checkpoint destilado para velocidade e versões quantizadas para orçamentos de memória mais apertados. As versões NVFP4 são voltadas à arquitetura mais recente da NVIDIA, então placas mais antigas provavelmente terão melhor desempenho com int8. Não encontrei um mínimo firme de VRAM nos relatos de lançamento, então confira o cartão do modelo para sua GPU exata.
Uma primeira execução sensata: carregue o checkpoint destilado no ComfyUI, renderize um clipe de 10 segundos em 1080p e só então avance para 4K ou durações maiores.

Limites locais do H3
O repositório do H3 é grande. Um passo a passo de um provedor de hospedagem descreve o download completo, com todas as quantizações incluídas, em cerca de 600 GB. O modelo base tem 33,1B de parâmetros densos contra 22B do LTX 2.5, então espere uma carga mais pesada na sua GPU. O ComfyUI ganhou quatro nós do H3: EmptyMiniMaxH3LatentAV, MiniMaxH3ImageToVideo, MiniMaxH3ReferenceToVideo e MiniMaxH3SigmaShift.
O que você obtém localmente é o resultado base em 768p. O acabamento em 2K que enche as páginas de marketing vem da API.
Como usar o LTX 2.5 na PicassoIA
Você não precisa de GPU para testar este modelo. O LTX 2.5 Fast roda na PicassoIA e aceita um prompt de texto ou uma única foto. No momento em que escrevo, o próprio H3 não está no catálogo. Os modelos mais recentes da MiniMax por lá são o Hailuo 2.3 e o Hailuo 2.3 Fast, o que faz um teste paralelo justo para o estilo MiniMax.
Passo a passo
- Abra a página do LTX 2.5 Fast na coleção de texto para vídeo.
- Escolha sua entrada. Escreva apenas um prompt ou envie uma foto de primeiro quadro para imagem para vídeo.
- Opcional: adicione uma imagem de último quadro e o modelo vai interpolar uma transição entre as duas.
- Defina a proporção, a resolução, a duração e a taxa de quadros (veja a tabela abaixo).
- Deixe Generate Audio ligado se quiser som sincronizado.
- Gere, visualize o clipe e depois baixe-o ou ajuste o prompt e rode de novo.
Configurações e dicas de prompt
| Configuração | Opções | Observações |
|---|
| Proporção | 16:9, 9:16 | Paisagem para a web, retrato para redes sociais |
| Resolução | 720p, 1080p, 2K, 4K | O padrão é 1080p; resoluções maiores limitam a duração |
| Duração | 2 a 20 segundos | Acima de 10 segundos só em 720p ou 1080p com 24 ou 25 fps |
| Taxa de quadros | 24, 25, 48, 50 | 48 e 50 fps limitam a 10 segundos |
| Gerar áudio | Ligado ou desligado | Ligado por padrão |
Para os primeiros quadros, crie a imagem fixa com um modelo de imagem como o Seedream 5 Pro e depois envie para o modelo de vídeo. Você controla a composição antes de qualquer movimento ser adicionado.
Escreva os prompts na ordem em que as coisas acontecem: sujeito, ação, movimento de câmera, luz e depois som. Por exemplo:
Um pescador puxa uma corda em um pequeno barco de madeira ao amanhecer. Travelling lento em direção ao casco, névoa do mar se espalhando sobre a água, luz âmbar baixa sobre as tábuas molhadas. Madeira rangendo, ondas suaves e gaivotas ao longe.

Qual você deve escolher?
Escolha o LTX 2.5 quando
- Você quer hospedar por conta própria ou fazer fine-tuning sem questões regionais.
- Clipes com mais de 15 segundos são importantes para você.
- Você itera muito e precisa do menor custo por rascunho.
- Você trabalha no ComfyUI e quer modelos de fluxo de trabalho desde o primeiro dia.
- Você precisa de 4K HDR para um pipeline de finalização.
Escolha o H3 quando
- Você dirige com muitas referências: rostos, vídeos e clipes de voz em uma única solicitação.
- Suas cenas dependem de diálogo multilíngue.
- Você aceita usar a API e a saída em 2K importa mais do que o controle local.
- Você confirmou que a licença permite a sua localização e a sua faixa de receita.
Se nenhum dos dois encaixar, rode o mesmo prompt no Kling v3 Video ou no Veo 3.1 para uma terceira opinião.
Faça sua própria comparação
Especificações só vão até certo ponto. A forma mais rápida de resolver isso é renderizar a mesma cena duas vezes e assistir com o som ligado. Abra o LTX 2.5 Fast na PicassoIA, cole um prompt e renderize em 1080p e depois em 4K. Em seguida, rode a mesma descrição no Hailuo 2.3 e compare rostos, movimento e áudio lado a lado.
Quer um primeiro quadro personalizado? Gere-o com os modelos de imagem da PicassoIA, envie como imagem inicial e deixe o modelo de vídeo assumir. Alguns experimentos vão te dizer mais do que qualquer tabela de especificações, inclusive esta.