A maioria dos modelos de vídeo fica atrás de um login e de um medidor de créditos. O MiniMax H3 não precisa disso. Seus pesos abertos rodam dentro do ComfyUI na sua própria placa de vídeo, e uma única passagem devolve até 15 segundos de vídeo a 24 fps com uma trilha estéreo já mixada: diálogo, efeitos sonoros e música juntos. Parece pronto para usar, e na maior parte das vezes é, desde que você escolha os arquivos certos do modelo, escreva os prompts do jeito que o H3 espera e saiba onde um LoRA realmente ajuda. Este artigo segue o fluxo de trabalho do MiniMax H3 no ComfyUI na ordem em que você vai encontrar cada problema: hardware, arquivos, os três modos de geração, prompts, velocidade, LoRAs de personagem e clipes mais longos.
O que o MiniMax H3 realmente faz
O H3 é um modelo de vídeo omnimodal. Em vez de renderizar quadros mudos e pedir a uma segunda ferramenta que adicione o som, ele sintetiza imagem, voz, efeitos e música na mesma passagem. O ComfyUI adicionou suporte nativo na versão 0.30.0, então os modelos básicos não precisam de nenhum nó personalizado.
Três modos em um só modelo
- Texto para vídeo (T2V): apenas um prompt. Descreva a cena e o modelo devolve um clipe com áudio.
- Imagem para vídeo (I2V): uma imagem fixa, mais entradas opcionais de primeiro e último quadro. O modelo preenche o movimento entre os dois quadros.
- Referência para vídeo (R2V): um prompt mais até 9 imagens de referência, 3 vídeos de referência e 3 clipes de áudio. Você decide qual referência controla identidade, estilo, movimento, câmera ou voz.
Os pesos seguem a mesma divisão. T2V e I2V usam os checkpoints FL2VA, enquanto R2V usa os checkpoints Ref2VA, então planeje um download separado se quiser os três modos.
Os números que importam
| Especificação | Valor |
|---|
| Duração do clipe | Até 15 segundos |
| Taxa de quadros | 24 fps |
| Áudio | Estéreo nativo a 32 kHz |
| Idiomas de fala | 11: árabe, chinês, inglês, francês, alemão, italiano, japonês, coreano, português, russo, espanhol |
| Resolução principal | Até 2K |
| Predefinições do template | 960×544, 1152×640, 1216×672 |
| Tamanho mínimo utilizável | 384p (256p falha) |
| Regra de tamanho | Largura e altura em múltiplos de 32 |
💡 Leia com atenção a linha de resolução. "Até 2K" é o teto. Um relato da comunidade descreve uma tela nativa de cerca de 768 px no lado menor, então trate as predefinições acima como seu ponto de partida realista e teste tamanhos maiores na sua própria placa.
Hardware e a realidade do disco
Antes de baixar qualquer coisa, verifique o que sua máquina aguenta. O H3 é um modelo grande, e a diferença entre "roda" e "roda bem" é enorme.

VRAM por classe de placa
Os números abaixo vêm de um benchmark da comunidade, não de uma especificação oficial, então espere variação conforme drivers, resolução e quantização.
| Classe da placa | O que esperar |
|---|
| 6 GB (classe RTX 2060) | Roda, mas com detalhes borrados, áudio mais grosseiro e cerca de 10 a 15 minutos por clipe |
| 12 a 16 GB (classe RTX 4060) | Cerca de 6 minutos para um clipe de 5 segundos em 480p, mais limpo que a faixa de 6 GB |
| 24 GB (classe RTX 4090) | Resolução maior com menos concessões, e espaço suficiente para treinar LoRAs |
| 32 GB ou mais (RTX 5090, RTX 6000) | A faixa recomendada, com clipes mais longos de 15 segundos em resolução maior |
| Apple Silicon | Uma versão NF4 de 4 bits roda a partir de apenas 8 GB, com queda visível de qualidade em cenas carregadas |
Arquivos do modelo e espaço em disco
Cada componente vem em três precisões, e a escolha é uma contrapartida entre qualidade e memória. Os arquivos de difusão INT8 podados e o codificador de texto nvfp4 são os que as notas do modelo recomendam, porque deixam mais espaço para o próprio vídeo. Suba para INT8 ou BF16 apenas se você tiver VRAM sobrando e conseguir ver diferença nos seus próprios testes lado a lado.
| Arquivo | Tamanho | Função |
|---|
| FL2VA INT8 podado ConvRot | 19,5 GB | Recomendado para T2V e I2V |
| FL2VA INT8 ConvRot | 31,7 GB | Opção INT8 maior |
| FL2VA BF16 | 61,7 GB | Precisão total |
| Ref2VA INT8 podado ConvRot | 19,5 GB | Recomendado para R2V |
| Qwen3-VL, codificador nvfp4 AWQ | 14,6 GB | Codificador recomendado |
| Qwen3-VL INT8 ConvRot | 25,3 GB | Opção de codificador maior |
| Qwen3-VL BF16 | 48,0 GB | Codificador de precisão total |
| Video VAE FP16 | 4,9 GB | Obrigatório |
| Audio VAE FP32 | 0,6 GB | Obrigatório |
A configuração enxuta de T2V e I2V (modelo de difusão INT8 podado, codificador de texto nvfp4 e os dois VAEs) soma cerca de 39,6 GB. Acrescente mais 19,5 GB se quiser R2V. Mantenha tudo em um drive NVMe, porque carregar 40 GB de um disco mecânico é doloroso.

Configuração local no ComfyUI
Atualize e abra o modelo
- Atualize o ComfyUI para a versão 0.30.0 ou posterior.
- Abra Workflow, Browse Templates, Video e escolha um modelo do MiniMax H3.
- Coloque os arquivos baixados em
models/diffusion_models/, models/text_encoders/ e models/vae/.
- Reinicie o ComfyUI para que os carregadores vejam os novos arquivos.
Faça primeiro um teste curto de T2V em baixa resolução. Um bom primeiro teste é um clipe em 384p com uma única frase de diálogo e um efeito sonoro óbvio, como uma porta batendo. Se a imagem aparecer, mas o áudio ficar mudo, o culpado provável é o caminho de decodificação de áudio, e não o seu prompt. Se os dois funcionarem, você tem uma base segura para mudar uma configuração de cada vez.
A saída de áudio depende do nó VAEDecodeAudio, que os templates já incluem. O nó de imagem para vídeo é o MiniMaxH3ImageToVideo, e ele expõe as entradas first_frame e last_frame.
Configurações de amostragem que se sustentam
A base das notas da comunidade é o amostrador res_multistep com o agendador simple em 20 passos. A qualidade cai visivelmente abaixo de cerca de 15 passos. Se sua placa suportar, inicie o ComfyUI com --use-sage-attention para uma geração de até cerca de 2x mais rápida. Para testes, reduza para 384p e duração curta, e aumente o tamanho quando o movimento e o áudio estiverem certos.
Uma alternativa em um único grafo
ComfyUI-MiniMaxH3-Easy é um nó personalizado da comunidade que reúne T2V, I2V, primeiro e último quadro, e R2V em um fluxo de trabalho compacto. Instale clonando o repositório em ComfyUI/custom_nodes ou pesquisando o nome dele no ComfyUI Manager. A geração não precisa de credenciais de API. Contas da OpenAI, do Gemini ou do Ollama são usadas apenas pelo otimizador de prompt opcional, e os amostradores, LoRAs e patches de atenção continuam sendo conexões comuns do ComfyUI. Ele também oferece um modo de humano digital guiado por uma única faixa de áudio, útil para clipes de apresentador.
Escrevendo prompts para o H3 como um diretor

Primeiro a cena, depois os planos
O H3 responde melhor a um prompt que descreve primeiro a cena geral (local, personagem, o que está acontecendo) e depois divide o clipe em planos cronometrados. Inclua movimentos de câmera e o áudio que você quer, e não apenas a imagem.
Prompt de exemplo: Um mercado noturno chuvoso em Osaka, um vendedor de rua com uma capa de chuva amarela servindo caldo em uma tigela de papel. 0 a 4 s: aproximação lenta sobre o vapor que sobe da panela, chuva batendo em uma lona. 4 a 9 s: plano médio enquanto o vendedor entrega a tigela a um cliente e sorri. 9 a 15 s: acompanhamento com câmera na mão enquanto o cliente caminha para a multidão. Áudio: chuva, óleo chiando, conversas distantes, música suave de shamisen.
Compare isso com um prompt pobre como "um homem cozinha macarrão na chuva." O H3 ainda devolverá algo assistível, mas a câmera, o ritmo e a trilha sonora serão palpites. Detalhar as batidas dá ao modelo uma linha do tempo para seguir, e dá a você algo concreto para editar quando um plano falhar. Mude uma única batida por teste para saber qual edição causou qual resultado.
Uma lista curta de verificação mantém os prompts consistentes:
- Cena: onde, quando e quem.
- Planos: uma linha por batida, com segundos.
- Câmera: aproximação, acompanhamento com câmera na mão, órbita ou câmera travada.
- Áudio: diálogo, efeitos e música, cada um nomeado separadamente.

Diálogo e som no prompt
Como o áudio é gerado junto com a imagem, nomeie-o. Diga quem fala e o que diz, e depois liste efeitos e música em uma linha própria para que não se misturem com a descrição da imagem. Com 11 idiomas suportados, você pode escrever o diálogo no idioma em que o personagem deve falar. No nó Easy, digitar # abre um bloco de diálogo que é convertido, na execução, nas tags <d>...</d> que o H3 espera.
Tags de referência para R2V
No modo de referência, cite cada entrada pela tag, na ordem exata em que você a conectou: <Picture 1>, <Video 1>, <Audio 1>. Depois, diga qual referência controla cada parte do plano:
Use <Picture 1> para o rosto e a roupa do personagem, <Video 1> para o movimento de câmera e <Audio 1> para a voz.
No nó Easy, @Image1, @Video1 e @Audio1 são convertidos nessas tags para você.

Controle de primeiro e último quadro
Duas imagens fixas costumam orientar um clipe melhor do que mais cem palavras de prompt. No modo I2V, first_frame e last_frame são ambos opcionais, e o modelo gera o movimento entre eles.

Crie e alinhe os quadros inicial e final
Crie os dois quadros antes de abrir o ComfyUI. O PicassoIA Image ou o Seedream 5 Pro podem gerar a imagem inicial, e um modelo de edição como o PicassoIA Image Editor Pro permite ajustar essa imagem até chegar à final, para que o sujeito e a iluminação continuem próximos.
Alinhe a sensação da lente, a direção da luz e a escala do sujeito. Se o primeiro quadro é o nascer do sol e o último é o pôr do sol, o H3 tem que inventar um dia inteiro em 15 segundos. Ele consegue, mas o resultado parece um time-lapse. Escolha pontos finais que a ação possa realisticamente alcançar dentro da duração do clipe.
LoRA: velocidade e identidade
As afirmações sobre LoRA em torno do H3 se confundem rapidamente. Na verdade, há duas coisas separadas: um LoRA de velocidade, que muda quantos passos você precisa, e um LoRA de identidade que você treina com as suas próprias imagens.

O LoRA Turbo para velocidade
O MiniMax-H3-Turbo-LoRA da comunidade (Apache 2.0, cerca de 744 MB em bf16) reduz os passos de amostragem de cerca de 20 para apenas 4.
| Configuração | Valor |
|---|
| Passos | 4 a 8, com 6 a 8 preferidos |
| Força do LoRA | 1.0 |
| Agendador | simple |
| Aceleração | Cerca de 5x na amostragem |
| Arquivo recomendado | minimax_h3_turbo_v4_step600_ema.safetensors |
O efeito prático está no seu ciclo de iteração. Suponha que um clipe de teste em 480p leve cerca de 6 minutos com 20 passos em uma placa de 12 a 16 GB. Uma aceleração de 5x na amostragem levaria a algo perto de um minuto e meio por teste. Isso é uma conta de guardanapo, não uma medição, e a decodificação ainda leva tempo, mas explica por que as pessoas usam o Turbo para rascunhos e a configuração completa de 20 passos para a renderização final.
Instale o nó personalizado ComfyUI-MiniMax-H3-Turbo, coloque o arquivo .safetensors na sua pasta de LoRAs e insira o nó do LoRA Turbo entre o carregador do modelo e o amostrador de um fluxo de trabalho existente.
💡 Limite conhecido: com 4 passos e movimento intenso, a v4 pode mostrar borrões e fantasmas, e o comportamento do áudio durante ações intensas ainda está sendo melhorado. Use 4 passos para planos estáticos ou de pouco movimento e 6 a 8 para ação.
Treinando um LoRA de personagem
Um criador treinou um LoRA de personagem em uma RTX 4070 de 12 GB com o ai-toolkit, usando um modelo quantizado e descarregamento para a CPU. Os números que ele relatou:
| Configuração | Valor |
|---|
| Conjunto de dados | 31 a 32 imagens em 512×512 |
| Rank do LoRA | 16 |
| Passos | 1000, tamanho de lote 1 |
| VRAM durante o treino | Cerca de 11,7 de 12 GB |
| RAM do sistema | Cerca de 32 a 37 GB |
| Tempo | Aproximadamente 6 a 7 horas |
| Configuração obrigatória | num_frames: 1 e auto_frame_count: false |
Dois detalhes decidem se isso funciona. Primeiro, com auto_frame_count ativado, um conjunto de imagens fixas é tratado como vídeo, e o treino informa que nenhuma imagem foi encontrada. Segundo, planos de corpo inteiro misturados deram resultados ruins. O criador passou para um conjunto focado no rosto, em que o rosto ocupa a maior parte do quadro, com uma legenda simples formada por uma palavra-gatilho mais um rótulo curto do sujeito. O LoRA finalizado carrega pelo nó LoraLoaderModelOnly.

💡 Pule o LoRA do H3 quando uma imagem fixa bastar. Se tudo o que você precisa é de um personagem consistente como primeiro quadro ou imagem de referência, treine um LoRA do lado da imagem. O P Image Trainer no PicassoIA cria um LoRA para o modelo p-image a partir de um zip com pelo menos 10 imagens, com 1000 passos como padrão.
Os LoRAs de vídeo são outra história. O mesmo criador observou que treinar com clipes de vídeo provavelmente está fora de alcance com 12 GB, e benchmarks da comunidade apontam para 20 GB ou mais para treino de vídeo na prática. Para a maioria das configurações, a divisão sensata é simples: um LoRA de identidade ou imagens de referência para o personagem, e o LoRA Turbo quando o tempo de renderização é o gargalo.
Clipes mais longos e correções comuns
Encadeie clipes com contexto de movimento
Quinze segundos é o teto de uma única passagem. O ComfyUI MiniMax H3 Extender encadeia vários clipes mantendo a continuidade. Quando você aprova um clipe, seu latente é guardado em cache no disco e se torna o contexto de movimento para o próximo, então o novo plano continua a partir dos últimos quadros do clipe anterior.
- Prompts, seeds e durações por clipe
- Modos de seed: Randomize, Fixed, Increment, Decrement
- Os mesmos limites de referência: 9 imagens, 3 vídeos, 3 faixas de áudio
- Exportação em H.264, H.265/HEVC ou FFV1
Instale pelo ComfyUI Manager ou clonando-o em ComfyUI/custom_nodes. Planeje a sequência inteira no papel antes: uma linha por clipe, com as referências compartilhadas do personagem listadas uma única vez, para que cada segmento herde a mesma identidade em vez de se afastar de um clipe para o outro.

Correções para erros frequentes
| Sintoma | Causa provável | Correção |
|---|
| Uma execução em 256p falha por completo | Abaixo do tamanho mínimo | Use 384p ou mais, em múltiplos de 32 |
| O vídeo renderiza sem som | Decodificação de áudio ausente | Adicione VAEDecodeAudio e carregue o VAE de áudio |
| Detalhes suaves e borrados | Passos insuficientes | Use 20 passos e evite ir abaixo de cerca de 15 |
| Fantasmas em movimento rápido com o Turbo | Configuração de 4 passos | Suba para 6 a 8 passos |
| O treino de LoRA não encontra imagens | auto_frame_count está ativado | Defina-o como false e num_frames como 1 |
| Renderizações lentas em uma placa capaz | Atenção padrão | Inicie com --use-sage-attention |
Teste no PicassoIA
O MiniMax H3 não está no catálogo do PicassoIA até o momento em que este artigo foi escrito, mas os mesmos trabalhos que ele faz no ComfyUI têm equivalentes próximos que você pode rodar no navegador, sem download de 40 GB e sem orçamento de VRAM para gerenciar.
| Se você precisa de | Experimente este modelo |
|---|
| Imagens ou clipes de referência que mantenham um sujeito consistente | Wan 2.7 R2V, que gera em 720p ou 1080p |
| Uma única foto transformada em movimento | Wan 2.7 I2V |
| A família de vídeo da própria MiniMax | Hailuo 2.3 para texto para vídeo cinematográfico |
| Iterações rápidas enquanto testa prompts | LTX 2.5 Fast |
| Clipes gratuitos e ilimitados | Seedance 2.5 Lite ou PicassoIA Video |
Um ciclo prático funciona bem: crie suas imagens finais e as referências de personagem no PicassoIA, faça alguns testes baratos ali para definir a linguagem de cena e de câmera, e então leve o prompt vencedor para o seu grafo local do H3 para a renderização final com áudio nativo. Escolha uma imagem do seu último teste no ComfyUI, coloque-a no Wan 2.7 I2V e compare o movimento com o seu clipe do H3. A forma mais rápida de descobrir o que seus prompts conseguem fazer é criar algo hoje, então abra o PicassoIA e crie suas primeiras imagens e vídeos.