Fluxo de trabalho do MiniMax H3 no ComfyUI: prompts, LoRA e configuração local

O MiniMax H3 produz até 15 segundos de vídeo a 24 fps com áudio estéreo nativo, e roda localmente no ComfyUI. Veja os arquivos do modelo e o espaço em disco que você precisa, as faixas de VRAM por GPU, como escrever prompts com planos cronometrados e diálogos, como funcionam os LoRAs Turbo e de personagem, e como encadear clipes mais longos.

Fluxo de trabalho do MiniMax H3 no ComfyUI: prompts, LoRA e configuração local
Cristian Da Conceicao
Fundador do Picasso IA

A maioria dos modelos de vídeo fica atrás de um login e de um medidor de créditos. O MiniMax H3 não precisa disso. Seus pesos abertos rodam dentro do ComfyUI na sua própria placa de vídeo, e uma única passagem devolve até 15 segundos de vídeo a 24 fps com uma trilha estéreo já mixada: diálogo, efeitos sonoros e música juntos. Parece pronto para usar, e na maior parte das vezes é, desde que você escolha os arquivos certos do modelo, escreva os prompts do jeito que o H3 espera e saiba onde um LoRA realmente ajuda. Este artigo segue o fluxo de trabalho do MiniMax H3 no ComfyUI na ordem em que você vai encontrar cada problema: hardware, arquivos, os três modos de geração, prompts, velocidade, LoRAs de personagem e clipes mais longos.

O que o MiniMax H3 realmente faz

O H3 é um modelo de vídeo omnimodal. Em vez de renderizar quadros mudos e pedir a uma segunda ferramenta que adicione o som, ele sintetiza imagem, voz, efeitos e música na mesma passagem. O ComfyUI adicionou suporte nativo na versão 0.30.0, então os modelos básicos não precisam de nenhum nó personalizado.

Três modos em um só modelo

  • Texto para vídeo (T2V): apenas um prompt. Descreva a cena e o modelo devolve um clipe com áudio.
  • Imagem para vídeo (I2V): uma imagem fixa, mais entradas opcionais de primeiro e último quadro. O modelo preenche o movimento entre os dois quadros.
  • Referência para vídeo (R2V): um prompt mais até 9 imagens de referência, 3 vídeos de referência e 3 clipes de áudio. Você decide qual referência controla identidade, estilo, movimento, câmera ou voz.

Os pesos seguem a mesma divisão. T2V e I2V usam os checkpoints FL2VA, enquanto R2V usa os checkpoints Ref2VA, então planeje um download separado se quiser os três modos.

Os números que importam

EspecificaçãoValor
Duração do clipeAté 15 segundos
Taxa de quadros24 fps
ÁudioEstéreo nativo a 32 kHz
Idiomas de fala11: árabe, chinês, inglês, francês, alemão, italiano, japonês, coreano, português, russo, espanhol
Resolução principalAté 2K
Predefinições do template960×544, 1152×640, 1216×672
Tamanho mínimo utilizável384p (256p falha)
Regra de tamanhoLargura e altura em múltiplos de 32

💡 Leia com atenção a linha de resolução. "Até 2K" é o teto. Um relato da comunidade descreve uma tela nativa de cerca de 768 px no lado menor, então trate as predefinições acima como seu ponto de partida realista e teste tamanhos maiores na sua própria placa.

Hardware e a realidade do disco

Antes de baixar qualquer coisa, verifique o que sua máquina aguenta. O H3 é um modelo grande, e a diferença entre "roda" e "roda bem" é enorme.

Placa de vídeo com três ventoinhas pretas instalada em um gabinete de PC aberto

VRAM por classe de placa

Os números abaixo vêm de um benchmark da comunidade, não de uma especificação oficial, então espere variação conforme drivers, resolução e quantização.

Classe da placaO que esperar
6 GB (classe RTX 2060)Roda, mas com detalhes borrados, áudio mais grosseiro e cerca de 10 a 15 minutos por clipe
12 a 16 GB (classe RTX 4060)Cerca de 6 minutos para um clipe de 5 segundos em 480p, mais limpo que a faixa de 6 GB
24 GB (classe RTX 4090)Resolução maior com menos concessões, e espaço suficiente para treinar LoRAs
32 GB ou mais (RTX 5090, RTX 6000)A faixa recomendada, com clipes mais longos de 15 segundos em resolução maior
Apple SiliconUma versão NF4 de 4 bits roda a partir de apenas 8 GB, com queda visível de qualidade em cenas carregadas

Arquivos do modelo e espaço em disco

Cada componente vem em três precisões, e a escolha é uma contrapartida entre qualidade e memória. Os arquivos de difusão INT8 podados e o codificador de texto nvfp4 são os que as notas do modelo recomendam, porque deixam mais espaço para o próprio vídeo. Suba para INT8 ou BF16 apenas se você tiver VRAM sobrando e conseguir ver diferença nos seus próprios testes lado a lado.

ArquivoTamanhoFunção
FL2VA INT8 podado ConvRot19,5 GBRecomendado para T2V e I2V
FL2VA INT8 ConvRot31,7 GBOpção INT8 maior
FL2VA BF1661,7 GBPrecisão total
Ref2VA INT8 podado ConvRot19,5 GBRecomendado para R2V
Qwen3-VL, codificador nvfp4 AWQ14,6 GBCodificador recomendado
Qwen3-VL INT8 ConvRot25,3 GBOpção de codificador maior
Qwen3-VL BF1648,0 GBCodificador de precisão total
Video VAE FP164,9 GBObrigatório
Audio VAE FP320,6 GBObrigatório

A configuração enxuta de T2V e I2V (modelo de difusão INT8 podado, codificador de texto nvfp4 e os dois VAEs) soma cerca de 39,6 GB. Acrescente mais 19,5 GB se quiser R2V. Mantenha tudo em um drive NVMe, porque carregar 40 GB de um disco mecânico é doloroso.

Drive NVMe fino sobre uma mesa de nogueira ao lado de um notebook e uma xícara de café

Configuração local no ComfyUI

Atualize e abra o modelo

  1. Atualize o ComfyUI para a versão 0.30.0 ou posterior.
  2. Abra Workflow, Browse Templates, Video e escolha um modelo do MiniMax H3.
  3. Coloque os arquivos baixados em models/diffusion_models/, models/text_encoders/ e models/vae/.
  4. Reinicie o ComfyUI para que os carregadores vejam os novos arquivos.

Faça primeiro um teste curto de T2V em baixa resolução. Um bom primeiro teste é um clipe em 384p com uma única frase de diálogo e um efeito sonoro óbvio, como uma porta batendo. Se a imagem aparecer, mas o áudio ficar mudo, o culpado provável é o caminho de decodificação de áudio, e não o seu prompt. Se os dois funcionarem, você tem uma base segura para mudar uma configuração de cada vez.

A saída de áudio depende do nó VAEDecodeAudio, que os templates já incluem. O nó de imagem para vídeo é o MiniMaxH3ImageToVideo, e ele expõe as entradas first_frame e last_frame.

Configurações de amostragem que se sustentam

A base das notas da comunidade é o amostrador res_multistep com o agendador simple em 20 passos. A qualidade cai visivelmente abaixo de cerca de 15 passos. Se sua placa suportar, inicie o ComfyUI com --use-sage-attention para uma geração de até cerca de 2x mais rápida. Para testes, reduza para 384p e duração curta, e aumente o tamanho quando o movimento e o áudio estiverem certos.

Uma alternativa em um único grafo

ComfyUI-MiniMaxH3-Easy é um nó personalizado da comunidade que reúne T2V, I2V, primeiro e último quadro, e R2V em um fluxo de trabalho compacto. Instale clonando o repositório em ComfyUI/custom_nodes ou pesquisando o nome dele no ComfyUI Manager. A geração não precisa de credenciais de API. Contas da OpenAI, do Gemini ou do Ollama são usadas apenas pelo otimizador de prompt opcional, e os amostradores, LoRAs e patches de atenção continuam sendo conexões comuns do ComfyUI. Ele também oferece um modo de humano digital guiado por uma única faixa de áudio, útil para clipes de apresentador.

Escrevendo prompts para o H3 como um diretor

Mão prendendo uma ficha em um quadro de cortiça cheio de cartões de plano

Primeiro a cena, depois os planos

O H3 responde melhor a um prompt que descreve primeiro a cena geral (local, personagem, o que está acontecendo) e depois divide o clipe em planos cronometrados. Inclua movimentos de câmera e o áudio que você quer, e não apenas a imagem.

Prompt de exemplo: Um mercado noturno chuvoso em Osaka, um vendedor de rua com uma capa de chuva amarela servindo caldo em uma tigela de papel. 0 a 4 s: aproximação lenta sobre o vapor que sobe da panela, chuva batendo em uma lona. 4 a 9 s: plano médio enquanto o vendedor entrega a tigela a um cliente e sorri. 9 a 15 s: acompanhamento com câmera na mão enquanto o cliente caminha para a multidão. Áudio: chuva, óleo chiando, conversas distantes, música suave de shamisen.

Compare isso com um prompt pobre como "um homem cozinha macarrão na chuva." O H3 ainda devolverá algo assistível, mas a câmera, o ritmo e a trilha sonora serão palpites. Detalhar as batidas dá ao modelo uma linha do tempo para seguir, e dá a você algo concreto para editar quando um plano falhar. Mude uma única batida por teste para saber qual edição causou qual resultado.

Uma lista curta de verificação mantém os prompts consistentes:

  • Cena: onde, quando e quem.
  • Planos: uma linha por batida, com segundos.
  • Câmera: aproximação, acompanhamento com câmera na mão, órbita ou câmera travada.
  • Áudio: diálogo, efeitos e música, cada um nomeado separadamente.

Microfone de condensador e fones de estúdio em uma sala de locução

Diálogo e som no prompt

Como o áudio é gerado junto com a imagem, nomeie-o. Diga quem fala e o que diz, e depois liste efeitos e música em uma linha própria para que não se misturem com a descrição da imagem. Com 11 idiomas suportados, você pode escrever o diálogo no idioma em que o personagem deve falar. No nó Easy, digitar # abre um bloco de diálogo que é convertido, na execução, nas tags <d>...</d> que o H3 espera.

Tags de referência para R2V

No modo de referência, cite cada entrada pela tag, na ordem exata em que você a conectou: <Picture 1>, <Video 1>, <Audio 1>. Depois, diga qual referência controla cada parte do plano:

Use <Picture 1> para o rosto e a roupa do personagem, <Video 1> para o movimento de câmera e <Audio 1> para a voz.

No nó Easy, @Image1, @Video1 e @Audio1 são convertidos nessas tags para você.

Folha de contato com retratos de um homem visto de vários ângulos

Controle de primeiro e último quadro

Duas imagens fixas costumam orientar um clipe melhor do que mais cem palavras de prompt. No modo I2V, first_frame e last_frame são ambos opcionais, e o modelo gera o movimento entre eles.

Duas fotografias impressas da mesma estrada ao nascer e ao pôr do sol

Crie e alinhe os quadros inicial e final

Crie os dois quadros antes de abrir o ComfyUI. O PicassoIA Image ou o Seedream 5 Pro podem gerar a imagem inicial, e um modelo de edição como o PicassoIA Image Editor Pro permite ajustar essa imagem até chegar à final, para que o sujeito e a iluminação continuem próximos.

Alinhe a sensação da lente, a direção da luz e a escala do sujeito. Se o primeiro quadro é o nascer do sol e o último é o pôr do sol, o H3 tem que inventar um dia inteiro em 15 segundos. Ele consegue, mas o resultado parece um time-lapse. Escolha pontos finais que a ação possa realisticamente alcançar dentro da duração do clipe.

LoRA: velocidade e identidade

As afirmações sobre LoRA em torno do H3 se confundem rapidamente. Na verdade, há duas coisas separadas: um LoRA de velocidade, que muda quantos passos você precisa, e um LoRA de identidade que você treina com as suas próprias imagens.

Cronômetro de latão sobre uma mesa de nogueira ao lado de um monitor

O LoRA Turbo para velocidade

O MiniMax-H3-Turbo-LoRA da comunidade (Apache 2.0, cerca de 744 MB em bf16) reduz os passos de amostragem de cerca de 20 para apenas 4.

ConfiguraçãoValor
Passos4 a 8, com 6 a 8 preferidos
Força do LoRA1.0
Agendadorsimple
AceleraçãoCerca de 5x na amostragem
Arquivo recomendadominimax_h3_turbo_v4_step600_ema.safetensors

O efeito prático está no seu ciclo de iteração. Suponha que um clipe de teste em 480p leve cerca de 6 minutos com 20 passos em uma placa de 12 a 16 GB. Uma aceleração de 5x na amostragem levaria a algo perto de um minuto e meio por teste. Isso é uma conta de guardanapo, não uma medição, e a decodificação ainda leva tempo, mas explica por que as pessoas usam o Turbo para rascunhos e a configuração completa de 20 passos para a renderização final.

Instale o nó personalizado ComfyUI-MiniMax-H3-Turbo, coloque o arquivo .safetensors na sua pasta de LoRAs e insira o nó do LoRA Turbo entre o carregador do modelo e o amostrador de um fluxo de trabalho existente.

💡 Limite conhecido: com 4 passos e movimento intenso, a v4 pode mostrar borrões e fantasmas, e o comportamento do áudio durante ações intensas ainda está sendo melhorado. Use 4 passos para planos estáticos ou de pouco movimento e 6 a 8 para ação.

Treinando um LoRA de personagem

Um criador treinou um LoRA de personagem em uma RTX 4070 de 12 GB com o ai-toolkit, usando um modelo quantizado e descarregamento para a CPU. Os números que ele relatou:

ConfiguraçãoValor
Conjunto de dados31 a 32 imagens em 512×512
Rank do LoRA16
Passos1000, tamanho de lote 1
VRAM durante o treinoCerca de 11,7 de 12 GB
RAM do sistemaCerca de 32 a 37 GB
TempoAproximadamente 6 a 7 horas
Configuração obrigatórianum_frames: 1 e auto_frame_count: false

Dois detalhes decidem se isso funciona. Primeiro, com auto_frame_count ativado, um conjunto de imagens fixas é tratado como vídeo, e o treino informa que nenhuma imagem foi encontrada. Segundo, planos de corpo inteiro misturados deram resultados ruins. O criador passou para um conjunto focado no rosto, em que o rosto ocupa a maior parte do quadro, com uma legenda simples formada por uma palavra-gatilho mais um rótulo curto do sujeito. O LoRA finalizado carrega pelo nó LoraLoaderModelOnly.

Grade de trinta e duas impressões de retratos presas em uma parede branca

💡 Pule o LoRA do H3 quando uma imagem fixa bastar. Se tudo o que você precisa é de um personagem consistente como primeiro quadro ou imagem de referência, treine um LoRA do lado da imagem. O P Image Trainer no PicassoIA cria um LoRA para o modelo p-image a partir de um zip com pelo menos 10 imagens, com 1000 passos como padrão.

Os LoRAs de vídeo são outra história. O mesmo criador observou que treinar com clipes de vídeo provavelmente está fora de alcance com 12 GB, e benchmarks da comunidade apontam para 20 GB ou mais para treino de vídeo na prática. Para a maioria das configurações, a divisão sensata é simples: um LoRA de identidade ou imagens de referência para o personagem, e o LoRA Turbo quando o tempo de renderização é o gargalo.

Clipes mais longos e correções comuns

Encadeie clipes com contexto de movimento

Quinze segundos é o teto de uma única passagem. O ComfyUI MiniMax H3 Extender encadeia vários clipes mantendo a continuidade. Quando você aprova um clipe, seu latente é guardado em cache no disco e se torna o contexto de movimento para o próximo, então o novo plano continua a partir dos últimos quadros do clipe anterior.

  • Prompts, seeds e durações por clipe
  • Modos de seed: Randomize, Fixed, Increment, Decrement
  • Os mesmos limites de referência: 9 imagens, 3 vídeos, 3 faixas de áudio
  • Exportação em H.264, H.265/HEVC ou FFV1

Instale pelo ComfyUI Manager ou clonando-o em ComfyUI/custom_nodes. Planeje a sequência inteira no papel antes: uma linha por clipe, com as referências compartilhadas do personagem listadas uma única vez, para que cada segmento herde a mesma identidade em vez de se afastar de um clipe para o outro.

Mãos com luvas brancas alinhando tiras de filme de 35 mm sobre uma mesa de luz

Correções para erros frequentes

SintomaCausa provávelCorreção
Uma execução em 256p falha por completoAbaixo do tamanho mínimoUse 384p ou mais, em múltiplos de 32
O vídeo renderiza sem somDecodificação de áudio ausenteAdicione VAEDecodeAudio e carregue o VAE de áudio
Detalhes suaves e borradosPassos insuficientesUse 20 passos e evite ir abaixo de cerca de 15
Fantasmas em movimento rápido com o TurboConfiguração de 4 passosSuba para 6 a 8 passos
O treino de LoRA não encontra imagensauto_frame_count está ativadoDefina-o como false e num_frames como 1
Renderizações lentas em uma placa capazAtenção padrãoInicie com --use-sage-attention

Teste no PicassoIA

O MiniMax H3 não está no catálogo do PicassoIA até o momento em que este artigo foi escrito, mas os mesmos trabalhos que ele faz no ComfyUI têm equivalentes próximos que você pode rodar no navegador, sem download de 40 GB e sem orçamento de VRAM para gerenciar.

Se você precisa deExperimente este modelo
Imagens ou clipes de referência que mantenham um sujeito consistenteWan 2.7 R2V, que gera em 720p ou 1080p
Uma única foto transformada em movimentoWan 2.7 I2V
A família de vídeo da própria MiniMaxHailuo 2.3 para texto para vídeo cinematográfico
Iterações rápidas enquanto testa promptsLTX 2.5 Fast
Clipes gratuitos e ilimitadosSeedance 2.5 Lite ou PicassoIA Video

Um ciclo prático funciona bem: crie suas imagens finais e as referências de personagem no PicassoIA, faça alguns testes baratos ali para definir a linguagem de cena e de câmera, e então leve o prompt vencedor para o seu grafo local do H3 para a renderização final com áudio nativo. Escolha uma imagem do seu último teste no ComfyUI, coloque-a no Wan 2.7 I2V e compare o movimento com o seu clipe do H3. A forma mais rápida de descobrir o que seus prompts conseguem fazer é criar algo hoje, então abra o PicassoIA e crie suas primeiras imagens e vídeos.

Compartilhe este artigo

Escolha seu idioma