Como o Nano Banana Pro lida com texto em imagens

Gerar texto legível dentro de imagens de IA sempre foi pouco confiável. O Nano Banana Pro muda isso com atenção espacial em nível de caractere, alinhamento de tokens e posicionamento espacial do texto, produzindo tipografia legível em cenas fotorrealistas.

Como o Nano Banana Pro lida com texto em imagens
Cristian Da Conceicao
Fundador do Picasso IA

Acertar o texto dentro de uma imagem gerada por IA é um daqueles problemas que parecem simples e acabam sendo realmente difíceis. A maioria dos modelos de imagem borra letras, mistura caracteres ou produz sequências de falsas palavras que parecem convincentes, mas se desmancham a qualquer olhar mais atento. O Nano Banana Pro, do Google, muda isso de um jeito ao mesmo tempo prático e surpreendentemente consistente. Este artigo explica em detalhes como ele lida com texto, por que funciona quando outros modelos falham e o que você pode de fato fazer com ele no PicassoIA.

Por que o texto quebra na maioria das imagens de IA

Peça a quase qualquer modelo de imagem para renderizar uma placa, um rótulo ou um banner com palavras específicas, e o resultado costuma ser uma variação do mesmo problema: letras que parecem quase certas, mas não estão. O modelo captura a forma visual do texto sem realmente saber o que é texto.

Close-up de mãos segurando uma placa impressa com letras pretas nítidas sobre cartolina branca

O problema central dos modelos de difusão

Os modelos de difusão padrão tratam cada pixel como parte de uma distribuição visual contínua. Eles absorveram bilhões de imagens e aprenderam estatisticamente como o texto se parece. Isso é algo fundamentalmente diferente de saber como posicionar caracteres específicos em posições específicas. Quando você pede um outdoor que diga "OPEN 24 HOURS", o modelo gera algo que lembra visualmente essa frase, mas a precisão no nível do caractere quase sempre está errada.

Os modos de falha são consistentes na maioria dos sistemas de texto para imagem:

  • Mistura de caracteres: Duas letras se fundem em um único glifo ambíguo
  • Substituição de letras: O modelo troca caracteres parecidos (0 por O, l por 1)
  • Erros de espaçamento: Kerning e tracking são inconsistentes ao longo da palavra
  • Colapso de limites de palavras: Várias palavras se juntam sem separação clara
  • Caracteres fantasma: Aparecem letras extras que não estavam no prompt

Esses problemas não são bugs de um modelo específico. Eles refletem como os modelos de difusão codificam e decodificam informação visual em um nível fundamental. O problema de renderização de texto é estrutural, não incidental.

Como são as "letras alucinadas" na prática

O termo "letras alucinadas" se refere a caracteres que o modelo inventa com base em plausibilidade visual, e não em fidelidade ao prompt. Um modelo pode gerar um rótulo de produto que parece perfeitamente correto em tamanho miniatura e se desfaz por completo em resolução total. As letras lembram um idioma específico sem formar palavras reais.

Vista aérea flat-lay de um espaço de trabalho criativo com uma fotografia impressa mostrando tipografia em negrito

Isso é especialmente incômodo em casos de uso comercial. Um mockup para uma campanha de marca, uma foto de produto com preço ou um criativo para redes sociais com um título específico ficam inutilizáveis no momento em que o texto não é legível. Por anos, a solução alternativa padrão era gerar a imagem sem texto e adicionar a tipografia depois, no Photoshop ou no Canva. O Nano Banana Pro torna essa solução opcional em uma ampla variedade de casos de uso.

O que o Nano Banana Pro faz de diferente

A diferença de arquitetura entre o Nano Banana Pro e as abordagens anteriores de texto para imagem está em como ele trata a relação entre os tokens do prompt de texto e as regiões espaciais da imagem final.

Atenção espacial em nível de caractere

Enquanto os modelos de difusão convencionais processam os prompts de texto como sinais semânticos que influenciam a distribuição geral da imagem, o Nano Banana Pro aplica um mecanismo de atenção mais refinado especificamente para o posicionamento de caracteres. Quando o prompt especifica o conteúdo do texto, o modelo não apenas "sabe" que um texto deve aparecer em algum ponto da imagem. Ele destina atenção espacial dedicada a sequências específicas de caracteres e às suas posições dentro da cena renderizada.

É isso que permite ao modelo renderizar palavras como "SALE" ou "OPEN" em uma placa de loja com o número correto de caracteres, espaçados de forma adequada, em um estilo de fonte que combina com a estética da cena. O modelo não adivinha que formas parecidas com texto devem aparecer. Ele coloca glifos específicos em locais específicos.

💡 Quanto mais específico for seu prompt sobre o posicionamento do texto, melhor será o resultado. Em vez de "uma placa que diz HELLO", experimente "uma placa retangular de madeira presa a uma parede de tijolos, com a palavra HELLO em letras de bloco brancas pintadas, centralizada".

Alinhamento de tokens ou adivinhação visual

Modelos anteriores como o SDXL tentavam renderizar texto apenas por correspondência de padrões visuais. O modelo tinha visto texto suficiente nos dados de treino para gerar algo que parecia texto, mas a conexão entre uma sequência específica no prompt e uma sequência específica de glifos na saída era, na melhor das hipóteses, probabilística.

O Nano Banana Pro usa alinhamento em nível de token, o que significa que o modelo mantém uma correspondência direta entre cada caractere do texto solicitado e uma região visual na saída. É por isso que sequências curtas e específicas de texto são renderizadas com muito mais confiabilidade do que parágrafos longos, e por que formulações de prompt que especificam claramente a sequência exata a renderizar produzem resultados melhores do que referências vagas a "algum texto".

Mulher em um café ensolarado segurando um cartão impresso com texto grande e nítido voltado para a câmera

O resultado prático: se você pedir três palavras, vai receber três palavras. Não duas fundidas em uma e um caractere fantasma extra pairando na borda da placa.

Como o contexto da cena afeta a renderização de texto

Um aspecto pouco valorizado do tratamento de texto do Nano Banana Pro é o quanto o contexto da cena ao redor influencia a saída tipográfica. O modelo ajusta estilo de fonte, peso e contraste de cor para combinar com a estética do ambiente que está gerando. Uma placa de madeira feita à mão recebe um tratamento de letras pintadas um pouco mais rústico. Uma fachada moderna recebe uma sans-serif limpa. Um rótulo vintage recebe letras serifadas com desgaste apropriado.

Essa adaptação ao contexto significa que o texto renderizado pelo Nano Banana Pro não parece ter sido colado na cena depois. Ele parece integrado, porque o modelo o posiciona como parte da cena desde o início.

Onde ele realmente se destaca

Entender onde o Nano Banana Pro tem o melhor desempenho ajuda você a planejar seus prompts e a ter expectativas precisas.

Placas, rótulos e banners

Este é o caso de uso principal e aquele em que o modelo é mais confiável. Texto físico em uma cena, como a placa de uma loja, um aviso de trânsito, um quadro de cardápio ou um cartaz de protesto, é renderizado com alta fidelidade quando o texto solicitado é curto e posicionado de forma natural no contexto da cena.

Tamanho do textoConfiabilidadeObservações
1-4 caracteresMuito altaQuase perfeito na maioria dos casos
5-8 caracteresAltaVariação ocasional de kerning
9-15 caracteresModeradaQuebras de palavra ajudam bastante
16+ caracteresVariávelMelhor dividir entre vários elementos visuais

O modelo lida melhor com letras latinas maiúsculas, depois com caixa mista, em seguida com números e por último com caracteres especiais. Números isolados (uma etiqueta de preço com "12", uma porta com o número "4B") são renderizados com grande precisão.

Embalagens de produto e mockups

Mockups de marca estão entre as aplicações comerciais de maior valor para essa capacidade. Uma foto de produto mostrando uma garrafa com um nome de marca, uma caixa com o título do produto ou uma sacola com texto de logotipo tornam-se possíveis sem trabalho de texto na pós-produção.

Página dupla de um portfólio de fotografia mostrando tipografia serifada precisa nas duas páginas

O Nano Banana Pro lida com texto curvo em rótulos de produtos com precisão razoável, algo particularmente difícil para outros modelos. O modelo ajusta o posicionamento das letras para acompanhar a curvatura da superfície em que estão, produzindo resultados que parecem embalagens impressas de verdade, e não uma sobreposição plana.

Criativos para redes sociais e anúncios

Para conteúdo social que exige um título curto, um destaque de preço ou uma frase de CTA incorporada diretamente na imagem, o Nano Banana Pro elimina a necessidade de uma camada de design sobre a saída gerada. Um banner promocional com "50% OFF" renderizado diretamente na cena é possível em uma única etapa de geração.

💡 Para criativos de redes sociais, especifique o estilo da fonte no prompt. "Sans-serif condensada em negrito, branca, com uma leve sombra" produzirá resultados mais consistentes do que deixar o estilo da fonte sem definição.

Como usar o Nano Banana Pro no PicassoIA

O Nano Banana Pro está disponível diretamente no PicassoIA. A configuração é simples e não exige nenhuma configuração técnica especial.

Configurando seu primeiro prompt de texto

Acesse a página do modelo Nano Banana Pro no PicassoIA. O campo de prompt aceita linguagem natural comum, sem nenhuma sintaxe especial necessária para a renderização de texto. A estrutura de prompt mais eficaz segue este padrão:

  1. Descrição da cena primeiro: Descreva a imagem como um todo antes de mencionar o texto
  2. Elemento de texto em segundo: Especifique em que superfície o texto aparece
  3. Conteúdo do texto em terceiro: Coloque o texto exato entre aspas dentro do seu prompt
  4. Detalhes de estilo por último: Peso da fonte, cor, tamanho em relação à cena

Exemplo de prompt:

"Uma porta de madeira desgastada na fachada de um prédio de tijolos, uma placa pintada à mão afixada na altura dos olhos com a palavra "CLOSED", tinta branca desgastada sobre madeira escura, luz solar do meio-dia vinda de cima, fotorrealista"

Mulher em frente a um grande cartaz de galeria com texto branco sobreposto em negrito

Parâmetros que afetam a qualidade do texto

Ao usar o Nano Banana Pro no PicassoIA, estas configurações têm impacto direto na qualidade da renderização de texto:

  • Steps: Contagens mais altas de steps (30-50) produzem letras mais nítidas. Gerações rápidas com menos steps tendem a borrar as bordas do texto e os limites dos caracteres.
  • CFG Scale: Uma guidance scale (CFG) mais alta (7-10) aumenta a aderência ao prompt, o que ajuda o modelo a se manter fiel ao conteúdo de texto específico que você indicou. Valores abaixo de 5 costumam se afastar da sequência de texto solicitada.
  • Seed: Se você encontrar uma geração em que o texto está quase correto, anote a seed e gere novamente com pequenos ajustes no prompt. Os padrões de atenção espacial dependem parcialmente da seed, então uma seed quase correta é um ótimo ponto de partida.

Dicas para resultados mais limpos

Estas observações práticas fazem a maior diferença no uso do dia a dia:

  • Use letras maiúsculas para palavras únicas. O modelo renderiza maiúsculas com mais fidelidade do que caixa mista em palavras curtas.
  • Coloque o texto em superfícies de alto contraste. Texto branco em fundos escuros e texto escuro em superfícies claras são renderizados com nitidez. Evite fundos de tom médio, onde as letras podem se misturar.
  • Evite pedir itálico, a menos que o estilo geral da imagem exija isso. Caracteres inclinados são mais difíceis para o modelo renderizar com bordas limpas.
  • Para números, mantenha as sequências numéricas bem curtas (1-3 dígitos) ou escreva-as por extenso sempre que possível.
  • Peça que o texto esteja fisicamente incorporado à cena, e não flutuando. "Texto pintado na parede" é renderizado melhor do que um pedido abstrato de "texto aparecendo na imagem".

Duas mulheres em uma bancada de coworking olhando para um tablet que mostra uma imagem gerada por IA com texto legível

Precisão do texto em diferentes estilos de prompt

Nem todos os pedidos de texto são iguais. O tipo de texto, seu comprimento e a forma como ele é descrito no prompt afetam a qualidade da saída do Nano Banana Pro.

Palavras curtas ou frases longas

A atenção espacial em nível de token do modelo funciona melhor quando ele tem um número limitado de caracteres para posicionar. Palavras únicas e frases de duas palavras produzem os resultados mais confiáveis. Acima desse ponto, o modelo passa a introduzir mais variação no espaçamento dos caracteres e ocasionalmente omite ou funde letras.

Para necessidades de texto mais longas, a melhor abordagem é dividir o conteúdo em vários elementos de texto mais curtos dentro da mesma cena. Uma loja com três placas separadas, cada uma com duas ou três palavras, será renderizada com mais precisão do que uma única placa tentando carregar nove palavras de uma vez.

💡 Pense no texto da sua cena como um cenógrafo pensaria: vários elementos de texto menores posicionados naturalmente no contexto, e não um grande bloco de texto.

Tipografia serifada ou sans-serif

Fontes sans-serif são renderizadas com maior precisão em todos os comprimentos de caractere. As formas geométricas limpas das letras sans-serif se alinham mais de perto com os dados de treino de alta frequência do modelo. Fontes serifadas são possíveis, especialmente para títulos e rótulos curtos, mas introduzem mais variabilidade na renderização das serifas em tamanhos visuais menores dentro da cena.

Mulher em uma cozinha iluminada segurando um rótulo de produto com texto impresso nítido

Estilos de script e manuscritos estão entre os de menor precisão para conteúdo de texto específico. Eles podem ficar bonitos e adequados ao estilo, mas o modelo trata o script mais como um estilo visual do que como uma tarefa de renderização precisa de caracteres. Se a legibilidade exata importa, prefira sans-serif ou serifas simples.

Combinando com outros modelos do PicassoIA

O Nano Banana Pro não precisa trabalhar sozinho. A coleção de modelos do PicassoIA oferece várias opções para refinar e ampliar a saída.

Editando e corrigindo texto com inpainting

Quando uma geração quase acerta o texto, mas um caractere está errado, o inpainting é a correção mais eficiente. Os recursos de edição de imagem do PicassoIA permitem mascarar a região específica do texto e regenerar apenas essa parte com um prompt refinado voltado para o erro específico. Isso é bem mais rápido do que regenerar tudo e preserva o restante da imagem que você já aprovou.

A combinação do Nano Banana Pro para a geração inicial com inpainting direcionado para a correção precisa do texto produz resultados coerentes e prontos para produção em duas etapas, em vez de dez.

Aumentando a nitidez do texto com super resolução

Texto renderizado na resolução de saída padrão pode parecer nítido em tamanhos para web, mas mostrar artefatos nas bordas quando impresso ou usado em grandes escalas de exibição. Os modelos de super resolução do PicassoIA podem aumentar a resolução da imagem final, deixando as letras mais nítidas e preservando a qualidade fotorrealista da cena ao redor.

Isso é especialmente relevante para mockups de impressão, materiais publicitários em grande formato e qualquer caso de uso em que a imagem será vista em resolução acima da de tela. As bordas dos caracteres que parecem aceitáveis em 1080p podem revelar suavidade em tamanhos de pôster, e uma passagem de super resolução as deixa bem mais definidas.

Close-up de uma placa de rua mostrando letras sans-serif nítidas e em negrito contra o céu azul

Comparando com outros modelos capazes de texto

O PicassoIA hospeda vários modelos que tentam renderizar texto com resultados variados. O Flux Pro e o Flux 1.1 Pro melhoraram de forma significativa o tratamento de texto em relação às bases de difusão mais antigas, e o GPT Image 2 aborda o texto a partir de uma perspectiva multimodal que gera resultados fortes em certos casos de uso.

ModeloPrecisão do textoMelhor para
Nano Banana ProMuito altaPlacas, rótulos, frases curtas
Nano Banana 2AltaTextos curtos, geração mais rápida
Flux 1.1 ProModerada a altaTexto integrado à cena
GPT Image 2AltaTexto descritivo e instrucional
SDXLBaixa a moderadaEstilo visual de texto, não precisão

O Nano Banana Pro ocupa a posição de destaque especificamente pela precisão de caracteres em sequências curtas de texto dentro de cenas fotorrealistas. Para texto artístico ou estilizado, em que a precisão exata importa menos, outros modelos da coleção podem produzir resultados esteticamente mais interessantes. A escolha certa depende de você precisar que o texto realmente diga o que você pretende.

Experimente no PicassoIA

Mulher em um sofá creme com notebook mostrando uma imagem gerada por IA com texto legível na cena

A melhor forma de ver o que o Nano Banana Pro é capaz de fazer é rodar alguns prompts por conta própria. Comece com algo concreto: uma placa de loja com um rótulo de uma palavra, um mockup de produto com um nome de marca curto ou um cartaz vintage com um título de três palavras. Mantenha o texto curto, use letras maiúsculas e coloque-o em uma superfície de alto contraste. Depois, compare a saída com o que você obteria de um modelo padrão usando o mesmo prompt.

A maioria dos usuários descobre que, com duas ou três iterações de prompt, consegue produzir resultados de texto em imagem que são realmente utilizáveis sem nenhum trabalho de pós-produção. A precisão dos caracteres nem sempre é perfeita de início, mas está perto o suficiente para que pequenos ajustes no prompt ou uma passagem de inpainting direcionada a leve a um resultado finalizado.

A coleção mais ampla do PicassoIA oferece opções para ir além. Gere com o Nano Banana Pro, refine regiões específicas de texto com inpainting e aumente a resolução para impressão. Esse fluxo de trabalho em três etapas produz um resultado que, alguns anos atrás, teria exigido um designer gráfico.

Você também pode testar o Nano Banana e o Nano Banana 2 para comparar velocidade de geração e precisão para as suas necessidades específicas. Cada variante da família tem um equilíbrio ligeiramente diferente entre velocidade, qualidade de imagem e fidelidade do texto, e a ideal depende do seu fluxo de trabalho.

O texto em imagens de IA já não é o problema que era. Vá criar algo com palavras de verdade nele.

Compartilhe este artigo

Escolha seu idioma