O Gemini 3.5 Flash tem chamado muita atenção desde que o Google o disponibilizou com um nível de acesso gratuito. A promessa soa quase boa demais: um modelo rápido e multimodal, com uma janela de contexto grande, disponível sem custo. Mas o plano gratuito vem com particularidades que pesam muito dependendo do que você está construindo. Este artigo detalha todos os limites para que você não precise adivinhar.
O que é o Gemini 3.5 Flash na prática

Antes de entrar nos limites, vale entender o que o modelo faz de diferente. O Gemini 3.5 Flash faz parte da família "Flash" do Google, o que significa que ele prioriza vazão e velocidade em vez do raciocínio mais profundo possível. Essa é uma contrapartida deliberada, não uma falha.
Velocidade ou inteligência
Os modelos Flash são otimizados para devolver respostas rapidamente. Onde um modelo "Pro" pode levar vários segundos para trabalhar em uma lógica complexa, o Flash entrega respostas em uma fração desse tempo. A precisão se sustenta bem na maioria das tarefas práticas: resumo, extração, tradução, classificação e programação direta. Onde ele perde terreno é no raciocínio lógico de várias etapas, que exige manter muitas variáveis interdependentes ao mesmo tempo.
Para a maioria dos casos de uso reais, a diferença de velocidade é o que você percebe primeiro, não qualquer lacuna de qualidade.
Onde ele se encaixa na linha de modelos

A família atual de modelos do Google vai do Gemini 3.5 Flash, na ponta mais rápida e leve, até o Gemini 3.1 Pro e o Gemini 3 Pro, na ponta mais capaz. O Flash não é a opção mais fraca da linha. Ele é o cavalo de batalha do dia a dia que atende a grande maioria do que os desenvolvedores realmente precisam. Pense nele como o modelo que você usa primeiro, antes de decidir se um processamento mais pesado é realmente necessário.
💡 Se a sua tarefa envolve ler documentos longos, o Gemini 3.5 Flash lida muito bem com o contexto, mesmo no nível gratuito. O limite da janela de contexto é generoso o bastante para a maioria dos documentos e relatórios completos.
Os números do plano gratuito

É isso que a maioria das pessoas quer saber. O acesso gratuito do Google ao Gemini 3.5 Flash acontece pelo Google AI Studio e pela API do Gemini. Veja o que você recebe:
Requisições por minuto
O nível gratuito limita você a 15 requisições por minuto (RPM). Isso é suficiente para projetos pessoais, prototipagem e fluxos de trabalho leves. Se você está construindo uma aplicação em que vários usuários disparam chamadas ao mesmo tempo, vai atingir esse teto rapidamente. Uma pequena equipe que roda pipelines automatizados também vai esbarrar nele.
| Plano | RPM | Requisições por dia |
|---|
| Free | 15 | 1.500 |
| Pay-as-you-go | 2.000 | Ilimitadas |
| Enterprise | Personalizado | Personalizado |
Limites diários de token
A cota diária fica em 1.500 requisições por dia no nível gratuito. Isso parece muito até você rodar um processo em lote, ingerir documentos em escala ou atender mais que alguns usuários ativos. Um usuário que faz muita conversa de ida e volta durante um dia de trabalho inteiro pode consumir uma parcela surpreendente dessa franquia.
Para a vazão total de tokens, o nível gratuito permite cerca de 1.000.000 de tokens por minuto, o que é generoso para cargas de um único usuário, mas se esgota rápido sob pressão de vários usuários.
Tamanho da janela de contexto
Uma área em que o Gemini 3.5 Flash realmente se destaca é a janela de contexto. Mesmo no plano gratuito, você tem acesso à janela de contexto completa de 1 milhão de tokens. Isso não é artificialmente limitado no nível gratuito. Você pode enviar documentos longos, bases de código completas ou históricos extensos de conversa sem esbarrar em nenhum limite.
Essa é uma vantagem significativa em comparação com outros modelos, nos quais o contexto do nível gratuito é cortado de propósito. Aqui, o que você vê é o que você tem.
💡 A janela de contexto de 1M torna o Gemini 3.5 Flash especialmente adequado para análise de documentos e para fluxos de geração aumentada por recuperação, em que você alimenta muito material de origem antes de fazer perguntas.
O que você pode fazer de graça

O plano gratuito não é apenas uma demonstração. É um nível funcional que serve para muitas tarefas reais. Veja onde ele entrega bem.
Tarefas de texto que funcionam
O Gemini 3.5 Flash no plano gratuito lida de forma confiável com o seguinte:
- Resumo: envie um PDF de 40 páginas e receba um resumo limpo e preciso. A janela de contexto grande é um trunfo real aqui.
- Classificação: rotule textos em grande volume dentro da sua cota diária. Classificação de sentimento, categoria e intenção funciona sem problemas.
- Extração: extraia dados estruturados de texto não estruturado, útil para processar e-mails, formulários e contratos.
- Tradução: desempenho sólido nos principais idiomas, à altura dos serviços comerciais de tradução para a maioria dos tipos de conteúdo.
- Perguntas e respostas: tanto perguntas abertas quanto perguntas baseadas em documentos funcionam bem dentro dos limites da janela de contexto.
Visão e entrada de imagens
O Gemini 3.5 Flash é multimodal, o que significa que você pode enviar imagens junto com prompts de texto. No plano gratuito, a entrada de imagens está totalmente incluída. Você pode enviar capturas de tela, fotos, diagramas ou qualquer conteúdo visual e pedir que o modelo descreva, analise ou raciocine com base no que vê.
Isso é especialmente útil em fluxos de processamento de documentos em que você tem PDFs digitalizados ou conteúdo em imagem que precisa ser extraído. O nível gratuito não restringe o acesso multimodal.
Geração de código

Para desenvolvedores, o desempenho em programação é sólido. O Gemini 3.5 Flash consegue escrever funções, depurar trechos de código, explicar lógica existente e sugerir refatorações. Ele lida com Python, JavaScript, TypeScript, Go e Rust de forma confiável. A qualidade da saída em tarefas comuns é competitiva com o que você obteria do GPT-4o ou do DeepSeek V3 em tarefas comparáveis.
A pegadinha é o limite de RPM. Se você roda um assistente de programação com IA em que os usuários digitam com frequência, 15 requisições por minuto se esgotam rápido, mesmo em uma equipe pequena.
Onde o plano gratuito esbarra em limites

As limitações não são só uma questão de números. Algumas restrições são estruturais e importam independentemente do volume que você roda.
Sem SLA de produção
O nível gratuito não tem garantia de disponibilidade. O Google declara explicitamente que o uso gratuito não vem com um Acordo de Nível de Serviço. Se o serviço cair ou degradar, você não tem a quem recorrer. Para projetos pessoais e ferramentas internas, isso costuma ser aceitável. Para qualquer coisa voltada a clientes pagantes, é um risco real.
Os níveis pagos oferecem SLAs formais, com compromissos de disponibilidade e caminhos de escalonamento de suporte. Se o seu negócio depende de disponibilidade confiável, isso faz uma diferença significativa.
Termos de dados e privacidade
No nível gratuito, o Google pode usar suas entradas para melhorar os modelos dele. Isso consta nos termos de uso. Para conteúdo de uso geral, isso costuma ser aceitável, mas se você processa dados proprietários de negócios, informações de clientes ou qualquer coisa confidencial, precisa prestar muita atenção.
Os níveis pagos conforme o uso e empresariais oferecem termos diferentes de tratamento de dados, incluindo opções que impedem que seus dados sejam usados para treinamento. Usuários do nível gratuito não têm essa proteção por padrão.
💡 Sempre leia os termos atuais de processamento de dados antes de passar dados sensíveis de negócios por qualquer nível gratuito de API. Os termos mudam com o tempo e os padrões raramente são conservadores.
Surpresas com o limite de requisições
Os limites de requisição são aplicados no nível da chave de API, não no nível da conta. Parece tranquilo até você perceber que isso cria modos de falha específicos. Se você usa uma única chave para atender vários usuários ou processos, um pico de tráfego bloqueia tudo o que mais compartilha essa chave. O nível gratuito não tem margem para rajadas nem suavização embutida.
Quando você atinge o limite de 15 RPM, as requisições falham imediatamente em vez de entrar em fila. Sua aplicação precisa tratar esses erros explicitamente, com lógica de nova tentativa e backoff exponencial.
Gratuito ou pago, lado a lado

Colocar os números reais em contexto deixa a decisão muito mais fácil.
A diferença de preço
| Recurso | Gratuito | Pago conforme o uso |
|---|
| Preço | US$ 0 | ~US$ 0,075 por 1M de tokens de entrada |
| RPM | 15 | 2.000 |
| Requisições por dia | 1.500 | Ilimitadas |
| SLA | Nenhum | Sim |
| Dados usados para treinamento | Possivelmente | Não |
| Suporte | Somente comunidade | Suporte pago |
O preço dos tokens de entrada no nível pago é realmente baixo. Um milhão de tokens custa menos de um dólar. Se você bate nos limites do nível gratuito com regularidade, a migração para o pago dificilmente será cara, a menos que você processe volumes enormes.
Quando mudar
Os gatilhos que costumam levar as pessoas do gratuito para o pago são coerentes:
- Vários usuários simultâneos batendo na mesma chave de API
- Fluxos automatizados rodando mais de 15 chamadas por minuto
- Processamento de dados sensíveis ou proprietários em que garantias de tratamento de dados importam
- Qualquer produto voltado ao usuário em que a indisponibilidade é inaceitável
Projetos pessoais, experimentação e fluxos de aprendizado quase nunca precisam sair do nível gratuito.
Como usar o Gemini 3.5 Flash no PicassoIA
O PicassoIA tem o Gemini 3.5 Flash disponível diretamente na sua coleção de Large Language Models. Isso permite usar o modelo sem gerenciar chaves de API, lidar com autenticação ou se preocupar com os limites de requisição em si.
Passo 1: acesse o modelo
Acesse o Gemini 3.5 Flash no PicassoIA. O modelo está listado na categoria Large Language Models, ao lado de outros modelos de texto rápidos, como o Gemini 3 Flash, o Claude Sonnet 4.6 e o DeepSeek R1.
Selecione o Gemini 3.5 Flash na coleção. Você verá uma área de entrada em que pode digitar seu prompt diretamente, sem nenhuma configuração.
Passo 2: defina suas entradas
A interface aceita prompts de texto e oferece suporte a entradas multimodais. Você pode:
- Digitar um prompt para geração ou análise de texto
- Colar documentos longos ou código para processar
- Fazer perguntas de acompanhamento em formato de conversa
A plataforma gerencia o contexto da sessão automaticamente. Você não precisa controlar manualmente o histórico da conversa nem contar tokens.
Combinando LLM com geração de imagens

É onde o PicassoIA se torna especialmente útil: combinar geração de texto com saída visual na mesma sessão. Você pode usar o Gemini 3.5 Flash para escrever textos, descrições de artigos ou briefings criativos e, em seguida, trocar para os modelos de geração de imagens para produzir visuais para esse conteúdo.
A plataforma tem mais de 91 modelos de texto para imagem disponíveis. Esse fluxo, em que você gera conteúdo estruturado com um LLM e depois produz imagens correspondentes sem alternar entre várias ferramentas e contas, é realmente mais rápido do que gerenciá-las separadamente.
Para comparação, outros LLMs fortes disponíveis na mesma plataforma incluem o GPT-4o, o Claude 4 Sonnet, o Gemini 2.5 Flash e o Gemini 3.1 Pro. Cada um tem contrapartidas diferentes entre velocidade e capacidade, então você pode trocar conforme a tarefa sem sair da plataforma.
O que você pode criar agora

O plano gratuito é realmente útil para uma ampla gama de tarefas reais. Veja o que as pessoas estão de fato colocando no ar com ele:
- Ferramentas internas de documentos: resuma atas de reunião, extraia itens de ação, classifique chamados de suporte. O uso leve por vários usuários fica folgado dentro da cota diária.
- Assistentes de escrita: escreva rascunhos de e-mails, reescreva textos, gere estruturas organizadas. Tarefas com baixo RPM rodam sem problemas dentro dos limites gratuitos.
- Revisores de código: cole uma função e receba feedback. Ferramentas de desenvolvedor para um único usuário quase nunca atingem limites de requisição na prática.
- Pipelines de extração de dados: alimente documentos estruturados pelo modelo para extrair campos específicos. O processamento em lote funciona bem enquanto você ficar abaixo de 1.500 requisições diárias.
- Protótipos e MVPs: construa e teste ideias de produto sem nenhum custo de infraestrutura. Mude para o pago quando usuários reais aparecerem e o volume justificar.
O plano gratuito não é uma versão reduzida de teste. É um nível de trabalho com restrições reais, pensado para cobrir exatamente essa faixa de casos de uso. O que ele não cobre é tráfego de produção em escala relevante, nem fluxos com exigências rigorosas de tratamento de dados.
Se você não tem certeza de que o nível gratuito é suficiente, faça a conta com o seu volume esperado de requisições: 15 RPM multiplicado pelas suas horas de uso ativo dá o seu teto prático. A maioria dos projetos pessoais e produtos em estágio inicial cabe confortavelmente dentro dele.
Quando você estiver pronto para ir além, comece usando o Gemini 3.5 Flash no PicassoIA para tratar suas tarefas de texto e raciocínio. Combine-o com as ferramentas de geração de imagens da plataforma para produzir visuais na mesma sessão. Os dois estão em um só lugar, sem necessidade de configurar API. Escolha uma tarefa real que você vinha fazendo manualmente e rode-a por ali. A diferença de velocidade e qualidade tende a ficar evidente nos primeiros minutos.