Gateways de API de IA de código aberto: as melhores opções e o Vercel AI Gateway

Compare os melhores gateways de API de IA de código aberto, incluindo LiteLLM, Bifrost, Envoy e Helicone, com o Vercel AI Gateway. Veja como roteamento, fallbacks, orçamentos e logs diferem, quais limites de licença se aplicam e como escolher a configuração certa para sua equipe em uma tarde.

Gateways de API de IA de código aberto: as melhores opções e o Vercel AI Gateway
Cristian Da Conceicao
Fundador do Picasso IA

Toda equipe que lança um recurso de IA bate no mesmo muro em poucas semanas. Um provedor limita suas requisições às 2 da manhã, outro renomeia um modelo, o financeiro pergunta por que a fatura dobrou e sua base de código agora carrega quatro SDKs diferentes. Um gateway de API de IA resolve isso ao ficar entre seu app e todos os provedores de modelos, para que roteamento, novas tentativas, orçamentos e logs fiquem em um só lugar, em vez de espalhados por vários serviços.

Este artigo compara as melhores opções de gateway de API de IA de código aberto com o Vercel AI Gateway, a opção hospedada que muitas equipes escolhem primeiro. Você verá o que cada uma faz bem, onde cada uma deixa a desejar e como escolher sem passar um mês em testes comparativos. Tudo aqui reflete como essas ferramentas são documentadas por seus mantenedores, então confira as páginas atuais de licença e preços antes de se comprometer.

O que um gateway de IA realmente faz

Vista aérea de um entroncamento de rodovia onde o tráfego se divide para diferentes saídas

Pense em um gateway como um entroncamento de tráfego para requisições de modelos. Seu aplicativo envia uma requisição em um único formato, geralmente o mesmo formato da API de chat da OpenAI. O gateway decide qual provedor e qual modelo devem responder, encaminha a chamada e devolve uma resposta normalizada. Seu código nunca precisa saber quem a atendeu.

É por isso que essa camada também aparece como LLM gateway, LLM proxy ou API unificada. Os nomes variam, mas a função é a mesma: uma porta de entrada, muitos provedores de saída.

Um endpoint, muitos provedores

Sem um gateway, cada provedor traz seu próprio SDK, esquema de autenticação, códigos de erro e formato de streaming. Adicionar um segundo provedor significa uma segunda integração, e um terceiro significa uma terceira. Com um gateway, você troca uma URL base e um nome de modelo. Por isso, a maioria dos gateways anuncia um endpoint compatível com OpenAI: as bibliotecas cliente existentes continuam funcionando, e o provedor por trás delas pode mudar numa terça-feira à tarde sem um novo deploy.

As funções que ele cumpre

Um gateway sólido cumpre seis funções:

  • Roteamento: envia cada requisição ao provedor, modelo ou região certo, com balanceamento de carga entre várias implantações.
  • Fallbacks: muda para um reserva quando a primeira opção retorna erro ou excede o tempo limite.
  • Orçamentos e limitação de taxa: limita gastos e taxas de requisições por equipe, projeto ou usuário.
  • Cache: devolve respostas armazenadas para prompts repetidos, para reduzir custo e latência.
  • Observabilidade: registra uso de tokens, latência, custo e erros de cada chamada.
  • Guardrails: filtra ou oculta dados sensíveis na entrada e na saída antes que saiam da sua rede.

💡 Dica: Você não precisa de todas as seis no primeiro dia. A maioria das equipes começa com roteamento, fallbacks e logs, e depois acrescenta orçamentos após a primeira fatura surpreendente.

Código aberto ou gateway hospedado?

Close de cabos ethernet conectados a um switch de rede montado em rack

Esta é a primeira bifurcação do caminho, e ela importa mais do que qualquer tabela de recursos.

Quando o código aberto vence

Gateways de código aberto rodam na sua própria infraestrutura, então prompts e respostas passam por máquinas que você controla. Esse é o principal motivo pelo qual equipes reguladas escolhem um servidor proxy self-hosted. Você pode ler o código, corrigir um bug, adicionar um provedor que ninguém suporta ainda e evitar uma taxa por requisição cobrada pelo próprio gateway. A contrapartida é o trabalho operacional: você cuida de atualizações, escalabilidade, armazenamento de segredos e do alerta das 3 da manhã quando o proxy cai.

As credenciais merecem cuidado especial. Um gateway guarda as credenciais de todos os provedores que você usa, o que o torna um alvo de alto valor. Armazene-as em um gerenciador de segredos, e não em arquivos de ambiente, troque-as periodicamente e dê a cada equipe interna uma credencial virtual, para que as credenciais reais dos provedores nunca saiam do gateway.

Quando o hospedado é mais inteligente

Um gateway hospedado elimina esse trabalho. Não há nada para implantar, nenhum banco de dados para fazer backup e nenhum cluster para atualizar. Se sua equipe tem três desenvolvedores lançando um produto, uma hora gasta com um gateway gerenciado vale mais do que uma semana ajustando um proxy. O custo é a dependência da disponibilidade, das políticas de dados e dos preços de um fornecedor, além de menos espaço para moldar o comportamento às suas necessidades.

PerguntaCódigo aberto, self-hostedServiço hospedado
Quem opera?Sua equipeO fornecedor
Por onde os prompts trafegam?Dentro da sua redePelo fornecedor
Tempo de configuraçãoHoras a diasMinutos
Comportamento personalizadoEditar código ou pluginsApenas configurações
Trabalho contínuoAtualizações, escalabilidade, monitoramentoQuase nenhum

💡 Verificação de licença: um repositório público nem sempre significa código totalmente aberto. Vários gateways mantêm recursos como single sign-on, controle de acesso baseado em funções ou logs de auditoria sob uma licença comercial separada. Leia o arquivo de licença, e não apenas o README.

Melhores gateways de API de IA de código aberto

Desenvolvedor digitando em uma janela de terminal, em uma mesa em pé, com luz da manhã

Estes são os projetos que a maioria das equipes inclui na lista inicial. Licenças e números de provedores mudam com frequência, então trate esta seção como um mapa, não como um contrato.

LiteLLM: o maior suporte a provedores

O LiteLLM geralmente é o primeiro nome que aparece. Ele é distribuído como uma biblioteca Python e como servidor proxy, usa o formato OpenAI e suporta uma longa lista de provedores, o que o torna o caminho mais rápido para um gateway funcional. O núcleo tem licença MIT. Single sign-on para além de um pequeno número de usuários, controle de acesso baseado em funções, logs de auditoria e alguns callbacks de moderação ficam atrás de uma licença empresarial separada, então confira essa fronteira antes de planejar em cima deles. Como roda em Python, equipes com volume muito alto de requisições costumam fazer benchmarks cuidadosos e escalar o sistema horizontalmente.

Portkey e Bifrost comparados

O Portkey Gateway tem licença MIT e mantém fallbacks, novas tentativas e guardrails no núcleo de código aberto. Ele serve a equipes que querem controles de política sem comprar uma plataforma completa logo no início.

O Bifrost é escrito em Go, distribuído sob Apache 2.0 e anuncia sobrecarga abaixo de um milissegundo. Testes independentes nem sempre confirmam esse número de destaque, então faça seu próprio teste de carga com os tamanhos de prompt do seu caso antes de confiar em qualquer alegação de latência. Sua lista de provedores é menor que a do LiteLLM, o que é suficiente se os grandes fornecedores são tudo de que você precisa.

Envoy, Helicone e Kong

O Envoy AI Gateway é construído sobre o Envoy e licenciado sob Apache 2.0. Ele se encaixa em equipes que já rodam Kubernetes e tratam o Envoy como sua camada de tráfego, já que o tráfego de modelos então segue as mesmas políticas, rastreamento e hábitos de rollout de qualquer outro serviço.

Fileiras de racks de servidores ao longo de um corredor limpo de data center, em perspectiva de ponto único

O Helicone tem licença Apache 2.0 e nasceu da observabilidade, então seus logs e visões de custo são um ponto forte. O Kong adiciona roteamento de IA por meio de plugins sobre seu gateway de API de código aberto, o que é conveniente se o Kong já é a porta de entrada das suas outras APIs. Verifique quais plugins de IA vêm na edição gratuita antes de depender deles.

GatewayLicençaMelhor para
LiteLLMNúcleo MIT, nível empresarial pagoInício rápido, muitos provedores
Portkey GatewayMITGuardrails e novas tentativas
BifrostApache 2.0Baixa sobrecarga, stack em Go
Envoy AI GatewayApache 2.0Plataformas Kubernetes
HeliconeApache 2.0Visibilidade de custo e uso
KongNúcleo Apache 2.0, alguns plugins pagosEquipes que já usam Kong

Vercel AI Gateway de perto

O Vercel AI Gateway é a contrapartida hospedada, e a forma honesta de apresentá-lo é simples: ele não é código aberto. O AI SDK ao redor dele é de código aberto, mas o gateway em si é um serviço gerenciado. Você está trocando controle por conveniência, e para muitas equipes essa é a escolha certa.

O que você recebe

Uma credencial e um endpoint dão acesso a modelos de muitos provedores. Ele expõe endpoints compatíveis com OpenAI e compatíveis com Anthropic, então os clientes existentes geralmente precisam apenas de uma nova URL base. Além disso, você ganha roteamento entre provedores, novas tentativas automáticas, fallbacks de modelos, logs de gastos e latência, e orçamentos por credencial.

Quanto ao custo, a Vercel afirma que cobra o preço de tabela do provedor, sem markup sobre os tokens, inclusive quando você usa suas próprias credenciais de provedor (muitas vezes chamadas de BYOK). Novas equipes recebem um pequeno crédito gratuito mensal, listado em US$ 5 no momento da escrita. Confira a página de preços atual, porque os valores dos créditos mudam.

A Vercel também informa que, em todo o seu tráfego de produção até abril de 2026, o fallback automático salvou cerca de 3,5% das requisições que haviam sofrido erro, limite de taxa ou tempo limite na primeira rota. Esse número vem do próprio fornecedor, então leia-o como um sinal de quão comuns são os problemas pontuais dos provedores, e não como uma promessa para a sua carga de trabalho.

Onde ele deixa a desejar

  • Não é self-hostable. Os prompts passam por um fornecedor, o que pode descartá-lo sob políticas de dados rígidas.
  • Baseado em créditos. Créditos pré-pagos servem a equipes pequenas, mas departamentos financeiros às vezes querem notas fiscais e compromissos de gasto.
  • Menos personalização. Você ajusta configurações, não corrige código.
  • Dependência leve. Como a API é compatível com OpenAI, sair é, em grande parte, trocar a URL base, mas seus logs e orçamentos continuam com o fornecedor.

Roteamento, fallbacks e novas tentativas

Vista de baixo ângulo de uma torre de controle de tráfego aéreo ao entardecer

Fallbacks são o recurso que, sozinho, justifica um gateway. Uma cadeia de fallback lista modelos em ordem: tente o principal e, se ele retornar um erro 5xx, um limite de taxa 429 ou um tempo limite, passe para o próximo. Uma cadeia sensata mistura provedores, não apenas modelos, porque uma queda de um provedor derruba todos os modelos que ele hospeda.

Uma cadeia prática para um recurso de chat pode ficar assim:

  1. Principal: Claude Sonnet 5 para respostas em que a qualidade é essencial.
  2. Primeiro reserva: GPT 5.6 Terra em um provedor diferente.
  3. Último recurso: Gemini 3.5 Flash para velocidade quando todo o resto estiver com problemas.

Vista aérea de um pátio ferroviário de manobras com trilhos se ramificando em muitas direções

Todo gateway deste artigo consegue expressar uma cadeia assim na configuração. O que muda é quanto controle você tem sobre quando ela é acionada: por código de status, por limite de latência, por resultado de filtro de conteúdo ou por regra personalizada.

O balanceamento de carga é o irmão discreto dos fallbacks. Se você tem duas implantações do mesmo modelo, digamos em regiões diferentes ou sob contas diferentes, o gateway pode distribuir o tráfego entre elas por peso e afastar-se da que está lenta. Isso também eleva seu limite de taxa efetivo, já que cada conta tem o seu próprio teto.

Novas tentativas precisam de limites

Novas tentativas ajudam com erros de curta duração, mas carregam risco. Uma requisição repetida pode ser cobrada duas vezes se a primeira chamada terminou tarde, e uma tempestade de novas tentativas pode empurrar ainda mais um provedor que já está em dificuldade. Mantenha estes hábitos:

  • Use no máximo duas ou três novas tentativas, com backoff exponencial e jitter aleatório.
  • Defina tempos limite por modelo. Um modelo de raciocínio pode legitimamente pensar por um minuto, enquanto um modelo de chat pequeno deve responder em segundos.
  • Planeje o streaming. Depois que os primeiros tokens chegaram ao usuário, um fallback no meio do stream não pode reiniciar a resposta sem que o usuário perceba, então decida cedo como sua interface vai lidar com isso.

Controlando custo e uso

Vista de cima de uma mesa com caderno, calculadora e café para acompanhar custos

As contas de modelos crescem em silêncio. Um gateway transforma os gastos em algo que você pode definir e acompanhar.

Orçamentos por equipe e projeto

Emita uma credencial virtual por equipe, projeto ou cliente e associe a ela um orçamento mensal e um limite de taxa. Quando um script descontrolado entra em loop, ele esgota o próprio orçamento e para, em vez de drenar a conta compartilhada. Marque cada requisição para que o log responda "quem gastou o quê" sem uma planilha. LiteLLM e Vercel AI Gateway oferecem orçamentos, e em qualquer ferramenta self-hosted você deve confirmar se o recurso de orçamento está na edição gratuita.

Depois, use o gateway para combinar o modelo com a tarefa:

  • Envie classificação, marcação e resumos curtos para um modelo pequeno e rápido, como o Gemini 3.5 Flash ou o Qwen3.7-Plus.
  • Reserve os modelos de ponta para código, raciocínio e textos voltados ao cliente, por exemplo o Kimi K2.6 para trabalho no estilo de agente.
  • Rode modelos de pesos abertos como o Llama 4 Maverick Instruct, o Deepseek v3.1 ou o GPT OSS 120B atrás do mesmo endpoint das APIs pagas, o que oferece uma faixa de custo baixo.
  • Faça cache de prompts repetidos, como respostas de FAQ, e emita alerta em 80% do orçamento, e não em 100%.

💡 Registre com cuidado: armazenar todo prompt facilita a depuração, mas também pode guardar dados pessoais. Defina regras de retenção e de ocultação antes de ativar o registro completo do corpo das requisições.

Como escolher em uma tarde

Dois engenheiros discutindo um diagrama desenhado à mão em um quadro branco

Você não precisa de um mês de pesquisa. Precisa de um quadro claro das suas restrições e de um teste curto.

Uma tabela de decisão simples

Sua situaçãoComece com
Equipe pequena que quer colocar no ar hojeVercel AI Gateway
Os prompts precisam ficar dentro da sua redeLiteLLM ou Portkey Gateway, self-hosted
Já roda Kubernetes e EnvoyEnvoy AI Gateway
A latência adicionada por requisição é o mais importanteFaça benchmark do Bifrost contra o LiteLLM
O Kong já é a porta de entrada das suas APIsPlugins de IA do Kong
Visibilidade de custo e uso vem primeiroHelicone

Depois, execute o mesmo teste de cinco passos nas suas duas melhores opções:

  1. Aponte um app de sandbox para a URL base do gateway.
  2. Envie mil prompts realistas, não exemplos de brinquedo.
  3. Revogue as credenciais do provedor principal e confirme que o fallback é acionado.
  4. Verifique se os logs mostram tokens, custo e erros por requisição.
  5. Meça a latência adicionada em comparação com chamar o provedor diretamente.

Três erros a evitar

  1. Escolher só com base em benchmarks. Um gateway que adiciona um milissegundo em laboratório pode adicionar mais quando o registro, a autenticação e os guardrails estiverem ativados.
  2. Pular o teste de fallback. Desligue o provedor principal e veja o que acontece. Uma cadeia não testada é um palpite.
  3. Tratar o gateway como ponto único de falha. Rode pelo menos duas instâncias atrás de um balanceador de carga, ou mantenha um caminho direto para o provedor no seu código como chave de emergência.

Pule a encanação e crie

Designer em uma mesa larga analisando uma fotografia de paisagem em um monitor grande

Nem todo projeto precisa de um gateway. Se seu objetivo é produzir textos, imagens ou vídeos em vez de operar infraestrutura, o Picasso IA oferece os modelos diretamente no navegador, sem proxy para implantar e sem credenciais para trocar.

No lado dos textos, você pode testar o Claude Sonnet 5, o GPT 5.6 Terra e o Gemini 3.5 Flash lado a lado, a mesma comparação que um gateway permitiria automatizar por script. Para imagens, rode um prompt pelo Seedream 5 Pro, pelo GPT Image 2 e pelo Flux 2 Max e fique com o resultado que você mais gostar. Para movimento, o Seedance 2.0 transforma texto em vídeo com áudio integrado, o Veo 3.1 Fast faz clipes rápidos em 1080p, e o Kling v3 Video busca planos cinematográficos.

Escolha um prompt de que você realmente precisa, rode-o em três modelos e compare os resultados. Esse único hábito ensina mais sobre qualidade e custo dos modelos do que qualquer tabela de benchmarks. Abra o Picasso IA, escolha um modelo e crie sua primeira imagem ou vídeo hoje.

Compartilhe este artigo

Escolha seu idioma