Um único AI Gateway fica à frente de um conjunto de AI Servers trabalhadores. Aplicações conectam-se ao gateway com uma URL e uma chave, exatamente como se fosse um único AI Server; por trás dele, o gateway balanceia a carga de cada requisição entre os trabalhadores, verifica a saúde de cada um e redireciona o tráfego de um trabalhador que está falhando para um saudável antes que o solicitante perceba [1]. Não é um produto separado. AI Gateway é o AI Server rodando em modo front-end de fazenda, então a interface compatível com OpenAI /v1/* e compatível com Ollama /api/* exposta por um único servidor é exatamente o que a fazenda expõe [1].
Uma URL e uma chave, uma fazenda por trás
O gateway balanceia todos os tipos de requisição que a plataforma atende: chat, embeddings, geração de imagens, visão e áudio, incluindo o WebSocket de fala ao vivo [1]. As requisições são distribuídas por uma estratégia que você escolhe — round-robin, menor latência, menos conexões, ponderada ou fixa por cliente. O roteamento consciente do modelo envia uma requisição para um trabalhador que já tem o modelo solicitado aquecido, evitando a penalidade de carga fria quando uma máquina mais fria poderia ter atendido a chamada [1].
Adicione uma caixa GPU e a capacidade cresce; os clientes não precisam mudar nada. Tire uma caixa para manutenção e seu tráfego é drenado suavemente, sem que nenhuma requisição em andamento seja perdida. Nós encerramos trabalhadores no meio do tráfego em nossa própria suíte de testes para garantir essa promessa: um trabalhador que morre é reencaminhado para um saudável, e o failover acontece dentro do gateway antes que o cliente veja um erro [1][3].
O limite de confiança que uma fazenda introduz
Uma fazenda muda quem detém qual credencial, e o design mantém esse limite restrito. A chave do gateway do cliente nunca chega a um trabalhador. O gateway apresenta a cada trabalhador sua própria chave, então uma chave de gateway vazada não pode ser usada diretamente contra um trabalhador, e as credenciais por trabalhador ficam dentro da fazenda [2]. A identidade do solicitante, ou seja, qual app e qual instalação emitiram a requisição, é passada para o trabalhador. O log de auditoria sem conteúdo de cada trabalhador registra assim o originador real, em vez de atribuir tudo ao gateway [2].
Backpressure em vez de timeouts
Quando todos os trabalhadores estão saturados, o gateway retorna um "tente novamente em breve" explícito em vez de manter uma conexão aberta até o timeout [1]. Os solicitantes recebem um sinal que podem agir. Dois controles de rollout operam na mesma camada de roteamento. Um lançamento canário envia uma fatia consistente do tráfego para novas máquinas antes que elas assumam carga total. Uma atualização sem downtime drena um trabalhador, o atualiza e o retorna para a fazenda, mantendo o endpoint ativo durante todo o processo [1].
Kubernetes sem edições manuais na fazenda
No Kubernetes, os workers são descobertos automaticamente à medida que escalam, portanto, uma fazenda com escalonamento automático não precisa de edições manuais na lista de workers do gateway [2]. A receita oferece três formatos a partir de um único produto: Docker Compose para uma demonstração em uma única máquina, manifests do Kubernetes e um chart Helm para o cluster. O produto, as APIs e a licença são idênticos desde um laptop até uma fazenda GPU [2].
Quanto custa para operar uma fazenda
Cada servidor, incluindo o gateway, hospeda seu próprio painel ao vivo e expõe métricas nativas do Prometheus para saúde da frota, latência, uso e capacidade [3]. A visibilidade da frota é um painel único, não uma pilha de monitoramento montada antes da primeira requisição. O serviço de rede permanece controlado em cada nó: uma falha de bind não-loopback fecha a conexão a menos que o nó possua uma licença Pro e pelo menos uma chave de API, o que impede que uma máquina sem licença ou sem chave se exponha silenciosamente na LAN [1][4].
Uma fazenda de gateway é a topologia por trás da posição de disponibilidade da plataforma: o endpoint de IA permanece ativo quando uma máquina falha, e isso ocorre sem um cloud do fornecedor no caminho da requisição. É licenciada como parte do Pro Comercial, e não vendida como produto separado [4].