Un único AI Gateway se sitúa frente a un conjunto de AI Servers trabajadores. Las aplicaciones se conectan al gateway con una sola URL y una sola clave, exactamente como si fuera un único AI Server; detrás, el gateway balancea la carga de cada solicitud entre los trabajadores, verifica la salud de cada uno y redirige el tráfico de un trabajador que está fallando a uno saludable antes de que el llamante lo note [1]. No es un producto separado. AI Gateway es AI Server ejecutándose en modo front-end de granja, por lo que la interfaz compatible con OpenAI /v1/* y compatible con Ollama /api/* que expone un único servidor es exactamente lo que expone la granja [1].

Una URL y una clave, una granja detrás

El gateway balancea todos los tipos de solicitudes que la plataforma atiende: chat, embeddings, generación de imágenes, visión y audio, incluyendo el WebSocket de voz en vivo [1]. Las solicitudes se asignan según una estrategia que elijas: round-robin, menor latencia, menos conexiones, ponderado o sticky por cliente. El enrutamiento consciente del modelo envía una solicitud a un trabajador que ya tiene el modelo solicitado activo, lo que evita la penalización por carga en frío cuando una máquina más fría podría haber atendido la llamada [1].

Agrega una caja con GPU y la capacidad crece; los clientes no cambian nada. Toma una caja para mantenimiento y su tráfico se drena de forma gradual, por lo que ninguna solicitud en curso se pierde. En nuestra propia suite de pruebas matamos trabajadores en medio del tráfico para mantener esa garantía honesta: un trabajador que muere se reintenta en uno saludable, y la conmutación por error ocurre dentro del gateway antes de que el cliente vea un error [1][3].

El límite de confianza que introduce una granja

Una granja cambia quién posee qué credencial, y el diseño mantiene ese límite estricto. La clave del gateway del cliente nunca llega a un trabajador. El gateway presenta a cada trabajador su propia clave, por lo que una clave del gateway filtrada no puede ser reproducida directamente contra un trabajador, y las credenciales por trabajador permanecen dentro de la granja [2]. La identidad del llamante, es decir, qué aplicación y qué instalación emitió una solicitud, se transmite al trabajador. Por lo tanto, el registro de auditoría sin contenido de cada trabajador registra el originador real en lugar de atribuir todo al gateway [2].

Contrapresión en lugar de tiempos de espera

Cuando cada trabajador está saturado, el gateway devuelve un "reintente en breve" explícito en lugar de mantener una conexión abierta hasta que expire el tiempo [1]. Los llamantes reciben una señal sobre la que pueden actuar. Dos controles de despliegue operan en la misma capa de enrutamiento. Un despliegue canario envía una porción consistente de tráfico a nuevas máquinas antes de que soporten carga completa. Una actualización sin tiempo de inactividad drena un trabajador, lo actualiza y lo devuelve al conjunto, manteniendo el endpoint activo durante todo el proceso [1].

Kubernetes sin ediciones manuales del conjunto

En Kubernetes, los trabajadores se descubren automáticamente a medida que escalan, por lo que una granja con escalado automático no requiere ediciones manuales en la lista de trabajadores del gateway [2]. La receta incluye tres configuraciones de un solo producto: Docker Compose para una demostración en una sola máquina, manifiestos de Kubernetes y un chart de Helm para el clúster. El producto, las API y la licencia son idénticos desde un portátil hasta una granja con GPU [2].

Lo que cuesta operar una granja

Cada servidor, incluido el gateway, aloja su propio panel en vivo y expone métricas nativas de Prometheus para la salud de la flota, latencia, uso y capacidad [3]. La visibilidad de la flota es un solo panel, no una pila de monitoreo ensamblada antes de la primera solicitud. El servicio de red permanece restringido en cada nodo: un fallo de enlace no loopback cierra la conexión a menos que el nodo tenga una licencia Pro y al menos una clave API, lo que impide que una máquina sin licencia o sin clave se exponga silenciosamente en la LAN [1][4].

Una granja de gateways es la topología detrás de la posición de disponibilidad de la plataforma: el endpoint de IA permanece activo cuando una máquina no lo está, y lo hace sin que haya una nube de proveedor en la ruta de la solicitud. Se licencia como parte de Pro Commercial y no se vende como un producto separado [4].