En enda AI Gateway sitter framför en pool av arbets-AI Servrar. Applikationer ansluter till gatewayen med en URL och en nyckel, precis som om det vore en enda AI Server; bakom den lastbalanserar gatewayen varje förfrågan över arbetarna, hälsokontrollerar var och en och flyttar trafiken från en döende arbetare till en frisk innan anroparen märker det [1]. Det är inte en separat produkt. AI Gateway är AI Server som körs i sitt farm-front-end-läge, så det OpenAI-kompatibla /v1/* och Ollama-kompatibla /api/* gränssnitt som en enda server exponerar är exakt vad farmen exponerar [1].
En URL och en nyckel, en farm bakom den
Gatewayen balanserar varje förfrågetyp som plattformen hanterar: chatt, inbäddningar, bildgenerering, vision och ljud, inklusive live-tal via WebSocket [1]. Förfrågningar placeras enligt en strategi du väljer — round-robin, lägsta latens, lägsta anslutningar, viktad eller klibbig per klient. Modellmedveten dirigering skickar en förfrågan till en arbetare som redan har den begärda modellen varm, vilket undviker kallstartstraff när en kallare maskin annars kunde ha tagit samtalet [1].
Lägg till en GPU-enhet och kapaciteten växer; klienterna ändrar ingenting. Ta ner en enhet för underhåll och dess trafik töms smidigt, så inga pågående förfrågningar tappas. Vi dödar arbetare mitt i trafiken i vår egen testsvit för att hålla det löftet ärligt: en arbetare som dör försöks igen på en frisk, och failovern sker inom gatewayen innan klienten ser ett fel [1][3].
Den förtroendegräns en farm inför
En farm ändrar vem som innehar vilka behörigheter, och designen håller den gränsen strikt. Klientens gateway-nyckel når aldrig en arbetare. Gatewayen presenterar varje arbetare sin egen nyckel, så en läckt gateway-nyckel kan inte spelas upp direkt mot en arbetare, och per-arbetare-behörigheter stannar inom farmen [2]. Anroparens identitet, alltså vilken app och vilken installation som utfärdade en förfrågan, förs vidare till arbetaren. Varje arbetares innehållsfria revisionslogg registrerar därför den verkliga ursprunget istället för att tillskriva allt till gatewayen [2].
Backpressure istället för timeout
När varje arbetare är mättad returnerar gatewayen ett explicit "försök igen snart" istället för att hålla en anslutning öppen tills den går ut [1]. Anropare får en signal de kan agera på. Två utrullningskontroller körs på samma dirigeringslager. En kanariefågelutgåva skickar en konsekvent del av trafiken till nya maskiner innan de bär full belastning. En uppgradering utan driftstopp tömmer en arbetare, uppgraderar den och återför den till poolen, med slutpunkten uppe hela tiden [1].
Kubernetes utan manuella pooländringar
På Kubernetes upptäcks arbetare automatiskt när de skalas, så en autoskalande farm kräver inga manuella ändringar i gatewayens arbetarlista [2]. Receptet levererar tre former från en produkt: Docker Compose för en enkel demo på en enhet, Kubernetes-manifester och ett Helm-diagram för klustret. Produkten, API:erna och licensen är identiska från en bärbar dator till en GPU-farm [2].
Vad en farm kostar dig att driva
Varje server, inklusive gatewayen, har sin egen live-instrumentpanel och exponerar inbyggda Prometheus-metriker för flottans hälsa, latens, användning och kapacitet [3]. Flottans synlighet är en instrumentpanel, inte en övervakningsstack som sätts ihop före den första förfrågan. Nätverkstjänster förblir begränsade vid varje nod: ett bindningsfel på en icke-loopback-adress stänger anslutningen omedelbart om inte noden har en Pro-licens och minst en API-nyckel, vilket förhindrar att en olicensierad eller nyckellös enhet tyst exponerar sig på LAN [1][4].
En gateway-farm är topologin bakom plattformens tillgänglighetsposition: AI-endpointen förblir aktiv när en enhet inte gör det, och detta sker utan en leverantörsmoln i förfrågningsvägen. Den licensieras som en del av Pro Commercial snarare än att säljas som en separat produkt [4].