Ein einzelnes AI Gateway sitzt vor einem Pool von Worker AI Servern. Anwendungen verbinden sich mit dem Gateway über eine einzige URL und einen Schlüssel, genau so, als wäre es ein einzelner AI Server; dahinter verteilt das Gateway jede Anfrage lastgerecht auf die Worker, überprüft deren Gesundheit und leitet den Traffic eines ausfallenden Workers auf einen gesunden um, bevor der Aufrufer es bemerkt [1]. Es ist kein separates Produkt. AI Gateway ist AI Server im Farm-Frontend-Modus, daher ist es OpenAI-kompatibel /v1/* und Ollama-kompatibel /api/* Die Oberfläche, die ein einzelner Server bereitstellt, ist genau die, die auch die Farm bereitstellt [1].
Eine URL und ein Schlüssel, dahinter eine Farm
Das Gateway balanciert jede Anfragetyp, den die Plattform bedient: Chat, Embeddings, Bilderzeugung, Vision und Audio, einschließlich des Live-Speech-WebSocket [1]. Anfragen werden nach einer von Ihnen gewählten Strategie verteilt – Round-Robin, geringste Latenz, geringste Verbindungen, gewichtet oder sticky pro Client. Modellbewusstes Routing sendet eine Anfrage an einen Worker, der das angeforderte Modell bereits geladen hat, wodurch eine Kaltstartstrafe vermieden wird, die sonst bei einem kälteren Rechner entstanden wäre [1].
Fügen Sie eine GPU-Box hinzu und die Kapazität wächst; die Clients müssen nichts ändern. Wird eine Box für Wartungsarbeiten heruntergefahren, wird ihr Traffic sanft abgebaut, sodass keine laufende Anfrage verloren geht. In unserer eigenen Testsuite beenden wir Worker mitten im Traffic, um diese Garantie zu überprüfen: Ein Worker, der abstürzt, wird auf einem gesunden neu versucht, und das Failover erfolgt innerhalb des Gateways, bevor der Client einen Fehler sieht [1][3].
Die Vertrauensgrenze, die eine Farm einführt
Eine Farm ändert, wer welche Berechtigung besitzt, und das Design hält diese Grenze strikt ein. Der Gateway-Schlüssel des Clients gelangt niemals zu einem Worker. Das Gateway stellt jedem Worker seinen eigenen Schlüssel zur Verfügung, sodass ein geleakter Gateway-Schlüssel nicht direkt gegen einen Worker wiederverwendet werden kann, und die pro-Worker-Berechtigungen bleiben innerhalb der Farm [2]. Die Anruferidentität, also welche App und welche Installation eine Anfrage gestellt hat, wird an den Worker weitergegeben. Das inhaltsfreie Prüfprotokoll jedes Workers zeichnet daher den tatsächlichen Ursprung auf, anstatt alles dem Gateway zuzuschreiben [2].
Rückdruck statt Zeitüberschreitungen
Wenn jeder Worker ausgelastet ist, gibt das Gateway ein explizites „bitte kurz erneut versuchen“ zurück, anstatt eine Verbindung offen zu halten, bis sie zeitlich abläuft [1]. Anrufer erhalten ein Signal, auf das sie reagieren können. Zwei Rollout-Kontrollen nutzen dieselbe Routing-Ebene. Ein Canary-Release sendet einen konsistenten Verkehrsschnitt an neue Maschinen, bevor diese die volle Last tragen. Ein Upgrade ohne Ausfallzeit leert einen Worker, aktualisiert ihn und gibt ihn zurück in den Pool, wobei der Endpunkt währenddessen durchgehend verfügbar bleibt [1].
Kubernetes ohne manuelle Pool-Änderungen
Bei Kubernetes werden Worker automatisch erkannt, wenn sie skalieren, sodass eine autoskalierende Farm keine manuellen Änderungen an der Worker-Liste des Gateways benötigt [2]. Das Rezept liefert drei Varianten aus einem Produkt: Docker Compose für eine Einzelbox-Demo, Kubernetes-Manifeste und ein Helm-Chart für den Cluster. Das Produkt, die APIs und die Lizenz sind von einem Laptop bis zu einer GPU-Farm identisch [2].
Was eine Farm im Betrieb kostet
Jeder Server, einschließlich des Gateways, hostet sein eigenes Live-Dashboard und stellt native Prometheus-Metriken für Flottenzustand, Latenz, Nutzung und Kapazität bereit [3]. Die Flottenübersicht ist ein Dashboard, nicht ein Monitoring-Stack, der vor der ersten Anfrage zusammengestellt wird. Der Netzwerkzugriff bleibt an jedem Knoten kontrolliert: Ein Bind-Versuch an eine Nicht-Loopback-Adresse schlägt fehl und schließt, sofern der Knoten keine Pro-Berechtigung und mindestens einen API-Schlüssel besitzt, was verhindert, dass eine nicht lizenzierte oder nicht mit Schlüssel versehene Box sich unbemerkt im LAN exponiert [1][4].
Eine Gateway-Farm ist die Topologie hinter der Verfügbarkeitsstrategie der Plattform: Der AI-Endpunkt bleibt verfügbar, wenn eine Box ausfällt, und das ohne einen Anbieter-Cloud-Dienst im Anfragepfad. Sie ist als Teil von Pro Commercial lizenziert und wird nicht als separates Produkt verkauft [4].