Api-Management
Filed under
One Door to the Models, Teil 8: Orchestrierung auf dem Gateway
Ein Orchestrierungs-Framework mit eigenem Retry und Failover konkurriert mit dem Gateway. Teil 8 hält es dünn und stellt Tools unter dieselbe Identität.
One Door to the Models, Teil 6: Semantic Caching und seine Fehlerbilder
Ein semantischer Cache ist eine Korrektheitsfläche, kein reiner Kostenhebel. Teil 6 stimmt den Threshold ab, isoliert Tenants und plant den Redis-Ausfall ein.
One Door to the Models, Teil 5: Identität, Quota und Chargeback
Fünf Custom-Metric-Dimensionen, und time series multiplizieren sich. Teil 5 baut Tenant-Identität, Quota und ein Chargeback-Modell, das Kardinalität übersteht.
One Door to the Models, Teil 3: Die Provider-Abstraktion und Streaming
Mit stream auf true wird Token-Zählung zur Schätzung. Über WebSocket gibt es kein Load Balancing mehr. Teil 3 ordnet Garantien den Transporten zu.
One Door to the Models, Teil 2: Terraform, Bicep oder ARM
Bicep hat kein State File und erreicht Entra ID nicht. Teil 2 wählt die IaC-Schicht des Gateways und findet den Default, der Modellversionen in Produktion hebt.
One Door to the Models, Teil 1: Das Plädoyer für ein zentrales LLM-Gateway
Ein Unternehmen betreibt fünf GenAI-Apps und kann deren Kosten keinem Team zuordnen. Teil 1: Szenario, Build versus Buy auf Azure und das Gateway dieser Serie.