Llm-Gateway

Filed under

9 posts

One Door to the Models, Teil 10: Observability, Governance und die Zahlen

Wer Prompts loggt, macht das Gateway zum Verarbeiter dessen, was Nutzer tippen. Teil 10 schließt die Serie: Traces, Evals in Produktion, Governance, Scorecard.

Jul 28, 2026 7 min

One Door to the Models, Teil 9: Eval Gates und Model Retirement

Ein Approval, das in den Timeout läuft, markiert die Stage als skipped, nicht als failed. Teil 9 macht das Eval zum echten Gate und Model Retirement zur Query.

Jul 27, 2026 8 min

One Door to the Models, Teil 8: Orchestrierung auf dem Gateway

Ein Orchestrierungs-Framework mit eigenem Retry und Failover konkurriert mit dem Gateway. Teil 8 hält es dünn und stellt Tools unter dieselbe Identität.

Jul 26, 2026 7 min

One Door to the Models, Teil 7: Azure AI Search oder eine Vektordatenbank

Azure AI Search skaliert nach SKU, nicht nach Vektoren; der vector index ist vom Tier-Memory begrenzt. Teil 7 entscheidet Retrieval über Limits statt Features.

Jul 25, 2026 8 min

One Door to the Models, Teil 6: Semantic Caching und seine Fehlerbilder

Ein semantischer Cache ist eine Korrektheitsfläche, kein reiner Kostenhebel. Teil 6 stimmt den Threshold ab, isoliert Tenants und plant den Redis-Ausfall ein.

Jul 24, 2026 8 min

One Door to the Models, Teil 5: Identität, Quota und Chargeback

Fünf Custom-Metric-Dimensionen, und time series multiplizieren sich. Teil 5 baut Tenant-Identität, Quota und ein Chargeback-Modell, das Kardinalität übersteht.

Jul 23, 2026 8 min

One Door to the Models, Teil 4: Asynchrone Arbeit abseits des Request-Pfads

Batch-Inferenz ist eine zweite Tür: Datei rein, Job läuft, Datei raus, keine Gateway-Policy dazwischen. Teil 4 hält die Abrechnung trotzdem ehrlich.

Jul 22, 2026 9 min

One Door to the Models, Teil 3: Die Provider-Abstraktion und Streaming

Mit stream auf true wird Token-Zählung zur Schätzung. Über WebSocket gibt es kein Load Balancing mehr. Teil 3 ordnet Garantien den Transporten zu.

Jul 21, 2026 10 min

One Door to the Models, Teil 1: Das Plädoyer für ein zentrales LLM-Gateway

Ein Unternehmen betreibt fünf GenAI-Apps und kann deren Kosten keinem Team zuordnen. Teil 1: Szenario, Build versus Buy auf Azure und das Gateway dieser Serie.

Jul 19, 2026 11 min