Api-Management
Filed under
One Door to the Models, partie 8. L'orchestration au-dessus de la gateway
Un framework d'orchestration qui refait retry et routage concurrence la gateway. Partie 8 : framework mince, tools sous la même identité que les modèles.
One Door to the Models, partie 6. Le semantic caching et ses modes de défaillance
Un cache sémantique met en jeu la justesse des réponses, pas seulement le coût. Partie 6 : score threshold, isolation par tenant, et le jour où Redis tombe.
One Door to the Models, partie 5. Identité, quota et chargeback
Cinq dimensions de métrique custom, et les time series se multiplient. Partie 5 : identité par tenant, quota et un chargeback qui survit à la cardinalité.
One Door to the Models, partie 3. L'abstraction de provider et le streaming
Avec stream: true, le comptage de tokens devient une estimation. En WebSocket, le load balancing disparaît. Partie 3 : les garanties par transport.
One Door to the Models, partie 2. Terraform, Bicep ou ARM
Bicep n'a ni state file ni accès à Entra ID. Partie 2 : le choix de la couche IaC, et le défaut de version de modèle qui met à jour la production.
One Door to the Models, partie 1. Plaidoyer pour une gateway LLM centrale
Une entreprise exploite cinq apps GenAI sans savoir ce que chacune coûte. Partie 1 : le scénario, construire ou acheter sur Azure, et la gateway à bâtir.