Azure
Filed under
One Door to the Models, partie 10. Observabilité, gouvernance et les chiffres
Logger les prompts fait de la gateway un processeur de tout ce que tapent les utilisateurs. Partie 10 : traces, evals en production, gouvernance et bilan.
One Door to the Models, partie 9. Des eval gates et le retrait des modèles
Une approval qui expire marque le stage skipped, pas failed. Partie 9 : l'eval devient un vrai gate et le retrait d'un modèle une simple requête.
One Door to the Models, partie 8. L'orchestration au-dessus de la gateway
Un framework d'orchestration qui refait retry et routage concurrence la gateway. Partie 8 : framework mince, tools sous la même identité que les modèles.
One Door to the Models, partie 7. Azure AI Search ou une base vectorielle
Azure AI Search facture par SKU, pas par vecteur, et le vector index est plafonné par la mémoire du tier. Partie 7 : le retrieval se décide sur les limites.
One Door to the Models, partie 6. Le semantic caching et ses modes de défaillance
Un cache sémantique met en jeu la justesse des réponses, pas seulement le coût. Partie 6 : score threshold, isolation par tenant, et le jour où Redis tombe.
One Door to the Models, partie 5. Identité, quota et chargeback
Cinq dimensions de métrique custom, et les time series se multiplient. Partie 5 : identité par tenant, quota et un chargeback qui survit à la cardinalité.
One Door to the Models, partie 4. Le travail asynchrone hors du chemin de requête
Le batch est une seconde porte : un fichier entre, un job tourne, un fichier sort, aucune politique de gateway au milieu. Partie 4 garde les comptes honnêtes.
One Door to the Models, partie 3. L'abstraction de provider et le streaming
Avec stream: true, le comptage de tokens devient une estimation. En WebSocket, le load balancing disparaît. Partie 3 : les garanties par transport.
One Door to the Models, partie 2. Terraform, Bicep ou ARM
Bicep n'a ni state file ni accès à Entra ID. Partie 2 : le choix de la couche IaC, et le défaut de version de modèle qui met à jour la production.
One Door to the Models, partie 1. Plaidoyer pour une gateway LLM centrale
Une entreprise exploite cinq apps GenAI sans savoir ce que chacune coûte. Partie 1 : le scénario, construire ou acheter sur Azure, et la gateway à bâtir.