Api-Management

Filed under

6 posts

One Door to the Models, partie 8. L'orchestration au-dessus de la gateway

Un framework d'orchestration qui refait retry et routage concurrence la gateway. Partie 8 : framework mince, tools sous la même identité que les modèles.

Jul 26, 2026 8 min

One Door to the Models, partie 6. Le semantic caching et ses modes de défaillance

Un cache sémantique met en jeu la justesse des réponses, pas seulement le coût. Partie 6 : score threshold, isolation par tenant, et le jour où Redis tombe.

Jul 24, 2026 9 min

One Door to the Models, partie 5. Identité, quota et chargeback

Cinq dimensions de métrique custom, et les time series se multiplient. Partie 5 : identité par tenant, quota et un chargeback qui survit à la cardinalité.

Jul 23, 2026 10 min

One Door to the Models, partie 3. L'abstraction de provider et le streaming

Avec stream: true, le comptage de tokens devient une estimation. En WebSocket, le load balancing disparaît. Partie 3 : les garanties par transport.

Jul 21, 2026 12 min

One Door to the Models, partie 2. Terraform, Bicep ou ARM

Bicep n'a ni state file ni accès à Entra ID. Partie 2 : le choix de la couche IaC, et le défaut de version de modèle qui met à jour la production.

Jul 20, 2026 12 min

One Door to the Models, partie 1. Plaidoyer pour une gateway LLM centrale

Une entreprise exploite cinq apps GenAI sans savoir ce que chacune coûte. Partie 1 : le scénario, construire ou acheter sur Azure, et la gateway à bâtir.

Jul 19, 2026 13 min