Api-Management
Filed under
One Door to the Models, Parte 8: Orchestrazione Sopra il Gateway
Un framework di orchestrazione che fa retry e reinstrada compete con il gateway. La Parte 8 tiene il framework snello e mette i tools sotto la stessa identità.
One Door to the Models, Parte 6: Semantic Caching e le Sue Modalità di Fallimento
Una semantic cache è una superficie di correttezza, non solo una leva di costo. La Parte 6 regola la soglia, isola i tenant e gestisce il giorno senza cache.
One Door to the Models, Parte 5: Identità, Quota e Chargeback
Cinque dimensioni per le metriche custom, e le time series si moltiplicano. La Parte 5 costruisce identità, quota e un chargeback che regge la cardinalità.
One Door to the Models, Parte 3: L'Astrazione dei Provider e lo Streaming
Con stream impostato a true il conteggio dei token diventa stima. Con un WebSocket il load balancing smette di esistere. La Parte 3 mappa garanzie e trasporti.
One Door to the Models, Parte 2: Terraform, Bicep o ARM
Bicep non ha state file e non può toccare Entra ID. La Parte 2 sceglie il layer IaC del gateway e il default di versione modello che aggiorna la produzione.
One Door to the Models, Parte 1: Le Ragioni di un Gateway LLM Centrale
Un'azienda gestisce cinque app GenAI e non sa quanto costa ciascuna. Parte 1: lo scenario, build contro buy su Azure e il gateway che questa serie costruisce.