Llm-Gateway

Filed under

9 posts

One Door to the Models, Parte 10: Osservabilità, Governance e i Numeri

Loggare i prompt rende il gateway un processore di ciò che gli utenti scrivono. La Parte 10 chiude la serie: trace, eval in produzione, governance e scorecard.

Jul 28, 2026 8 min

One Door to the Models, Parte 9: Eval Gate e Ritiro dei Modelli

Un approval scaduto marca lo stage come skipped, non fallito. La Parte 9 rende l'eval un vero gate e trasforma il ritiro di un modello in una query.

Jul 27, 2026 8 min

One Door to the Models, Parte 8: Orchestrazione Sopra il Gateway

Un framework di orchestrazione che fa retry e reinstrada compete con il gateway. La Parte 8 tiene il framework snello e mette i tools sotto la stessa identità.

Jul 26, 2026 8 min

One Door to the Models, Parte 7: Azure AI Search o un Vector Database

Azure AI Search fattura per SKU, non per vettori; il vector index è limitato dalla memoria del tier. La Parte 7 decide il retrieval sui limiti, non le feature.

Jul 25, 2026 9 min

One Door to the Models, Parte 6: Semantic Caching e le Sue Modalità di Fallimento

Una semantic cache è una superficie di correttezza, non solo una leva di costo. La Parte 6 regola la soglia, isola i tenant e gestisce il giorno senza cache.

Jul 24, 2026 9 min

One Door to the Models, Parte 5: Identità, Quota e Chargeback

Cinque dimensioni per le metriche custom, e le time series si moltiplicano. La Parte 5 costruisce identità, quota e un chargeback che regge la cardinalità.

Jul 23, 2026 9 min

One Door to the Models, Parte 4: Il Lavoro Asincrono Fuori dal Percorso della Richiesta

La batch inference è una seconda porta: entra un file, gira un job, esce un file, nessuna policy del gateway nel mezzo. La Parte 4 tiene onesta la contabilità.

Jul 22, 2026 10 min

One Door to the Models, Parte 3: L'Astrazione dei Provider e lo Streaming

Con stream impostato a true il conteggio dei token diventa stima. Con un WebSocket il load balancing smette di esistere. La Parte 3 mappa garanzie e trasporti.

Jul 21, 2026 12 min

One Door to the Models, Parte 1: Le Ragioni di un Gateway LLM Centrale

Un'azienda gestisce cinque app GenAI e non sa quanto costa ciascuna. Parte 1: lo scenario, build contro buy su Azure e il gateway che questa serie costruisce.

Jul 19, 2026 12 min