AI, LLMs, and applied ML.

Note sul campo di un ingegnere senior su IA, LLM, agenti e apprendimento automatico applicato di Ercan Ermis.

All posts

66 posts

Scegli il vector database in base a cosa si rompe per primo

Quasi ogni sistema RAG dovrebbe partire da pgvector. La domanda utile non è quale vector database sia il più veloce, ma quale failure mode arriva per primo.

Jul 29, 2026 12 min

One Door to the Models, Parte 10: Osservabilità, Governance e i Numeri

Loggare i prompt rende il gateway un processore di ciò che gli utenti scrivono. La Parte 10 chiude la serie: trace, eval in produzione, governance e scorecard.

Jul 28, 2026 8 min

One Door to the Models, Parte 9: Eval Gate e Ritiro dei Modelli

Un approval scaduto marca lo stage come skipped, non fallito. La Parte 9 rende l'eval un vero gate e trasforma il ritiro di un modello in una query.

Jul 27, 2026 8 min

One Door to the Models, Parte 8: Orchestrazione Sopra il Gateway

Un framework di orchestrazione che fa retry e reinstrada compete con il gateway. La Parte 8 tiene il framework snello e mette i tools sotto la stessa identità.

Jul 26, 2026 8 min

One Door to the Models, Parte 7: Azure AI Search o un Vector Database

Azure AI Search fattura per SKU, non per vettori; il vector index è limitato dalla memoria del tier. La Parte 7 decide il retrieval sui limiti, non le feature.

Jul 25, 2026 9 min

One Door to the Models, Parte 6: Semantic Caching e le Sue Modalità di Fallimento

Una semantic cache è una superficie di correttezza, non solo una leva di costo. La Parte 6 regola la soglia, isola i tenant e gestisce il giorno senza cache.

Jul 24, 2026 9 min

One Door to the Models, Parte 5: Identità, Quota e Chargeback

Cinque dimensioni per le metriche custom, e le time series si moltiplicano. La Parte 5 costruisce identità, quota e un chargeback che regge la cardinalità.

Jul 23, 2026 9 min

One Door to the Models, Parte 4: Il Lavoro Asincrono Fuori dal Percorso della Richiesta

La batch inference è una seconda porta: entra un file, gira un job, esce un file, nessuna policy del gateway nel mezzo. La Parte 4 tiene onesta la contabilità.

Jul 22, 2026 10 min

One Door to the Models, Parte 3: L'Astrazione dei Provider e lo Streaming

Con stream impostato a true il conteggio dei token diventa stima. Con un WebSocket il load balancing smette di esistere. La Parte 3 mappa garanzie e trasporti.

Jul 21, 2026 12 min

Auth MCP enterprise: gli agenti hanno finalmente i service account

SEP-1046 dà agli agenti non presidiati un vero flusso OAuth su MCP: client credentials con private_key_jwt. Cosa risolve, cosa lascia aperto, come adottarlo.

Jul 21, 2026 10 min

Altro da Ercan

Altri due siti, stesso autore, terreno diverso.