AI, LLMs, and applied ML.
Note sul campo di un ingegnere senior su IA, LLM, agenti e apprendimento automatico applicato di Ercan Ermis.
All posts
Scegli il vector database in base a cosa si rompe per primo
Quasi ogni sistema RAG dovrebbe partire da pgvector. La domanda utile non è quale vector database sia il più veloce, ma quale failure mode arriva per primo.
One Door to the Models, Parte 10: Osservabilità, Governance e i Numeri
Loggare i prompt rende il gateway un processore di ciò che gli utenti scrivono. La Parte 10 chiude la serie: trace, eval in produzione, governance e scorecard.
One Door to the Models, Parte 9: Eval Gate e Ritiro dei Modelli
Un approval scaduto marca lo stage come skipped, non fallito. La Parte 9 rende l'eval un vero gate e trasforma il ritiro di un modello in una query.
One Door to the Models, Parte 8: Orchestrazione Sopra il Gateway
Un framework di orchestrazione che fa retry e reinstrada compete con il gateway. La Parte 8 tiene il framework snello e mette i tools sotto la stessa identità.
One Door to the Models, Parte 7: Azure AI Search o un Vector Database
Azure AI Search fattura per SKU, non per vettori; il vector index è limitato dalla memoria del tier. La Parte 7 decide il retrieval sui limiti, non le feature.
One Door to the Models, Parte 6: Semantic Caching e le Sue Modalità di Fallimento
Una semantic cache è una superficie di correttezza, non solo una leva di costo. La Parte 6 regola la soglia, isola i tenant e gestisce il giorno senza cache.
One Door to the Models, Parte 5: Identità, Quota e Chargeback
Cinque dimensioni per le metriche custom, e le time series si moltiplicano. La Parte 5 costruisce identità, quota e un chargeback che regge la cardinalità.
One Door to the Models, Parte 4: Il Lavoro Asincrono Fuori dal Percorso della Richiesta
La batch inference è una seconda porta: entra un file, gira un job, esce un file, nessuna policy del gateway nel mezzo. La Parte 4 tiene onesta la contabilità.
One Door to the Models, Parte 3: L'Astrazione dei Provider e lo Streaming
Con stream impostato a true il conteggio dei token diventa stima. Con un WebSocket il load balancing smette di esistere. La Parte 3 mappa garanzie e trasporti.
Auth MCP enterprise: gli agenti hanno finalmente i service account
SEP-1046 dà agli agenti non presidiati un vero flusso OAuth su MCP: client credentials con private_key_jwt. Cosa risolve, cosa lascia aperto, come adottarlo.
Altro da Ercan
Altri due siti, stesso autore, terreno diverso.
Cloud, AWS, EKS, Terraform, platform engineering.
Note sul campo da sistemi in produzione. EKS, IAM, Terraform su scala organizzativa, observability, ottimizzazione dei costi.
Visita ercan.cloud →L'hub. Chi sono, consulenza, contatti.
Hub personale per entrambe le tracce di scrittura. Chi sono, come funziona la consulenza, come contattarmi.
Visita ercanermis.com →