AI, LLMs, and applied ML.
Note sul campo di un ingegnere senior su IA, LLM, agenti e apprendimento automatico applicato di Ercan Ermis.
All posts
Evals Prima Degli Agenti: Non Puoi Rilasciare Ciò Che Non Puoi Misurare
Senza un eval harness, ogni modifica a un agente è un vibe check. Costruisci il tabellone prima dell'agente, e tratta l'LLM-as-judge come fallibile.
Semantic Caching: Due Domande Diverse, Una Risposta
La semantic cache dà una risposta salvata a due domande diverse. Riduce costi e latenza, ma un falso hit restituisce una risposta sbagliata con sicurezza.
Step Functions È l'Orchestratore di Agenti Più Sottovalutato
Molti workflow ad agenti non servono un modello per decidere il flusso. Step Functions dà orchestrazione deterministica, retry e stati human-in-the-loop.
Gateway LLM: Perché Ogni Platform Team Ne Costruisce Uno, Prima o Poi
Un secondo team che chiama un modello significa fan-out non governato. Un gateway LLM centralizza auth, quota, routing e audit. Build vs LiteLLM vs API Gateway.
AWS Mensile (Apr '26): OpenAI arriva su Bedrock
Aprile 2026 su AWS: i modelli OpenAI, Codex e Managed Agents arrivano su Bedrock, e AgentCore aggiunge un harness gestito e una CLI verso un agente.
Inferenza cross-region: resilienza a basso costo o trappola di residenza?
L'inferenza cross-region di Bedrock livella throughput e throttling, ma un profilo globale può instradare il prompt fuori dalla sua geografia.
La tua bolletta LLM è un problema di osservabilità
Una bolletta Bedrock sorprendente non è un problema di prezzo, è di visibilità. Se non attribuisci i token a feature, tenant o agente, non puoi gestirla.
Batch Inference su Bedrock: metà prezzo se puoi aspettare
La batch inference di Amazon Bedrock costa il 50% del prezzo on-demand. L'unico costo è la latenza. Per ogni job dove nessuno aspetta, è denaro gratis.
App LLM multi-tenant: isolare i clienti su un modello condiviso
Un modello Bedrock condiviso, molti clienti. Il modello è stateless: l'isolamento tocca a te, delimita il retrieval, la quota e l'identità per tenant.
La memoria degli agenti è un problema di database, non di prompt
Incollare la cronologia di un agente nel prompt non è memoria: è una bolletta crescente e un tetto di token. La memoria vera è un database con retrieval.
Altro da Ercan
Altri due siti, stesso autore, terreno diverso.
Cloud, AWS, EKS, Terraform, platform engineering.
Note sul campo da sistemi in produzione. EKS, IAM, Terraform su scala organizzativa, observability, ottimizzazione dei costi.
Visita ercan.cloud →L'hub. Chi sono, consulenza, contatti.
Hub personale per entrambe le tracce di scrittura. Chi sono, come funziona la consulenza, come contattarmi.
Visita ercanermis.com →