AI, LLMs, and applied ML.

Note sul campo di un ingegnere senior su IA, LLM, agenti e apprendimento automatico applicato di Ercan Ermis.

All posts

66 posts

Evals Prima Degli Agenti: Non Puoi Rilasciare Ciò Che Non Puoi Misurare

Senza un eval harness, ogni modifica a un agente è un vibe check. Costruisci il tabellone prima dell'agente, e tratta l'LLM-as-judge come fallibile.

May 14, 2026 5 min

Semantic Caching: Due Domande Diverse, Una Risposta

La semantic cache dà una risposta salvata a due domande diverse. Riduce costi e latenza, ma un falso hit restituisce una risposta sbagliata con sicurezza.

May 11, 2026 5 min

Step Functions È l'Orchestratore di Agenti Più Sottovalutato

Molti workflow ad agenti non servono un modello per decidere il flusso. Step Functions dà orchestrazione deterministica, retry e stati human-in-the-loop.

May 07, 2026 5 min

Gateway LLM: Perché Ogni Platform Team Ne Costruisce Uno, Prima o Poi

Un secondo team che chiama un modello significa fan-out non governato. Un gateway LLM centralizza auth, quota, routing e audit. Build vs LiteLLM vs API Gateway.

May 04, 2026 6 min

AWS Mensile (Apr '26): OpenAI arriva su Bedrock

Aprile 2026 su AWS: i modelli OpenAI, Codex e Managed Agents arrivano su Bedrock, e AgentCore aggiunge un harness gestito e una CLI verso un agente.

Apr 30, 2026 4 min

Inferenza cross-region: resilienza a basso costo o trappola di residenza?

L'inferenza cross-region di Bedrock livella throughput e throttling, ma un profilo globale può instradare il prompt fuori dalla sua geografia.

Apr 26, 2026 4 min

La tua bolletta LLM è un problema di osservabilità

Una bolletta Bedrock sorprendente non è un problema di prezzo, è di visibilità. Se non attribuisci i token a feature, tenant o agente, non puoi gestirla.

Apr 21, 2026 5 min

Batch Inference su Bedrock: metà prezzo se puoi aspettare

La batch inference di Amazon Bedrock costa il 50% del prezzo on-demand. L'unico costo è la latenza. Per ogni job dove nessuno aspetta, è denaro gratis.

Apr 17, 2026 5 min

App LLM multi-tenant: isolare i clienti su un modello condiviso

Un modello Bedrock condiviso, molti clienti. Il modello è stateless: l'isolamento tocca a te, delimita il retrieval, la quota e l'identità per tenant.

Apr 13, 2026 5 min

La memoria degli agenti è un problema di database, non di prompt

Incollare la cronologia di un agente nel prompt non è memoria: è una bolletta crescente e un tetto di token. La memoria vera è un database con retrieval.

Apr 09, 2026 5 min

Altro da Ercan

Altri due siti, stesso autore, terreno diverso.