AI, LLMs, and applied ML.

Notas de campo de um engenheiro sênior sobre IA, LLMs, agentes e aprendizado de máquina aplicado por Ercan Ermis.

All posts

66 posts

Evals Antes de Agentes: Você Não Pode Lançar o Que Não Consegue Pontuar

Sem um harness de eval, toda mudança em um agente é um vibe check. Construa o placar antes do agente, e trate o LLM-as-judge como um componente que pode errar.

May 14, 2026 5 min

Cache Semântico: Duas Perguntas Diferentes, Uma Resposta

Cache semântico retorna resposta salva para perguntas formuladas de forma diferente. Reduz custo e latência, mas falso hit serve resposta errada com confiança.

May 11, 2026 5 min

Step Functions É o Orquestrador de Agentes Mais Subestimado

A maioria dos fluxos não precisa que um modelo decida o control flow. Step Functions dá orquestração determinística, retries e estado human-in-the-loop.

May 07, 2026 5 min

LLM Gateways: Por Que Todo Time de Plataforma Acaba Construindo Um

Um segundo time chamando um modelo é fan-out sem governança. Um LLM gateway centraliza auth, quota, roteamento e auditoria: build vs LiteLLM vs API Gateway.

May 04, 2026 6 min

AWS Mensal (Abr '26): OpenAI Chega ao Bedrock

Abril de 2026 na AWS: modelos OpenAI, Codex e Managed Agents chegam ao Bedrock, e o AgentCore ganha harness gerenciado e CLI que encurtam o caminho a um agente.

Apr 30, 2026 4 min

Inferência Cross-Region: Resiliência Barata ou Armadilha de Residência?

A inferência cross-region do Bedrock suaviza vazão e throttling. Mas um perfil global pode rotear seu prompt para fora da geografia. Verifique residência antes.

Apr 26, 2026 4 min

Sua Conta de LLM É um Problema de Observabilidade

Uma conta surpreendente do Bedrock não é problema de preço, é visibilidade. Se você não atribui tokens a recurso, cliente ou agente, não consegue gerenciá-los.

Apr 21, 2026 5 min

Inferência em Lote no Bedrock: Metade do Preço Se Você Puder Esperar

A inferência em lote do Bedrock roda a 50% do preço sob demanda. O único custo é latência. Para um job sem ninguém esperando, essa troca é dinheiro de graça.

Apr 17, 2026 5 min

Apps LLM Multi-Tenant: Isolando Clientes em um Modelo Compartilhado

Um modelo Bedrock compartilhado, muitos clientes. Sem estado no modelo, isolamento é seu trabalho: delimite busca, limite cota, carregue identidade certa.

Apr 13, 2026 5 min

Memória de Agente É um Problema de Banco de Dados, Não de Prompt

Colar todo o histórico de um agente no próximo prompt não é memória, é uma conta crescente e um teto de tokens. Memória de verdade é um banco com busca.

Apr 09, 2026 5 min

Mais de Ercan

Mais dois sites, mesmo autor, terreno diferente.