AI, LLMs, and applied ML.
Notas de campo de um engenheiro sênior sobre IA, LLMs, agentes e aprendizado de máquina aplicado por Ercan Ermis.
All posts
Evals Antes de Agentes: Você Não Pode Lançar o Que Não Consegue Pontuar
Sem um harness de eval, toda mudança em um agente é um vibe check. Construa o placar antes do agente, e trate o LLM-as-judge como um componente que pode errar.
Cache Semântico: Duas Perguntas Diferentes, Uma Resposta
Cache semântico retorna resposta salva para perguntas formuladas de forma diferente. Reduz custo e latência, mas falso hit serve resposta errada com confiança.
Step Functions É o Orquestrador de Agentes Mais Subestimado
A maioria dos fluxos não precisa que um modelo decida o control flow. Step Functions dá orquestração determinística, retries e estado human-in-the-loop.
LLM Gateways: Por Que Todo Time de Plataforma Acaba Construindo Um
Um segundo time chamando um modelo é fan-out sem governança. Um LLM gateway centraliza auth, quota, roteamento e auditoria: build vs LiteLLM vs API Gateway.
AWS Mensal (Abr '26): OpenAI Chega ao Bedrock
Abril de 2026 na AWS: modelos OpenAI, Codex e Managed Agents chegam ao Bedrock, e o AgentCore ganha harness gerenciado e CLI que encurtam o caminho a um agente.
Inferência Cross-Region: Resiliência Barata ou Armadilha de Residência?
A inferência cross-region do Bedrock suaviza vazão e throttling. Mas um perfil global pode rotear seu prompt para fora da geografia. Verifique residência antes.
Sua Conta de LLM É um Problema de Observabilidade
Uma conta surpreendente do Bedrock não é problema de preço, é visibilidade. Se você não atribui tokens a recurso, cliente ou agente, não consegue gerenciá-los.
Inferência em Lote no Bedrock: Metade do Preço Se Você Puder Esperar
A inferência em lote do Bedrock roda a 50% do preço sob demanda. O único custo é latência. Para um job sem ninguém esperando, essa troca é dinheiro de graça.
Apps LLM Multi-Tenant: Isolando Clientes em um Modelo Compartilhado
Um modelo Bedrock compartilhado, muitos clientes. Sem estado no modelo, isolamento é seu trabalho: delimite busca, limite cota, carregue identidade certa.
Memória de Agente É um Problema de Banco de Dados, Não de Prompt
Colar todo o histórico de um agente no próximo prompt não é memória, é uma conta crescente e um teto de tokens. Memória de verdade é um banco com busca.
Mais de Ercan
Mais dois sites, mesmo autor, terreno diferente.
Cloud, AWS, EKS, Terraform, engenharia de plataforma.
Notas de campo de sistemas em produção. EKS, IAM, Terraform em escala organizacional, observabilidade, otimização de custos.
Visitar ercan.cloud →O hub. Sobre, consultoria, contato.
Hub pessoal para as duas trilhas de escrita. Quem sou eu, como funciona a consultoria, como me contatar.
Visitar ercanermis.com →