Amazon Bedrock
Filed under
Rastreamento de Custo do Bedrock por Aplicação com Inference Profiles
Inference profiles colocam tags de custo nas chamadas do Bedrock, transformando uma fatura única em linhas por time. O design das tags é a parte difícil.
AI Act da UE, 2 de Agosto: O Prazo Que Não Mudou
O Digital Omnibus adiou os prazos de alto risco para 2027 e 2028. A transparência do Artigo 50 segue valendo em 2 de agosto de 2026, o prazo que pega a maioria.
SageMaker vs Bedrock: Uma Decisão Organizacional, Não Técnica
A escolha entre SageMaker e Bedrock é, na verdade, sobre se sua organização tem um time dono de modelos. Escolha pela topologia que você tem, não a do slide.
Injeção de Prompt via Seus Próprios Documentos: A Superfície de Ataque do RAG
Sua base de conhecimento é entrada não confiável. A recuperação entrega texto de atacantes ao modelo, então o controle que compensa é escanear na ingestão.
AWS Mensal (Junho de 26): Agentes Ganham um Loop de Feedback
Junho de 2026 na AWS: o Summit em Nova York transformou traces de produção em melhoria de agentes, lançou o Continuum de segurança e levou o AgentCore ao GA.
O Limite Real do Seu Sistema Multi-Agente é Tokens Por Minuto
O Amazon Bedrock agora expõe quotas de tokens por minuto por modelo no Service Quotas. Para agents, TPM é o teto real de escala. Planeje antes dos 429s.
A Janela de Contexto Não É Sua Amiga
Uma janela de contexto enorme não substitui a recuperação. A precisão cai conforme o prompt cresce, o custo escala a cada token e o meio é ignorado.
AWS Mensal (Mai/26): Agentes Ganham uma Carteira
Maio de 2026 na AWS: AgentCore Payments permite que agentes transacionem, e o Agent Toolkit for AWS mais um servidor MCP gerenciado GA reforçam o ferramental.
Quando o Haiku Vence o Opus: Right-Sizing de Modelos no Bedrock
Usar Opus como default em toda chamada é como as contas de LLM estouram. Roteie por classe de tarefa: Haiku para o mecânico, Opus como caminho de escalonamento.
RAG Agêntico É, Na Maior Parte, Latência Que Você Não Precisa
RAG agêntico faz loop por saltos de retrieval, cada um ida e volta ao modelo. Para a maioria das perguntas, boa query basta. Use o loop só se valer a latência.
Evals Antes de Agentes: Você Não Pode Lançar o Que Não Consegue Pontuar
Sem um harness de eval, toda mudança em um agente é um vibe check. Construa o placar antes do agente, e trate o LLM-as-judge como um componente que pode errar.
Cache Semântico: Duas Perguntas Diferentes, Uma Resposta
Cache semântico retorna resposta salva para perguntas formuladas de forma diferente. Reduz custo e latência, mas falso hit serve resposta errada com confiança.
LLM Gateways: Por Que Todo Time de Plataforma Acaba Construindo Um
Um segundo time chamando um modelo é fan-out sem governança. Um LLM gateway centraliza auth, quota, roteamento e auditoria: build vs LiteLLM vs API Gateway.
AWS Mensal (Abr '26): OpenAI Chega ao Bedrock
Abril de 2026 na AWS: modelos OpenAI, Codex e Managed Agents chegam ao Bedrock, e o AgentCore ganha harness gerenciado e CLI que encurtam o caminho a um agente.
Inferência Cross-Region: Resiliência Barata ou Armadilha de Residência?
A inferência cross-region do Bedrock suaviza vazão e throttling. Mas um perfil global pode rotear seu prompt para fora da geografia. Verifique residência antes.
Sua Conta de LLM É um Problema de Observabilidade
Uma conta surpreendente do Bedrock não é problema de preço, é visibilidade. Se você não atribui tokens a recurso, cliente ou agente, não consegue gerenciá-los.
Inferência em Lote no Bedrock: Metade do Preço Se Você Puder Esperar
A inferência em lote do Bedrock roda a 50% do preço sob demanda. O único custo é latência. Para um job sem ninguém esperando, essa troca é dinheiro de graça.
Apps LLM Multi-Tenant: Isolando Clientes em um Modelo Compartilhado
Um modelo Bedrock compartilhado, muitos clientes. Sem estado no modelo, isolamento é seu trabalho: delimite busca, limite cota, carregue identidade certa.
Saída Estruturada Vence o Parsing Esperto
Ainda extrai JSON do texto do modelo com regex? Pare. Saídas estruturadas do Bedrock aplicam um JSON Schema na decodificação, então a resposta já nasce válida.
Cache de Prompt no Bedrock: O Desconto de 90% Que a Maioria dos Times Ignora
O cache de prompt do Bedrock lê um prefixo repetido com cerca de 90% de desconto, mas escrever no cache custa mais. O breakpoint decide o resultado.
AWS Mensal (Mar '26): A Governança Chega para os Agentes
Março de 2026 na AWS: AgentCore Policy e Evaluations chegam ao GA, o Elemental Inference é lançado, e a governança de agentes vira control plane de produção.
Respostas em Streaming São uma Decisão de UX, Não de Performance
Streaming de respostas é uma escolha de UX sobre time to first token, não correção de velocidade. Às vezes piora output estruturado e uso de ferramentas.
Bedrock Agents vs Construir Seu Próprio Loop
Bedrock Agents cuida de orquestração, memória e chamadas de ferramenta por você. Veja quando o framework gerenciado poupa trabalho e quando ele te domina.
Pare de Fazer Fine-Tuning. Você Precisa de RAG, Cache e Prompts Melhores
Fine-tuning mais provisioned throughput é a resposta cara para a maioria dos problemas de LLM. O caminho barato é retrieval, prompt caching e prompts melhores.
O Chunking da Knowledge Base É Onde a Qualidade do Seu RAG Morre
A maioria das respostas ruins de RAG é problema de retrieval, não de modelo. Chunking fixo, semântico ou hierárquico nas Knowledge Bases define a qualidade.
Bedrock Guardrails Não Vai Te Salvar de Prompt Injection
Amazon Bedrock Guardrails filtra conteúdo, não autoriza ações. A defesa contra prompt injection é isolar input, allowlist de ferramentas e escopo de IAM.