Amazon Bedrock

Filed under

26 posts

Rastreamento de Custo do Bedrock por Aplicação com Inference Profiles

Inference profiles colocam tags de custo nas chamadas do Bedrock, transformando uma fatura única em linhas por time. O design das tags é a parte difícil.

Jul 10, 2026 6 min

AI Act da UE, 2 de Agosto: O Prazo Que Não Mudou

O Digital Omnibus adiou os prazos de alto risco para 2027 e 2028. A transparência do Artigo 50 segue valendo em 2 de agosto de 2026, o prazo que pega a maioria.

Jul 08, 2026 8 min

SageMaker vs Bedrock: Uma Decisão Organizacional, Não Técnica

A escolha entre SageMaker e Bedrock é, na verdade, sobre se sua organização tem um time dono de modelos. Escolha pela topologia que você tem, não a do slide.

Jul 06, 2026 7 min

Injeção de Prompt via Seus Próprios Documentos: A Superfície de Ataque do RAG

Sua base de conhecimento é entrada não confiável. A recuperação entrega texto de atacantes ao modelo, então o controle que compensa é escanear na ingestão.

Jul 04, 2026 7 min

AWS Mensal (Junho de 26): Agentes Ganham um Loop de Feedback

Junho de 2026 na AWS: o Summit em Nova York transformou traces de produção em melhoria de agentes, lançou o Continuum de segurança e levou o AgentCore ao GA.

Jun 30, 2026 7 min

O Limite Real do Seu Sistema Multi-Agente é Tokens Por Minuto

O Amazon Bedrock agora expõe quotas de tokens por minuto por modelo no Service Quotas. Para agents, TPM é o teto real de escala. Planeje antes dos 429s.

Jun 21, 2026 7 min

A Janela de Contexto Não É Sua Amiga

Uma janela de contexto enorme não substitui a recuperação. A precisão cai conforme o prompt cresce, o custo escala a cada token e o meio é ignorado.

Jun 03, 2026 6 min

AWS Mensal (Mai/26): Agentes Ganham uma Carteira

Maio de 2026 na AWS: AgentCore Payments permite que agentes transacionem, e o Agent Toolkit for AWS mais um servidor MCP gerenciado GA reforçam o ferramental.

May 31, 2026 4 min

Quando o Haiku Vence o Opus: Right-Sizing de Modelos no Bedrock

Usar Opus como default em toda chamada é como as contas de LLM estouram. Roteie por classe de tarefa: Haiku para o mecânico, Opus como caminho de escalonamento.

May 22, 2026 5 min

RAG Agêntico É, Na Maior Parte, Latência Que Você Não Precisa

RAG agêntico faz loop por saltos de retrieval, cada um ida e volta ao modelo. Para a maioria das perguntas, boa query basta. Use o loop só se valer a latência.

May 18, 2026 5 min

Evals Antes de Agentes: Você Não Pode Lançar o Que Não Consegue Pontuar

Sem um harness de eval, toda mudança em um agente é um vibe check. Construa o placar antes do agente, e trate o LLM-as-judge como um componente que pode errar.

May 14, 2026 5 min

Cache Semântico: Duas Perguntas Diferentes, Uma Resposta

Cache semântico retorna resposta salva para perguntas formuladas de forma diferente. Reduz custo e latência, mas falso hit serve resposta errada com confiança.

May 11, 2026 5 min

LLM Gateways: Por Que Todo Time de Plataforma Acaba Construindo Um

Um segundo time chamando um modelo é fan-out sem governança. Um LLM gateway centraliza auth, quota, roteamento e auditoria: build vs LiteLLM vs API Gateway.

May 04, 2026 6 min

AWS Mensal (Abr '26): OpenAI Chega ao Bedrock

Abril de 2026 na AWS: modelos OpenAI, Codex e Managed Agents chegam ao Bedrock, e o AgentCore ganha harness gerenciado e CLI que encurtam o caminho a um agente.

Apr 30, 2026 4 min

Inferência Cross-Region: Resiliência Barata ou Armadilha de Residência?

A inferência cross-region do Bedrock suaviza vazão e throttling. Mas um perfil global pode rotear seu prompt para fora da geografia. Verifique residência antes.

Apr 26, 2026 4 min

Sua Conta de LLM É um Problema de Observabilidade

Uma conta surpreendente do Bedrock não é problema de preço, é visibilidade. Se você não atribui tokens a recurso, cliente ou agente, não consegue gerenciá-los.

Apr 21, 2026 5 min

Inferência em Lote no Bedrock: Metade do Preço Se Você Puder Esperar

A inferência em lote do Bedrock roda a 50% do preço sob demanda. O único custo é latência. Para um job sem ninguém esperando, essa troca é dinheiro de graça.

Apr 17, 2026 5 min

Apps LLM Multi-Tenant: Isolando Clientes em um Modelo Compartilhado

Um modelo Bedrock compartilhado, muitos clientes. Sem estado no modelo, isolamento é seu trabalho: delimite busca, limite cota, carregue identidade certa.

Apr 13, 2026 5 min

Saída Estruturada Vence o Parsing Esperto

Ainda extrai JSON do texto do modelo com regex? Pare. Saídas estruturadas do Bedrock aplicam um JSON Schema na decodificação, então a resposta já nasce válida.

Apr 06, 2026 5 min

Cache de Prompt no Bedrock: O Desconto de 90% Que a Maioria dos Times Ignora

O cache de prompt do Bedrock lê um prefixo repetido com cerca de 90% de desconto, mas escrever no cache custa mais. O breakpoint decide o resultado.

Apr 02, 2026 5 min

AWS Mensal (Mar '26): A Governança Chega para os Agentes

Março de 2026 na AWS: AgentCore Policy e Evaluations chegam ao GA, o Elemental Inference é lançado, e a governança de agentes vira control plane de produção.

Mar 31, 2026 4 min

Respostas em Streaming São uma Decisão de UX, Não de Performance

Streaming de respostas é uma escolha de UX sobre time to first token, não correção de velocidade. Às vezes piora output estruturado e uso de ferramentas.

Mar 24, 2026 5 min

Bedrock Agents vs Construir Seu Próprio Loop

Bedrock Agents cuida de orquestração, memória e chamadas de ferramenta por você. Veja quando o framework gerenciado poupa trabalho e quando ele te domina.

Mar 18, 2026 5 min

Pare de Fazer Fine-Tuning. Você Precisa de RAG, Cache e Prompts Melhores

Fine-tuning mais provisioned throughput é a resposta cara para a maioria dos problemas de LLM. O caminho barato é retrieval, prompt caching e prompts melhores.

Mar 09, 2026 5 min

O Chunking da Knowledge Base É Onde a Qualidade do Seu RAG Morre

A maioria das respostas ruins de RAG é problema de retrieval, não de modelo. Chunking fixo, semântico ou hierárquico nas Knowledge Bases define a qualidade.

Mar 05, 2026 5 min

Bedrock Guardrails Não Vai Te Salvar de Prompt Injection

Amazon Bedrock Guardrails filtra conteúdo, não autoriza ações. A defesa contra prompt injection é isolar input, allowlist de ferramentas e escopo de IAM.

Mar 03, 2026 6 min