Amazon Bedrock

Filed under

26 posts

Tracciamento dei Costi Bedrock per App con gli Inference Profile

Gli application inference profile aggiungono tag di allocazione costi alle chiamate Bedrock, trasformando una bolletta condivisa in voci per team.

Jul 10, 2026 6 min

EU AI Act, 2 Agosto: La Scadenza Che Non È Cambiata

Il Digital Omnibus ha rinviato le scadenze per i sistemi ad alto rischio al 2027 e al 2028. La trasparenza dell'Articolo 50 resta fissata al 2 agosto 2026.

Jul 08, 2026 7 min

SageMaker vs Bedrock: Una Decisione Organizzativa, Non Tecnica

La scelta tra SageMaker e Bedrock dipende da chi possiede i modelli nella tua organizzazione. Scegli in base alla topologia di team reale, non alla slide.

Jul 06, 2026 6 min

Prompt Injection Tramite i Tuoi Documenti: La Superficie d'Attacco RAG

La tua knowledge base è input non fidato: il retrieval consegna al modello testo scritto da un attaccante, quindi conviene scansionare in fase di ingestione.

Jul 04, 2026 7 min

AWS Monthly (Giu '26): Gli Agenti Ricevono un Loop di Feedback

Giugno 2026 su AWS: al Summit di New York le tracce di produzione migliorano gli agenti, arriva Continuum per la sicurezza, e l'harness AgentCore va in GA.

Jun 30, 2026 7 min

Il vero limite del tuo sistema multi-agente sono i token al minuto

Amazon Bedrock espone ora in Service Quotas le quote di token al minuto per modello: per gli agent è il vero soffitto di scalabilità. Pianificalo prima dei 429.

Jun 21, 2026 7 min

La Finestra di Contesto Non È Tua Amica

Una finestra di contesto enorme non sostituisce il retrieval. Il recall peggiora con la lunghezza, il costo cresce a ogni token, il centro viene ignorato.

Jun 03, 2026 6 min

AWS Monthly (Mag '26): Gli Agenti Ricevono un Portafoglio

Maggio 2026 su AWS: AgentCore Payments fa transare gli agenti, e l'Agent Toolkit for AWS più un server MCP gestito in GA irrobustiscono il toolchain.

May 31, 2026 4 min

Quando Haiku Batte Opus: Model Right-Sizing su Bedrock

Puntare su Opus per ogni chiamata gonfia la bolletta LLM. Instrada per classe di task: Haiku per la maggioranza meccanica, Opus come escalation.

May 22, 2026 5 min

Agentic RAG È per lo Più Latenza Che Non Ti Serve

Agentic RAG passa in loop tra hop di retrieval, ognuno un round trip al modello. Per la maggior parte delle domande basta una query, usa il loop se conviene.

May 18, 2026 5 min

Evals Prima Degli Agenti: Non Puoi Rilasciare Ciò Che Non Puoi Misurare

Senza un eval harness, ogni modifica a un agente è un vibe check. Costruisci il tabellone prima dell'agente, e tratta l'LLM-as-judge come fallibile.

May 14, 2026 5 min

Semantic Caching: Due Domande Diverse, Una Risposta

La semantic cache dà una risposta salvata a due domande diverse. Riduce costi e latenza, ma un falso hit restituisce una risposta sbagliata con sicurezza.

May 11, 2026 5 min

Gateway LLM: Perché Ogni Platform Team Ne Costruisce Uno, Prima o Poi

Un secondo team che chiama un modello significa fan-out non governato. Un gateway LLM centralizza auth, quota, routing e audit. Build vs LiteLLM vs API Gateway.

May 04, 2026 6 min

AWS Mensile (Apr '26): OpenAI arriva su Bedrock

Aprile 2026 su AWS: i modelli OpenAI, Codex e Managed Agents arrivano su Bedrock, e AgentCore aggiunge un harness gestito e una CLI verso un agente.

Apr 30, 2026 4 min

Inferenza cross-region: resilienza a basso costo o trappola di residenza?

L'inferenza cross-region di Bedrock livella throughput e throttling, ma un profilo globale può instradare il prompt fuori dalla sua geografia.

Apr 26, 2026 4 min

La tua bolletta LLM è un problema di osservabilità

Una bolletta Bedrock sorprendente non è un problema di prezzo, è di visibilità. Se non attribuisci i token a feature, tenant o agente, non puoi gestirla.

Apr 21, 2026 5 min

Batch Inference su Bedrock: metà prezzo se puoi aspettare

La batch inference di Amazon Bedrock costa il 50% del prezzo on-demand. L'unico costo è la latenza. Per ogni job dove nessuno aspetta, è denaro gratis.

Apr 17, 2026 5 min

App LLM multi-tenant: isolare i clienti su un modello condiviso

Un modello Bedrock condiviso, molti clienti. Il modello è stateless: l'isolamento tocca a te, delimita il retrieval, la quota e l'identità per tenant.

Apr 13, 2026 5 min

L'output strutturato batte il parsing ingegnoso

Estrai ancora JSON dal testo del modello con una regex? Smetti. Gli structured output di Bedrock impongono uno JSON Schema in decodifica: risposta valida.

Apr 06, 2026 5 min

Prompt Caching su Bedrock: lo sconto del 90% che quasi tutti ignorano

Il prompt caching di Bedrock legge un prefisso ripetuto con uno sconto del 90%, ma scrivere in cache costa più di una chiamata normale: decide il breakpoint.

Apr 02, 2026 5 min

AWS Mensile (Mar '26): La Governance Arriva per gli Agenti

Marzo 2026 su AWS: AgentCore Policy ed Evaluations raggiungono la GA, Elemental Inference viene lanciato, e la governance degli agenti arriva in produzione.

Mar 31, 2026 4 min

Le Risposte in Streaming Sono una Decisione UX, Non di Performance

Lo streaming delle risposte è una scelta UX sul time to first token, non una correzione di velocità. A volte peggiora output strutturati e uso dei tool.

Mar 24, 2026 5 min

Bedrock Agents vs Costruire il Proprio Loop

Amazon Bedrock Agents gestisce orchestrazione, memoria e chiamate ai tool per te. Quando il framework gestito risparmia lavoro vero e quando ti possiede.

Mar 18, 2026 5 min

Smetti di Fare Fine-Tuning. Ti Servono RAG, una Cache e Prompt Migliori

Fine-tuning più provisioned throughput è la risposta costosa ai problemi con gli LLM. Il percorso economico è retrieval, prompt caching e prompt migliori.

Mar 09, 2026 5 min

Il Chunking della Knowledge Base È Dove Muore la Qualità del Tuo RAG

La maggior parte delle risposte RAG sbagliate è un problema di retrieval, non del modello. Il chunking nelle Knowledge Bases decide la qualità del retrieval.

Mar 05, 2026 5 min

Bedrock Guardrails Non Ti Salva Dal Prompt Injection

Amazon Bedrock Guardrails filtra i contenuti, non autorizza azioni: la difesa reale dal prompt injection è isolamento input, allowlist tool e scoping IAM.

Mar 03, 2026 5 min