Amazon Bedrock
Filed under
Tracciamento dei Costi Bedrock per App con gli Inference Profile
Gli application inference profile aggiungono tag di allocazione costi alle chiamate Bedrock, trasformando una bolletta condivisa in voci per team.
EU AI Act, 2 Agosto: La Scadenza Che Non È Cambiata
Il Digital Omnibus ha rinviato le scadenze per i sistemi ad alto rischio al 2027 e al 2028. La trasparenza dell'Articolo 50 resta fissata al 2 agosto 2026.
SageMaker vs Bedrock: Una Decisione Organizzativa, Non Tecnica
La scelta tra SageMaker e Bedrock dipende da chi possiede i modelli nella tua organizzazione. Scegli in base alla topologia di team reale, non alla slide.
Prompt Injection Tramite i Tuoi Documenti: La Superficie d'Attacco RAG
La tua knowledge base è input non fidato: il retrieval consegna al modello testo scritto da un attaccante, quindi conviene scansionare in fase di ingestione.
AWS Monthly (Giu '26): Gli Agenti Ricevono un Loop di Feedback
Giugno 2026 su AWS: al Summit di New York le tracce di produzione migliorano gli agenti, arriva Continuum per la sicurezza, e l'harness AgentCore va in GA.
Il vero limite del tuo sistema multi-agente sono i token al minuto
Amazon Bedrock espone ora in Service Quotas le quote di token al minuto per modello: per gli agent è il vero soffitto di scalabilità. Pianificalo prima dei 429.
La Finestra di Contesto Non È Tua Amica
Una finestra di contesto enorme non sostituisce il retrieval. Il recall peggiora con la lunghezza, il costo cresce a ogni token, il centro viene ignorato.
AWS Monthly (Mag '26): Gli Agenti Ricevono un Portafoglio
Maggio 2026 su AWS: AgentCore Payments fa transare gli agenti, e l'Agent Toolkit for AWS più un server MCP gestito in GA irrobustiscono il toolchain.
Quando Haiku Batte Opus: Model Right-Sizing su Bedrock
Puntare su Opus per ogni chiamata gonfia la bolletta LLM. Instrada per classe di task: Haiku per la maggioranza meccanica, Opus come escalation.
Agentic RAG È per lo Più Latenza Che Non Ti Serve
Agentic RAG passa in loop tra hop di retrieval, ognuno un round trip al modello. Per la maggior parte delle domande basta una query, usa il loop se conviene.
Evals Prima Degli Agenti: Non Puoi Rilasciare Ciò Che Non Puoi Misurare
Senza un eval harness, ogni modifica a un agente è un vibe check. Costruisci il tabellone prima dell'agente, e tratta l'LLM-as-judge come fallibile.
Semantic Caching: Due Domande Diverse, Una Risposta
La semantic cache dà una risposta salvata a due domande diverse. Riduce costi e latenza, ma un falso hit restituisce una risposta sbagliata con sicurezza.
Gateway LLM: Perché Ogni Platform Team Ne Costruisce Uno, Prima o Poi
Un secondo team che chiama un modello significa fan-out non governato. Un gateway LLM centralizza auth, quota, routing e audit. Build vs LiteLLM vs API Gateway.
AWS Mensile (Apr '26): OpenAI arriva su Bedrock
Aprile 2026 su AWS: i modelli OpenAI, Codex e Managed Agents arrivano su Bedrock, e AgentCore aggiunge un harness gestito e una CLI verso un agente.
Inferenza cross-region: resilienza a basso costo o trappola di residenza?
L'inferenza cross-region di Bedrock livella throughput e throttling, ma un profilo globale può instradare il prompt fuori dalla sua geografia.
La tua bolletta LLM è un problema di osservabilità
Una bolletta Bedrock sorprendente non è un problema di prezzo, è di visibilità. Se non attribuisci i token a feature, tenant o agente, non puoi gestirla.
Batch Inference su Bedrock: metà prezzo se puoi aspettare
La batch inference di Amazon Bedrock costa il 50% del prezzo on-demand. L'unico costo è la latenza. Per ogni job dove nessuno aspetta, è denaro gratis.
App LLM multi-tenant: isolare i clienti su un modello condiviso
Un modello Bedrock condiviso, molti clienti. Il modello è stateless: l'isolamento tocca a te, delimita il retrieval, la quota e l'identità per tenant.
L'output strutturato batte il parsing ingegnoso
Estrai ancora JSON dal testo del modello con una regex? Smetti. Gli structured output di Bedrock impongono uno JSON Schema in decodifica: risposta valida.
Prompt Caching su Bedrock: lo sconto del 90% che quasi tutti ignorano
Il prompt caching di Bedrock legge un prefisso ripetuto con uno sconto del 90%, ma scrivere in cache costa più di una chiamata normale: decide il breakpoint.
AWS Mensile (Mar '26): La Governance Arriva per gli Agenti
Marzo 2026 su AWS: AgentCore Policy ed Evaluations raggiungono la GA, Elemental Inference viene lanciato, e la governance degli agenti arriva in produzione.
Le Risposte in Streaming Sono una Decisione UX, Non di Performance
Lo streaming delle risposte è una scelta UX sul time to first token, non una correzione di velocità. A volte peggiora output strutturati e uso dei tool.
Bedrock Agents vs Costruire il Proprio Loop
Amazon Bedrock Agents gestisce orchestrazione, memoria e chiamate ai tool per te. Quando il framework gestito risparmia lavoro vero e quando ti possiede.
Smetti di Fare Fine-Tuning. Ti Servono RAG, una Cache e Prompt Migliori
Fine-tuning più provisioned throughput è la risposta costosa ai problemi con gli LLM. Il percorso economico è retrieval, prompt caching e prompt migliori.
Il Chunking della Knowledge Base È Dove Muore la Qualità del Tuo RAG
La maggior parte delle risposte RAG sbagliate è un problema di retrieval, non del modello. Il chunking nelle Knowledge Bases decide la qualità del retrieval.
Bedrock Guardrails Non Ti Salva Dal Prompt Injection
Amazon Bedrock Guardrails filtra i contenuti, non autorizza azioni: la difesa reale dal prompt injection è isolamento input, allowlist tool e scoping IAM.