Amazon Bedrock
Filed under
Suivi des coûts Bedrock par application avec les profils d'inférence
Les profils d'inférence applicatifs posent des tags d'allocation de coûts sur les appels Bedrock, transformant une facture unique en lignes par équipe.
AI Act européen, le 2 août : l'échéance qui n'a pas bougé
L'Omnibus numérique a reporté les échéances à haut risque à 2027 et 2028. L'Article 50 sur la transparence s'applique toujours au 2 août 2026, sans changement.
SageMaker vs Bedrock : une décision d'organisation, pas technique
Le choix entre SageMaker et Bedrock dépend surtout de si votre organisation a une équipe qui possède des modèles. Choisissez selon votre topologie réelle.
Injection de prompt via vos propres documents : la surface d'attaque du RAG
Votre base de connaissances est une entrée non fiable. Le retrieval transmet au modèle du texte écrit par l'attaquant, d'où l'intérêt de scanner à l'ingestion.
AWS Monthly (juin 26) : les agents obtiennent une boucle de rétroaction
Juin 2026 chez AWS : le Summit de New York a transformé les traces de production en amélioration d'agents, et AgentCore a atteint la disponibilité générale.
La vraie limite de votre système multi-agent, ce sont les tokens par minute
Amazon Bedrock expose des quotas de tokens par minute par modèle dans Service Quotas. Le TPM est le plafond de scaling des agents : prévoyez avant les 429.
La fenêtre de contexte n'est pas votre amie
Une fenêtre de contexte énorme ne remplace pas la recherche documentaire. Le rappel se dégrade avec la taille du prompt et le milieu du texte est survolé.
AWS Monthly (mai '26) : les agents reçoivent un portefeuille
Mai 2026 chez AWS : AgentCore Payments laisse les agents transiger, et l'Agent Toolkit for AWS plus un serveur MCP managé en GA durcissent la chaîne d'outils.
Quand Haiku bat Opus : le bon dimensionnement de modèle sur Bedrock
Router chaque appel vers Opus par défaut fait exploser la facture. Répartissez par classe de tâche : Haiku pour la majorité mécanique, Opus en escalade.
Le RAG agentique, c'est surtout de la latence dont vous n'avez pas besoin
Le RAG agentique boucle sur des sauts de récupération, chacun un aller-retour modèle. Une bonne requête suffit souvent : réservez la boucle aux vrais cas.
Les évals avant les agents : on ne livre pas ce qu'on ne peut pas noter
Sans harnais d'évaluation, chaque changement d'agent est un test au feeling. Construisez le tableau de score avant l'agent, traitez le LLM-juge comme faillible.
Cache sémantique : deux questions différentes, une seule réponse
Un cache sémantique renvoie une réponse stockée à deux questions différentes. Il réduit coût et latence, mais un faux hit sert une réponse fausse en confiance.
Passerelles LLM : pourquoi chaque équipe plateforme finit par en construire une
Une deuxième équipe qui appelle un modèle crée un fan-out non gouverné. Une passerelle LLM centralise auth, quota, routage et audit d'un seul endroit.
AWS Mensuel (avr. 26) : OpenAI débarque sur Bedrock
Avril 2026 sur AWS : modèles OpenAI, Codex et Managed Agents arrivent sur Bedrock, AgentCore ajoute un harness géré et une CLI pour raccourcir le chemin agent.
Inférence inter-régions : résilience bon marché ou piège de résidence des données ?
L'inférence inter-régions Bedrock lisse le débit et le throttling. Un profil global peut router le prompt hors géographie. Vérifiez la résidence des données.
Votre facture LLM est un problème d'observabilité
Une facture Bedrock surprenante n'est pas un problème de tarification, c'est un problème de visibilité. Sans attribuer les tokens, impossible de la gérer.
L'inférence par lots sur Bedrock : demi-tarif si vous pouvez attendre
L'inférence par lots Amazon Bedrock tourne à 50 % du tarif à la demande. Le seul coût est la latence, gratuite pour tout job sans personne qui attend.
Applications LLM multi-tenant : isoler les clients sur un modèle partagé
Un modèle Bedrock partagé, plusieurs clients. Le modèle est sans état, l'isolation est votre travail : scoper la récupération, plafonner le quota par tenant.
La sortie structurée bat le parsing astucieux
Vous parsez encore du JSON dans du texte modèle avec des regex ? Les sorties structurées Bedrock imposent un JSON Schema : réponse valide par construction.
Le Prompt Caching sur Bedrock : la remise de 90 % que la plupart des équipes ignorent
Le prompt caching Bedrock lit un préfixe répété à 90 % de réduction, mais une écriture en cache coûte plus cher qu'un appel sans cache. Le breakpoint décide.
AWS Monthly (mars 26) : la gouvernance rattrape les agents
Mars 2026 sur AWS : AgentCore Policy et Evaluations en disponibilité générale, Elemental Inference lancé, gouvernance d'agents en plan de contrôle production.
Le streaming des réponses est une décision d'UX, pas de performance
Diffuser les réponses en streaming est un choix UX sur le temps jusqu'au premier token, pas un correctif de vitesse. Cela peut dégrader la sortie structurée.
Bedrock Agents contre votre propre boucle maison
Amazon Bedrock Agents gère l'orchestration, la mémoire et les appels d'outils. Voici quand ce framework managé fait gagner du temps, et quand il vous limite.
Arrêtez le fine-tuning. Vous avez besoin de RAG, d'un cache et de meilleurs prompts
Fine-tuning et Provisioned Throughput coûtent cher pour la plupart des problèmes LLM. Le chemin moins cher : récupération, cache de prompt, meilleurs prompts.
Le découpage en chunks de la base de connaissances, c'est là que meurt la qualité de votre RAG
La plupart des mauvaises réponses RAG sont un problème de récupération, pas de modèle. Le découpage détermine la qualité des Bedrock Knowledge Bases.
Bedrock Guardrails ne vous protégera pas de l'injection de prompt
Amazon Bedrock Guardrails filtre le contenu, pas les actions. La défense contre l'injection de prompt : isolation des entrées, allowlists d'outils, scoping IAM.