Amazon Bedrock

Filed under

26 posts

Suivi des coûts Bedrock par application avec les profils d'inférence

Les profils d'inférence applicatifs posent des tags d'allocation de coûts sur les appels Bedrock, transformant une facture unique en lignes par équipe.

Jul 10, 2026 6 min

AI Act européen, le 2 août : l'échéance qui n'a pas bougé

L'Omnibus numérique a reporté les échéances à haut risque à 2027 et 2028. L'Article 50 sur la transparence s'applique toujours au 2 août 2026, sans changement.

Jul 08, 2026 8 min

SageMaker vs Bedrock : une décision d'organisation, pas technique

Le choix entre SageMaker et Bedrock dépend surtout de si votre organisation a une équipe qui possède des modèles. Choisissez selon votre topologie réelle.

Jul 06, 2026 7 min

Injection de prompt via vos propres documents : la surface d'attaque du RAG

Votre base de connaissances est une entrée non fiable. Le retrieval transmet au modèle du texte écrit par l'attaquant, d'où l'intérêt de scanner à l'ingestion.

Jul 04, 2026 7 min

AWS Monthly (juin 26) : les agents obtiennent une boucle de rétroaction

Juin 2026 chez AWS : le Summit de New York a transformé les traces de production en amélioration d'agents, et AgentCore a atteint la disponibilité générale.

Jun 30, 2026 7 min

La vraie limite de votre système multi-agent, ce sont les tokens par minute

Amazon Bedrock expose des quotas de tokens par minute par modèle dans Service Quotas. Le TPM est le plafond de scaling des agents : prévoyez avant les 429.

Jun 21, 2026 7 min

La fenêtre de contexte n'est pas votre amie

Une fenêtre de contexte énorme ne remplace pas la recherche documentaire. Le rappel se dégrade avec la taille du prompt et le milieu du texte est survolé.

Jun 03, 2026 6 min

AWS Monthly (mai '26) : les agents reçoivent un portefeuille

Mai 2026 chez AWS : AgentCore Payments laisse les agents transiger, et l'Agent Toolkit for AWS plus un serveur MCP managé en GA durcissent la chaîne d'outils.

May 31, 2026 4 min

Quand Haiku bat Opus : le bon dimensionnement de modèle sur Bedrock

Router chaque appel vers Opus par défaut fait exploser la facture. Répartissez par classe de tâche : Haiku pour la majorité mécanique, Opus en escalade.

May 22, 2026 5 min

Le RAG agentique, c'est surtout de la latence dont vous n'avez pas besoin

Le RAG agentique boucle sur des sauts de récupération, chacun un aller-retour modèle. Une bonne requête suffit souvent : réservez la boucle aux vrais cas.

May 18, 2026 5 min

Les évals avant les agents : on ne livre pas ce qu'on ne peut pas noter

Sans harnais d'évaluation, chaque changement d'agent est un test au feeling. Construisez le tableau de score avant l'agent, traitez le LLM-juge comme faillible.

May 14, 2026 5 min

Cache sémantique : deux questions différentes, une seule réponse

Un cache sémantique renvoie une réponse stockée à deux questions différentes. Il réduit coût et latence, mais un faux hit sert une réponse fausse en confiance.

May 11, 2026 5 min

Passerelles LLM : pourquoi chaque équipe plateforme finit par en construire une

Une deuxième équipe qui appelle un modèle crée un fan-out non gouverné. Une passerelle LLM centralise auth, quota, routage et audit d'un seul endroit.

May 04, 2026 6 min

AWS Mensuel (avr. 26) : OpenAI débarque sur Bedrock

Avril 2026 sur AWS : modèles OpenAI, Codex et Managed Agents arrivent sur Bedrock, AgentCore ajoute un harness géré et une CLI pour raccourcir le chemin agent.

Apr 30, 2026 4 min

Inférence inter-régions : résilience bon marché ou piège de résidence des données ?

L'inférence inter-régions Bedrock lisse le débit et le throttling. Un profil global peut router le prompt hors géographie. Vérifiez la résidence des données.

Apr 26, 2026 4 min

Votre facture LLM est un problème d'observabilité

Une facture Bedrock surprenante n'est pas un problème de tarification, c'est un problème de visibilité. Sans attribuer les tokens, impossible de la gérer.

Apr 21, 2026 5 min

L'inférence par lots sur Bedrock : demi-tarif si vous pouvez attendre

L'inférence par lots Amazon Bedrock tourne à 50 % du tarif à la demande. Le seul coût est la latence, gratuite pour tout job sans personne qui attend.

Apr 17, 2026 5 min

Applications LLM multi-tenant : isoler les clients sur un modèle partagé

Un modèle Bedrock partagé, plusieurs clients. Le modèle est sans état, l'isolation est votre travail : scoper la récupération, plafonner le quota par tenant.

Apr 13, 2026 5 min

La sortie structurée bat le parsing astucieux

Vous parsez encore du JSON dans du texte modèle avec des regex ? Les sorties structurées Bedrock imposent un JSON Schema : réponse valide par construction.

Apr 06, 2026 5 min

Le Prompt Caching sur Bedrock : la remise de 90 % que la plupart des équipes ignorent

Le prompt caching Bedrock lit un préfixe répété à 90 % de réduction, mais une écriture en cache coûte plus cher qu'un appel sans cache. Le breakpoint décide.

Apr 02, 2026 6 min

AWS Monthly (mars 26) : la gouvernance rattrape les agents

Mars 2026 sur AWS : AgentCore Policy et Evaluations en disponibilité générale, Elemental Inference lancé, gouvernance d'agents en plan de contrôle production.

Mar 31, 2026 5 min

Le streaming des réponses est une décision d'UX, pas de performance

Diffuser les réponses en streaming est un choix UX sur le temps jusqu'au premier token, pas un correctif de vitesse. Cela peut dégrader la sortie structurée.

Mar 24, 2026 5 min

Bedrock Agents contre votre propre boucle maison

Amazon Bedrock Agents gère l'orchestration, la mémoire et les appels d'outils. Voici quand ce framework managé fait gagner du temps, et quand il vous limite.

Mar 18, 2026 5 min

Arrêtez le fine-tuning. Vous avez besoin de RAG, d'un cache et de meilleurs prompts

Fine-tuning et Provisioned Throughput coûtent cher pour la plupart des problèmes LLM. Le chemin moins cher : récupération, cache de prompt, meilleurs prompts.

Mar 09, 2026 5 min

Le découpage en chunks de la base de connaissances, c'est là que meurt la qualité de votre RAG

La plupart des mauvaises réponses RAG sont un problème de récupération, pas de modèle. Le découpage détermine la qualité des Bedrock Knowledge Bases.

Mar 05, 2026 6 min

Bedrock Guardrails ne vous protégera pas de l'injection de prompt

Amazon Bedrock Guardrails filtre le contenu, pas les actions. La défense contre l'injection de prompt : isolation des entrées, allowlists d'outils, scoping IAM.

Mar 03, 2026 6 min