Amazon Bedrock
Filed under
Bedrock-Kostenverfolgung pro App mit Inference Profiles
Application Inference Profiles versehen Bedrock-Aufrufe mit Kosten-Tags und machen aus einer Rechnung Zeilen pro Team. Das Tag-Design ist der harte Teil.
EU AI Act, 2. August: Die Frist, die sich nicht verschoben hat
Das Digital Omnibus verschob die Hochrisiko-Fristen auf 2027 und 2028. Artikel 50 gilt weiter ab 2. August 2026 und trifft die meisten Teams.
SageMaker vs. Bedrock: Eine Organisationsentscheidung, keine technische
Die Frage SageMaker oder Bedrock dreht sich darum, ob Ihre Organisation ein Team hat, das Modelle verantwortet. Entscheiden Sie nach der echten Teamtopologie.
Prompt Injection über die eigene Doku: Die RAG-Angriffsfläche
Ihre Wissensdatenbank ist nicht vertrauenswürdig. Retrieval liefert dem Modell von Angreifern verfassten Text, daher lohnt sich Scannen beim Ingest.
AWS Monthly (Juni '26): Agenten bekommen eine Feedback-Schleife
Juni 2026 bei AWS: Der Summit in New York verwandelte Produktions-Traces in Agenten-Verbesserung, brachte Continuum für Security und die Harness zur GA.
Das echte Limit Ihres Multi-Agent-Systems sind Tokens pro Minute
Amazon Bedrock zeigt jetzt Tokens-pro-Minute-Quotas pro Modell in Service Quotas. Für Agenten ist TPM die echte Skalierungsgrenze, planen Sie rechtzeitig.
Das Kontextfenster ist nicht dein Freund
Ein riesiges Kontextfenster ersetzt kein Retrieval: Die Trefferquote sinkt mit wachsendem Prompt, jeder Token kostet, und die Mitte wird nur überflogen.
AWS Monthly (Mai '26): Agenten bekommen eine Geldbörse
Mai 2026 bei AWS: AgentCore Payments lässt Agenten Transaktionen ausführen, das Agent Toolkit for AWS und ein GA-MCP-Server härten die Toolchain dahinter.
Wenn Haiku Opus schlägt: Model Right-Sizing auf Bedrock
Jeden Aufruf standardmäßig an Opus zu schicken, lässt die LLM-Rechnung explodieren. Nach Aufgabenklasse routen: Haiku für die Mehrheit, Opus nur zur Eskalation.
Agentic RAG ist meistens Latenz, die man nicht braucht
Agentic RAG durchläuft Retrieval-Hops, jeder ein Modell-Roundtrip. Bei den meisten Fragen gewinnt eine gute Query, die Schleife lohnt sich selten.
Evals vor Agenten: Man kann nicht ausliefern, was man nicht bewerten kann
Ohne Eval-Harness ist jede Änderung am Agenten ein Bauchgefühl-Check. Erst die Anzeigetafel bauen, dann den Agenten, und den LLM-Judge als fehlbar behandeln.
Semantic Caching: Zwei verschiedene Fragen, eine Antwort
Semantic Caching liefert eine gespeicherte Antwort für ähnlich formulierte Fragen. Das senkt Kosten und Latenz, ein False Hit liefert die falsche Antwort.
LLM-Gateways: Warum jedes Platform-Team irgendwann eines baut
Ruft ein zweites Team ein Modell auf, entsteht unkontrollierter Fan-out. Ein LLM-Gateway bündelt Auth, Quota, Routing und Audit: Eigenbau, LiteLLM, API Gateway.
AWS Monatsrückblick (Apr '26): OpenAI landet auf Bedrock
April 2026 auf AWS: OpenAI-Modelle, Codex und Managed Agents kommen zu Bedrock, und AgentCore bekommt ein verwaltetes Harness plus CLI für den Weg zum Agenten.
Cross-Region Inference: Günstige Resilienz oder Residency-Falle?
Bedrock Cross-Region Inference glättet Durchsatz und Throttling, aber ein globales Profil kann den Prompt aus seiner Geografie routen. Erst Residency prüfen.
Eure LLM-Rechnung ist ein Observability-Problem
Eine überraschende Bedrock-Rechnung ist kein Preisproblem, sondern ein Sichtbarkeitsproblem. Ohne Zuordnung von Tokens zu Feature fehlt die Kontrolle.
Batch Inference auf Bedrock: Halber Preis, wenn ihr warten könnt
Amazon Bedrock Batch Inference läuft zu 50 Prozent des On-Demand-Preises. Die einzigen Kosten sind Latenz. Wo niemand wartet, ist der Tausch geschenktes Geld.
Multi-Tenant-LLM-Apps: Kunden auf einem gemeinsam genutzten Modell isolieren
Ein gemeinsames Bedrock-Modell, viele Kunden. Das Modell ist zustandslos, Isolation ist eure Aufgabe: Retrieval eingrenzen, Quote deckeln, Identität pro Tenant.
Structured Output schlägt cleveres Parsing
Noch immer JSON per Regex aus Modelltext parsen? Bedrock Structured Outputs erzwingen ein JSON Schema beim Decoding, die Antwort ist automatisch gültig.
Prompt Caching auf Bedrock: Der 90-Prozent-Rabatt, den die meisten Teams ignorieren
Bedrock Prompt Caching liest ein wiederholtes Präfix mit 90 Prozent Rabatt, aber ein Cache-Write kostet mehr als gar kein Caching. Der Breakpoint entscheidet.
AWS Monthly (Mar '26): Governance holt die Agenten ein
März 2026 auf AWS: AgentCore Policy und Evaluations erreichen GA, Elemental Inference launcht, Agenten-Governance wird zur Produktions-Kontrollebene.
Streaming-Antworten sind eine UX-Entscheidung, keine Performance-Entscheidung
Streaming ist eine UX-Entscheidung über Time to First Token, kein Geschwindigkeits-Fix. Es kann strukturierte Ausgabe und Tool-Use sogar verschlechtern.
Bedrock Agents vs. die eigene Loop bauen
Amazon Bedrock Agents übernimmt Orchestrierung, Memory und Tool-Aufrufe. Wann das Managed Framework echte Arbeit spart und wann es dich still übernimmt.
Hör auf mit Fine-Tuning. Du brauchst RAG, einen Cache und bessere Prompts
Fine-Tuning plus Provisioned Throughput ist die teure Antwort auf die meisten LLM-Probleme. Günstiger sind Retrieval, Prompt Caching und bessere Prompts.
Knowledge-Base-Chunking ist der Ort, an dem deine RAG-Qualität stirbt
Schlechte RAG-Antworten sind meist ein Retrieval-, kein Modellproblem. Fixed-, Semantic- und Hierarchical-Chunking in Knowledge Bases legen die Qualität fest.
Bedrock Guardrails schützt nicht vor Prompt Injection
Amazon Bedrock Guardrails filtert Inhalte, autorisiert keine Aktionen. Schutz vor Prompt Injection braucht Input-Isolation, Tool-Allowlists und IAM-Scoping.