Amazon Bedrock

Filed under

26 posts

Bedrock-Kostenverfolgung pro App mit Inference Profiles

Application Inference Profiles versehen Bedrock-Aufrufe mit Kosten-Tags und machen aus einer Rechnung Zeilen pro Team. Das Tag-Design ist der harte Teil.

Jul 10, 2026 5 min

EU AI Act, 2. August: Die Frist, die sich nicht verschoben hat

Das Digital Omnibus verschob die Hochrisiko-Fristen auf 2027 und 2028. Artikel 50 gilt weiter ab 2. August 2026 und trifft die meisten Teams.

Jul 08, 2026 7 min

SageMaker vs. Bedrock: Eine Organisationsentscheidung, keine technische

Die Frage SageMaker oder Bedrock dreht sich darum, ob Ihre Organisation ein Team hat, das Modelle verantwortet. Entscheiden Sie nach der echten Teamtopologie.

Jul 06, 2026 6 min

Prompt Injection über die eigene Doku: Die RAG-Angriffsfläche

Ihre Wissensdatenbank ist nicht vertrauenswürdig. Retrieval liefert dem Modell von Angreifern verfassten Text, daher lohnt sich Scannen beim Ingest.

Jul 04, 2026 6 min

AWS Monthly (Juni '26): Agenten bekommen eine Feedback-Schleife

Juni 2026 bei AWS: Der Summit in New York verwandelte Produktions-Traces in Agenten-Verbesserung, brachte Continuum für Security und die Harness zur GA.

Jun 30, 2026 6 min

Das echte Limit Ihres Multi-Agent-Systems sind Tokens pro Minute

Amazon Bedrock zeigt jetzt Tokens-pro-Minute-Quotas pro Modell in Service Quotas. Für Agenten ist TPM die echte Skalierungsgrenze, planen Sie rechtzeitig.

Jun 21, 2026 6 min

Das Kontextfenster ist nicht dein Freund

Ein riesiges Kontextfenster ersetzt kein Retrieval: Die Trefferquote sinkt mit wachsendem Prompt, jeder Token kostet, und die Mitte wird nur überflogen.

Jun 03, 2026 5 min

AWS Monthly (Mai '26): Agenten bekommen eine Geldbörse

Mai 2026 bei AWS: AgentCore Payments lässt Agenten Transaktionen ausführen, das Agent Toolkit for AWS und ein GA-MCP-Server härten die Toolchain dahinter.

May 31, 2026 4 min

Wenn Haiku Opus schlägt: Model Right-Sizing auf Bedrock

Jeden Aufruf standardmäßig an Opus zu schicken, lässt die LLM-Rechnung explodieren. Nach Aufgabenklasse routen: Haiku für die Mehrheit, Opus nur zur Eskalation.

May 22, 2026 4 min

Agentic RAG ist meistens Latenz, die man nicht braucht

Agentic RAG durchläuft Retrieval-Hops, jeder ein Modell-Roundtrip. Bei den meisten Fragen gewinnt eine gute Query, die Schleife lohnt sich selten.

May 18, 2026 4 min

Evals vor Agenten: Man kann nicht ausliefern, was man nicht bewerten kann

Ohne Eval-Harness ist jede Änderung am Agenten ein Bauchgefühl-Check. Erst die Anzeigetafel bauen, dann den Agenten, und den LLM-Judge als fehlbar behandeln.

May 14, 2026 4 min

Semantic Caching: Zwei verschiedene Fragen, eine Antwort

Semantic Caching liefert eine gespeicherte Antwort für ähnlich formulierte Fragen. Das senkt Kosten und Latenz, ein False Hit liefert die falsche Antwort.

May 11, 2026 4 min

LLM-Gateways: Warum jedes Platform-Team irgendwann eines baut

Ruft ein zweites Team ein Modell auf, entsteht unkontrollierter Fan-out. Ein LLM-Gateway bündelt Auth, Quota, Routing und Audit: Eigenbau, LiteLLM, API Gateway.

May 04, 2026 5 min

AWS Monatsrückblick (Apr '26): OpenAI landet auf Bedrock

April 2026 auf AWS: OpenAI-Modelle, Codex und Managed Agents kommen zu Bedrock, und AgentCore bekommt ein verwaltetes Harness plus CLI für den Weg zum Agenten.

Apr 30, 2026 4 min

Cross-Region Inference: Günstige Resilienz oder Residency-Falle?

Bedrock Cross-Region Inference glättet Durchsatz und Throttling, aber ein globales Profil kann den Prompt aus seiner Geografie routen. Erst Residency prüfen.

Apr 26, 2026 4 min

Eure LLM-Rechnung ist ein Observability-Problem

Eine überraschende Bedrock-Rechnung ist kein Preisproblem, sondern ein Sichtbarkeitsproblem. Ohne Zuordnung von Tokens zu Feature fehlt die Kontrolle.

Apr 21, 2026 4 min

Batch Inference auf Bedrock: Halber Preis, wenn ihr warten könnt

Amazon Bedrock Batch Inference läuft zu 50 Prozent des On-Demand-Preises. Die einzigen Kosten sind Latenz. Wo niemand wartet, ist der Tausch geschenktes Geld.

Apr 17, 2026 4 min

Multi-Tenant-LLM-Apps: Kunden auf einem gemeinsam genutzten Modell isolieren

Ein gemeinsames Bedrock-Modell, viele Kunden. Das Modell ist zustandslos, Isolation ist eure Aufgabe: Retrieval eingrenzen, Quote deckeln, Identität pro Tenant.

Apr 13, 2026 4 min

Structured Output schlägt cleveres Parsing

Noch immer JSON per Regex aus Modelltext parsen? Bedrock Structured Outputs erzwingen ein JSON Schema beim Decoding, die Antwort ist automatisch gültig.

Apr 06, 2026 4 min

Prompt Caching auf Bedrock: Der 90-Prozent-Rabatt, den die meisten Teams ignorieren

Bedrock Prompt Caching liest ein wiederholtes Präfix mit 90 Prozent Rabatt, aber ein Cache-Write kostet mehr als gar kein Caching. Der Breakpoint entscheidet.

Apr 02, 2026 5 min

AWS Monthly (Mar '26): Governance holt die Agenten ein

März 2026 auf AWS: AgentCore Policy und Evaluations erreichen GA, Elemental Inference launcht, Agenten-Governance wird zur Produktions-Kontrollebene.

Mar 31, 2026 4 min

Streaming-Antworten sind eine UX-Entscheidung, keine Performance-Entscheidung

Streaming ist eine UX-Entscheidung über Time to First Token, kein Geschwindigkeits-Fix. Es kann strukturierte Ausgabe und Tool-Use sogar verschlechtern.

Mar 24, 2026 4 min

Bedrock Agents vs. die eigene Loop bauen

Amazon Bedrock Agents übernimmt Orchestrierung, Memory und Tool-Aufrufe. Wann das Managed Framework echte Arbeit spart und wann es dich still übernimmt.

Mar 18, 2026 4 min

Hör auf mit Fine-Tuning. Du brauchst RAG, einen Cache und bessere Prompts

Fine-Tuning plus Provisioned Throughput ist die teure Antwort auf die meisten LLM-Probleme. Günstiger sind Retrieval, Prompt Caching und bessere Prompts.

Mar 09, 2026 4 min

Knowledge-Base-Chunking ist der Ort, an dem deine RAG-Qualität stirbt

Schlechte RAG-Antworten sind meist ein Retrieval-, kein Modellproblem. Fixed-, Semantic- und Hierarchical-Chunking in Knowledge Bases legen die Qualität fest.

Mar 05, 2026 5 min

Bedrock Guardrails schützt nicht vor Prompt Injection

Amazon Bedrock Guardrails filtert Inhalte, autorisiert keine Aktionen. Schutz vor Prompt Injection braucht Input-Isolation, Tool-Allowlists und IAM-Scoping.

Mar 03, 2026 5 min