AI
Filed under
Vektordatenbanken wählt man nach dem, was zuerst bricht
Fast jedes RAG-System sollte mit pgvector starten. Die Frage ist nicht, welche Vektordatenbank am schnellsten ist, sondern welcher Fehlermodus zuerst kommt.
Kiro nach dem Hype: Was KI-IDEs wirklich verändert haben
Acht Monate nach Kiros GA hat die Spec überlebt, die IDE größtenteils nicht. Verändert hat sich, wo die Prüfung stattfindet, und nicht, wer den Code schreibt.
Warum Ihr KI-Pilot in der Beschaffung gestorben ist
Die meisten KI-Piloten scheitern nicht an der Genauigkeit. Sie stocken bei Sicherheitsprüfung und AV-Verträgen, weil niemand die zwölf Wochen danach einplante.
Bedrock-Kostenverfolgung pro App mit Inference Profiles
Application Inference Profiles versehen Bedrock-Aufrufe mit Kosten-Tags und machen aus einer Rechnung Zeilen pro Team. Das Tag-Design ist der harte Teil.
EU AI Act, 2. August: Die Frist, die sich nicht verschoben hat
Das Digital Omnibus verschob die Hochrisiko-Fristen auf 2027 und 2028. Artikel 50 gilt weiter ab 2. August 2026 und trifft die meisten Teams.
SageMaker vs. Bedrock: Eine Organisationsentscheidung, keine technische
Die Frage SageMaker oder Bedrock dreht sich darum, ob Ihre Organisation ein Team hat, das Modelle verantwortet. Entscheiden Sie nach der echten Teamtopologie.
Prompt Injection über die eigene Doku: Die RAG-Angriffsfläche
Ihre Wissensdatenbank ist nicht vertrauenswürdig. Retrieval liefert dem Modell von Angreifern verfassten Text, daher lohnt sich Scannen beim Ingest.
M365 Security 101: AI Pilot und Business Impact Reports
Wo AI in Security zählt: Remediation hinter einem Freigabe-Gate pro Änderung, Berichte für die Führung. Ein 101 mit Aether365 als Beispiel.
Dem Modell vertrauen, das Binary auditieren
Der Client eines Coding-Agenten ist das privilegierteste Binary auf deiner Maschine. Claude Codes versteckter Prompt-Fingerprint zeigt, warum du es auditierst.
AWS Monthly (Juni '26): Agenten bekommen eine Feedback-Schleife
Juni 2026 bei AWS: Der Summit in New York verwandelte Produktions-Traces in Agenten-Verbesserung, brachte Continuum für Security und die Harness zur GA.
AWS hat eine Sandbox für KI-generierten Code gebaut: Lambda MicroVMs
AWS Lambda MicroVMs geben KI-Agents einen Ort, um generierten Code isoliert auf VM-Ebene auszuführen. Das fehlende Stück für Produktions-Agents: die Laufzeit.
Das echte Limit Ihres Multi-Agent-Systems sind Tokens pro Minute
Amazon Bedrock zeigt jetzt Tokens-pro-Minute-Quotas pro Modell in Service Quotas. Für Agenten ist TPM die echte Skalierungsgrenze, planen Sie rechtzeitig.
Estland gibt KI-Agenten eine ID. Das ist der einfache Teil
Estland will KI-Agenten AI-ID-Codes ausstellen, eine Weltpremiere. Identität ist einfach. Befugnis, Delegation, Verantwortlichkeit sind die eigentliche Arbeit.
Le Chaton Fat: Das fetteste KI-Modell, das es nie gab
Es gibt kein KI-Modell namens Le Chaton Fat. Keine Gewichte, keine API, kein Benchmark. So wurde ein Mistral-Witz zum Lieblings-Running-Gag der KI-Community.
KI-Coding-Agenten brauchen auch Staging-Umgebungen
Teams gaben Coding-Agenten Produktions-Credentials und nannten es Geschwindigkeit. Ein Agent braucht dieselbe Umgebungsleiter wie jeder neue Mitarbeiter.
Claude Code in CI: Einen Agenten den Build reparieren lassen
Einen Coding-Agenten in die Pipeline zu stellen ist einfach. Die eigentliche Arbeit sind die Leitplanken: was er anfassen darf, wann er stoppt, wer prüft.
Das Kontextfenster ist nicht dein Freund
Ein riesiges Kontextfenster ersetzt kein Retrieval: Die Trefferquote sinkt mit wachsendem Prompt, jeder Token kostet, und die Mitte wird nur überflogen.
AWS Monthly (Mai '26): Agenten bekommen eine Geldbörse
Mai 2026 bei AWS: AgentCore Payments lässt Agenten Transaktionen ausführen, das Agent Toolkit for AWS und ein GA-MCP-Server härten die Toolchain dahinter.
Prompts loggen, ohne PII zu loggen
Prompt-Logs braucht man zum Debuggen einer LLM-App, aber PII darf darin nicht bleiben. Vor der Speicherung mit Comprehend redigieren, dann Retention setzen.
Wenn Haiku Opus schlägt: Model Right-Sizing auf Bedrock
Jeden Aufruf standardmäßig an Opus zu schicken, lässt die LLM-Rechnung explodieren. Nach Aufgabenklasse routen: Haiku für die Mehrheit, Opus nur zur Eskalation.
Agentic RAG ist meistens Latenz, die man nicht braucht
Agentic RAG durchläuft Retrieval-Hops, jeder ein Modell-Roundtrip. Bei den meisten Fragen gewinnt eine gute Query, die Schleife lohnt sich selten.
Evals vor Agenten: Man kann nicht ausliefern, was man nicht bewerten kann
Ohne Eval-Harness ist jede Änderung am Agenten ein Bauchgefühl-Check. Erst die Anzeigetafel bauen, dann den Agenten, und den LLM-Judge als fehlbar behandeln.
Semantic Caching: Zwei verschiedene Fragen, eine Antwort
Semantic Caching liefert eine gespeicherte Antwort für ähnlich formulierte Fragen. Das senkt Kosten und Latenz, ein False Hit liefert die falsche Antwort.
Step Functions ist der am meisten unterschätzte Agent-Orchestrator
Die meisten Agent-Workflows brauchen kein Modell für den Kontrollfluss. Step Functions liefert deterministische Orchestrierung, Retries und Human-in-the-Loop.
LLM-Gateways: Warum jedes Platform-Team irgendwann eines baut
Ruft ein zweites Team ein Modell auf, entsteht unkontrollierter Fan-out. Ein LLM-Gateway bündelt Auth, Quota, Routing und Audit: Eigenbau, LiteLLM, API Gateway.
AWS Monatsrückblick (Apr '26): OpenAI landet auf Bedrock
April 2026 auf AWS: OpenAI-Modelle, Codex und Managed Agents kommen zu Bedrock, und AgentCore bekommt ein verwaltetes Harness plus CLI für den Weg zum Agenten.
Cross-Region Inference: Günstige Resilienz oder Residency-Falle?
Bedrock Cross-Region Inference glättet Durchsatz und Throttling, aber ein globales Profil kann den Prompt aus seiner Geografie routen. Erst Residency prüfen.
Eure LLM-Rechnung ist ein Observability-Problem
Eine überraschende Bedrock-Rechnung ist kein Preisproblem, sondern ein Sichtbarkeitsproblem. Ohne Zuordnung von Tokens zu Feature fehlt die Kontrolle.
Batch Inference auf Bedrock: Halber Preis, wenn ihr warten könnt
Amazon Bedrock Batch Inference läuft zu 50 Prozent des On-Demand-Preises. Die einzigen Kosten sind Latenz. Wo niemand wartet, ist der Tausch geschenktes Geld.
Multi-Tenant-LLM-Apps: Kunden auf einem gemeinsam genutzten Modell isolieren
Ein gemeinsames Bedrock-Modell, viele Kunden. Das Modell ist zustandslos, Isolation ist eure Aufgabe: Retrieval eingrenzen, Quote deckeln, Identität pro Tenant.
Agenten-Gedächtnis ist ein Datenbankproblem, kein Prompt-Problem
Die gesamte Historie eines Agenten in den Prompt zu stopfen ist kein Gedächtnis, nur eine wachsende Rechnung. Echtes Gedächtnis heißt Datenbank mit Retrieval.
Structured Output schlägt cleveres Parsing
Noch immer JSON per Regex aus Modelltext parsen? Bedrock Structured Outputs erzwingen ein JSON Schema beim Decoding, die Antwort ist automatisch gültig.
Prompt Caching auf Bedrock: Der 90-Prozent-Rabatt, den die meisten Teams ignorieren
Bedrock Prompt Caching liest ein wiederholtes Präfix mit 90 Prozent Rabatt, aber ein Cache-Write kostet mehr als gar kein Caching. Der Breakpoint entscheidet.
AWS Monthly (Mar '26): Governance holt die Agenten ein
März 2026 auf AWS: AgentCore Policy und Evaluations erreichen GA, Elemental Inference launcht, Agenten-Governance wird zur Produktions-Kontrollebene.
Streaming-Antworten sind eine UX-Entscheidung, keine Performance-Entscheidung
Streaming ist eine UX-Entscheidung über Time to First Token, kein Geschwindigkeits-Fix. Es kann strukturierte Ausgabe und Tool-Use sogar verschlechtern.
Bedrock Agents vs. die eigene Loop bauen
Amazon Bedrock Agents übernimmt Orchestrierung, Memory und Tool-Aufrufe. Wann das Managed Framework echte Arbeit spart und wann es dich still übernimmt.
IAM für LLM-Apps: Least Privilege, wenn der Aufrufer ein Modell ist
Ist der Aufrufer ein Modell, gilt Least Privilege trotzdem. Jedes Agenten-Tool braucht eine enge IAM-Rolle und Session Policy, keine breiten Admin-Credentials.
Hör auf mit Fine-Tuning. Du brauchst RAG, einen Cache und bessere Prompts
Fine-Tuning plus Provisioned Throughput ist die teure Antwort auf die meisten LLM-Probleme. Günstiger sind Retrieval, Prompt Caching und bessere Prompts.
Knowledge-Base-Chunking ist der Ort, an dem deine RAG-Qualität stirbt
Schlechte RAG-Antworten sind meist ein Retrieval-, kein Modellproblem. Fixed-, Semantic- und Hierarchical-Chunking in Knowledge Bases legen die Qualität fest.
Bedrock Guardrails schützt nicht vor Prompt Injection
Amazon Bedrock Guardrails filtert Inhalte, autorisiert keine Aktionen. Schutz vor Prompt Injection braucht Input-Isolation, Tool-Allowlists und IAM-Scoping.