AI, LLMs, and applied ML.
Feldnotizen eines Senior-Ingenieurs zu KI, LLMs, Agenten und angewandtem maschinellem Lernen von Ercan Ermis.
All posts
Evals vor Agenten: Man kann nicht ausliefern, was man nicht bewerten kann
Ohne Eval-Harness ist jede Änderung am Agenten ein Bauchgefühl-Check. Erst die Anzeigetafel bauen, dann den Agenten, und den LLM-Judge als fehlbar behandeln.
Semantic Caching: Zwei verschiedene Fragen, eine Antwort
Semantic Caching liefert eine gespeicherte Antwort für ähnlich formulierte Fragen. Das senkt Kosten und Latenz, ein False Hit liefert die falsche Antwort.
Step Functions ist der am meisten unterschätzte Agent-Orchestrator
Die meisten Agent-Workflows brauchen kein Modell für den Kontrollfluss. Step Functions liefert deterministische Orchestrierung, Retries und Human-in-the-Loop.
LLM-Gateways: Warum jedes Platform-Team irgendwann eines baut
Ruft ein zweites Team ein Modell auf, entsteht unkontrollierter Fan-out. Ein LLM-Gateway bündelt Auth, Quota, Routing und Audit: Eigenbau, LiteLLM, API Gateway.
AWS Monatsrückblick (Apr '26): OpenAI landet auf Bedrock
April 2026 auf AWS: OpenAI-Modelle, Codex und Managed Agents kommen zu Bedrock, und AgentCore bekommt ein verwaltetes Harness plus CLI für den Weg zum Agenten.
Cross-Region Inference: Günstige Resilienz oder Residency-Falle?
Bedrock Cross-Region Inference glättet Durchsatz und Throttling, aber ein globales Profil kann den Prompt aus seiner Geografie routen. Erst Residency prüfen.
Eure LLM-Rechnung ist ein Observability-Problem
Eine überraschende Bedrock-Rechnung ist kein Preisproblem, sondern ein Sichtbarkeitsproblem. Ohne Zuordnung von Tokens zu Feature fehlt die Kontrolle.
Batch Inference auf Bedrock: Halber Preis, wenn ihr warten könnt
Amazon Bedrock Batch Inference läuft zu 50 Prozent des On-Demand-Preises. Die einzigen Kosten sind Latenz. Wo niemand wartet, ist der Tausch geschenktes Geld.
Multi-Tenant-LLM-Apps: Kunden auf einem gemeinsam genutzten Modell isolieren
Ein gemeinsames Bedrock-Modell, viele Kunden. Das Modell ist zustandslos, Isolation ist eure Aufgabe: Retrieval eingrenzen, Quote deckeln, Identität pro Tenant.
Agenten-Gedächtnis ist ein Datenbankproblem, kein Prompt-Problem
Die gesamte Historie eines Agenten in den Prompt zu stopfen ist kein Gedächtnis, nur eine wachsende Rechnung. Echtes Gedächtnis heißt Datenbank mit Retrieval.
Weiteres von Ercan
Zwei weitere Seiten, gleicher Autor, anderes Terrain.
Cloud, AWS, EKS, Terraform, Platform Engineering.
Praxisnotizen aus Produktionssystemen. EKS, IAM, Terraform im Organisationsmaßstab, Observability, Kostenoptimierung.
Besuchen ercan.cloud →Die Drehscheibe. Über mich, Beratung, Kontakt.
Persönliche Drehscheibe für beide Schreibspuren. Wer ich bin, wie die Beratung funktioniert, wie Sie mich erreichen.
Besuchen ercanermis.com →