AI, LLMs, and applied ML.

Feldnotizen eines Senior-Ingenieurs zu KI, LLMs, Agenten und angewandtem maschinellem Lernen von Ercan Ermis.

All posts

66 posts

Evals vor Agenten: Man kann nicht ausliefern, was man nicht bewerten kann

Ohne Eval-Harness ist jede Änderung am Agenten ein Bauchgefühl-Check. Erst die Anzeigetafel bauen, dann den Agenten, und den LLM-Judge als fehlbar behandeln.

May 14, 2026 4 min

Semantic Caching: Zwei verschiedene Fragen, eine Antwort

Semantic Caching liefert eine gespeicherte Antwort für ähnlich formulierte Fragen. Das senkt Kosten und Latenz, ein False Hit liefert die falsche Antwort.

May 11, 2026 4 min

Step Functions ist der am meisten unterschätzte Agent-Orchestrator

Die meisten Agent-Workflows brauchen kein Modell für den Kontrollfluss. Step Functions liefert deterministische Orchestrierung, Retries und Human-in-the-Loop.

May 07, 2026 4 min

LLM-Gateways: Warum jedes Platform-Team irgendwann eines baut

Ruft ein zweites Team ein Modell auf, entsteht unkontrollierter Fan-out. Ein LLM-Gateway bündelt Auth, Quota, Routing und Audit: Eigenbau, LiteLLM, API Gateway.

May 04, 2026 5 min

AWS Monatsrückblick (Apr '26): OpenAI landet auf Bedrock

April 2026 auf AWS: OpenAI-Modelle, Codex und Managed Agents kommen zu Bedrock, und AgentCore bekommt ein verwaltetes Harness plus CLI für den Weg zum Agenten.

Apr 30, 2026 4 min

Cross-Region Inference: Günstige Resilienz oder Residency-Falle?

Bedrock Cross-Region Inference glättet Durchsatz und Throttling, aber ein globales Profil kann den Prompt aus seiner Geografie routen. Erst Residency prüfen.

Apr 26, 2026 4 min

Eure LLM-Rechnung ist ein Observability-Problem

Eine überraschende Bedrock-Rechnung ist kein Preisproblem, sondern ein Sichtbarkeitsproblem. Ohne Zuordnung von Tokens zu Feature fehlt die Kontrolle.

Apr 21, 2026 4 min

Batch Inference auf Bedrock: Halber Preis, wenn ihr warten könnt

Amazon Bedrock Batch Inference läuft zu 50 Prozent des On-Demand-Preises. Die einzigen Kosten sind Latenz. Wo niemand wartet, ist der Tausch geschenktes Geld.

Apr 17, 2026 4 min

Multi-Tenant-LLM-Apps: Kunden auf einem gemeinsam genutzten Modell isolieren

Ein gemeinsames Bedrock-Modell, viele Kunden. Das Modell ist zustandslos, Isolation ist eure Aufgabe: Retrieval eingrenzen, Quote deckeln, Identität pro Tenant.

Apr 13, 2026 4 min

Agenten-Gedächtnis ist ein Datenbankproblem, kein Prompt-Problem

Die gesamte Historie eines Agenten in den Prompt zu stopfen ist kein Gedächtnis, nur eine wachsende Rechnung. Echtes Gedächtnis heißt Datenbank mit Retrieval.

Apr 09, 2026 4 min

Weiteres von Ercan

Zwei weitere Seiten, gleicher Autor, anderes Terrain.