AI, LLMs, and applied ML.
Ercan ErmisによるAI、LLM、エージェント、応用機械学習に関するシニアエンジニアのフィールドノート。
All posts
ベクトルデータベースは何が最初に壊れるかで選ぶ
ほぼすべてのRAGシステムはpgvectorから始めるべきだ。問うべきはどのベクトルデータベースが最速かではなく、どの障害モードが最初に自分に届くかである。
モデルへの扉はひとつに。第10回 observability、ガバナンス、そして数字
プロンプトをログに残した瞬間、ゲートウェイはユーザー入力の処理者になる。最終回はトレース、本番eval、ガバナンス、そして第1回の数字の答え合わせ。
モデルへの扉はひとつに。第9回 evalゲートとモデルの引退
timeoutした承認はstageをskippedにし、失敗にはしない。第9回はevalを本物のゲートにし、モデルの引退をプロジェクトではなくクエリに変える。
モデルへの扉はひとつに。第8回 ゲートウェイの上のorchestration
retryと再ルーティングを行うorchestrationフレームワークはゲートウェイと競合する。第8回はフレームワークを薄く保ち、toolsを同じidentityの下に置く。
モデルへの扉はひとつに。第7回 Azure AI Searchかベクトルデータベースか
Azure AI Searchはベクトル数ではなくSKUでキャパシティを課金し、vector indexはtierのメモリで上限が決まる。第7回はretrievalを機能ではなく制限で決める。
モデルへの扉はひとつに。第6回 semantic cachingとその失敗モード
semantic cacheはコスト削減の道具である前に正しさの境界だ。第6回はscore thresholdを調整し、テナントを分離し、キャッシュが消えた日に備える。
モデルへの扉はひとつに。第5回 アイデンティティ、quota、chargeback
カスタムメトリクスのdimensionは5つしか使えず、time seriesは掛け算で増える。第5回はカーディナリティに耐えるテナントのアイデンティティ、quota、chargebackを構築する。
モデルへの扉はひとつに。第4回 非同期処理をリクエストパスの外へ
バッチ推論は第二の扉だ。ファイルが入り、jobが走り、ファイルが出るまで、ゲートウェイのポリシーは経路のどこにもいない。第4回はこの会計を誠実に保つ。
モデルへの扉はひとつに。第3回 プロバイダー抽象化とstreaming
stream: trueにした瞬間、トークン計測は推定になる。WebSocketではload balancingが消える。第3回は保証とトランスポートの対応を描く。
エンタープライズMCP認証: エージェントがついにサービスアカウントを手にした
SEP-1046はMCP上の無人エージェントに本物のOAuthを与える。client_credentialsとprivate_key_jwtで何が解決し、何が残り、どう導入するかを解説する。
Ercan の他のサイト
同じ著者、別の領域のサイトが2つ。