Llm-Gateway
Filed under
모델로 가는 하나의 문, 10부. 관측성, 거버넌스, 그리고 숫자
프롬프트 로깅은 게이트웨이를 사용자가 입력한 모든 것의 처리자로 만든다. 10부는 trace, 프로덕션 eval, 거버넌스, 스코어카드로 시리즈를 닫는다.
모델로 가는 하나의 문, 9부. 평가 게이트와 모델 은퇴
timeout으로 만료된 approval은 stage를 skipped로 표시한다. 9부는 eval을 실제 게이트로 만들고 모델 은퇴를 프로젝트가 아니라 쿼리로 바꾼다.
모델로 가는 하나의 문, 8부. 게이트웨이 위의 Orchestration
retry와 reroute를 하는 orchestration framework는 게이트웨이와 경쟁한다. 8부는 framework를 얇게 유지하고 tools를 같은 identity 아래에 둔다.
모델로 가는 하나의 문, 7부. Azure AI Search인가 벡터 데이터베이스인가
Azure AI Search는 벡터 수가 아니라 SKU로 용량이 정해지고 vector index는 티어 메모리에 묶인다. 7부는 retrieval을 기능이 아니라 한도로 결정한다.
모델로 가는 하나의 문, 6부. Semantic Caching과 그 실패 모드
semantic cache는 비용 레버가 아니라 정확성의 표면이다. 6부는 score threshold를 조정하고 테넌트를 격리하며 cache가 사라진 날에 대비한다.
모델로 가는 하나의 문, 5부. 아이덴티티, Quota, Chargeback
custom dimension은 다섯 개, time series는 곱으로 늘어난다. 5부는 cardinality를 버티는 테넌트 아이덴티티, quota, chargeback 모델을 만든다.
모델로 가는 하나의 문, 4부. 요청 경로 밖의 비동기 작업
batch 추론은 두 번째 문이다. 파일이 들어가고 job이 돌고 파일이 나오는 동안 게이트웨이 정책은 경로에 없다. 4부는 회계를 정직하게 유지한다.
모델로 가는 하나의 문, 3부. Provider 추상화와 Streaming
stream을 true로 켜면 토큰 집계는 추정이 되고, WebSocket을 열면 load balancing은 사라진다. 3부는 전송 방식별 보장을 정리한다.
모델로 가는 하나의 문, 1부. 중앙 LLM 게이트웨이를 세워야 하는 이유
한 회사가 GenAI 앱 5개를 운영하면서 각각의 비용을 말하지 못한다. 1부는 시나리오와 Azure에서의 구축 대 구매, 이 시리즈가 만들 게이트웨이를 다룬다.