Llm-Gateway

Filed under

9 posts

One Door to the Models, Parte 10: Observabilidade, Governança e os Números

Logar prompts torna o gateway processador do que os usuários digitaram. A Parte 10 fecha a série: traces, evals em produção, governança e o placar.

Jul 28, 2026 8 min

One Door to the Models, Parte 9: Eval Gates e Aposentadoria de Modelos

Uma approval que expira marca o stage como skipped, não como falho. A Parte 9 torna o eval um gate real e faz da aposentadoria de modelo uma query.

Jul 27, 2026 9 min

One Door to the Models, Parte 8: Orquestração em Cima do Gateway

Um framework de orquestração que faz retry e reroteia compete com o gateway. A Parte 8 mantém o framework fino e põe as tools sob a mesma identidade.

Jul 26, 2026 8 min

One Door to the Models, Parte 7: Azure AI Search ou um Vector Database

Azure AI Search cobra capacidade por SKU, não por vetores, e o vector index é limitado pela memória do tier. A Parte 7 decide por limites, não por features.

Jul 25, 2026 9 min

One Door to the Models, Parte 6: Semantic Caching e Seus Modos de Falha

Um semantic cache é uma superfície de correção, não só uma alavanca de custo. A Parte 6 ajusta o threshold, isola tenants e trata o dia em que o cache some.

Jul 24, 2026 9 min

One Door to the Models, Parte 5: Identidade, Quota e Chargeback

São cinco dimensions por métrica, e as time series se multiplicam. A Parte 5 constrói identidade de tenant, quota e chargeback que sobrevive à cardinalidade.

Jul 23, 2026 9 min

One Door to the Models, Parte 4: Trabalho Assíncrono Fora do Caminho da Requisição

Inferência em batch é uma segunda porta: arquivo entra, job roda, arquivo sai, sem policy de gateway no caminho. A Parte 4 mantém a contabilidade honesta.

Jul 22, 2026 10 min

One Door to the Models, Parte 3: A Abstração de Provider e o Streaming

Com stream em true, a contagem de tokens vira estimativa. Abra um WebSocket e o load balancing deixa de existir. A Parte 3 mapeia garantias por transporte.

Jul 21, 2026 12 min

One Door to the Models, Parte 1: O Caso a Favor de um Gateway Central de LLM

Uma empresa roda cinco apps de GenAI e não sabe o custo de cada um. Parte 1: o cenário, construir ou comprar no Azure, e o gateway que a série constrói.

Jul 19, 2026 13 min