Custo e latência em sistemas baseados em modelos
Baixar o custo
Anexar menos contexto; rotear requisições simples para um modelo pequeno; aproveitar o cache para partes fixas; e agrupar o que não é urgente.
Calcule o custo por unidade de negócio — por requisição, por usuário, por pedido — não só uma soma mensal. É assim que você vê se o crescimento compensa.
Acelerar
Transmitir a resposta ao usuário em fluxo encurta a espera percebida mais do que qualquer outra otimização. Encurtar o comprimento da saída ajuda diretamente. E tarefas que podem rodar em paralelo — rode em paralelo.
Proteger o orçamento
Tetos diários, alertas ao cruzar limites e um limite de passos em processos automatizados. Um loop errado pode queimar o orçamento de um mês em horas.
Indo mais fundo
Etiquete cada chamada por usuário, capacidade e propósito. Sem etiquetas, a pergunta 'o que causou o pico' é respondida por suposição, e você não consegue desligar a capacidade cara e menos útil — que quase sempre existe e só aparece quando você olha.