Como escolher um modelo — e por que não é a primeira decisão
A direção certa
Se até o modelo poderoso falha, você descobriu barato que o problema não é a escolha do modelo, mas a definição da tarefa, os dados ou o prompt. Se tiver sucesso, você tem uma linha de base de qualidade, e agora pode descer e encontrar o ponto onde a qualidade cai abaixo do seu limite.
Quatro eixos
Qualidade na sua tarefa — não nas tabelas públicas que testam outras tarefas.
Custo por operação — determinado principalmente pelo texto que entra, não pelo que sai.
Velocidade — crítica em uma interface ao vivo, quase irrelevante no processamento em segundo plano.
Onde os dados rodam — uma questão de regulação e risco, não de qualidade.
Quando treinar
Quase nunca, e não no começo. Melhoria de prompt, bons exemplos e conexão à fonte certa de informação resolvem a maioria das lacunas. Fine-tuning vale a pena quando você tem milhares de exemplos de qualidade e o objetivo é baixar o custo ou o tempo de resposta.
Indo mais fundo
Envolva a chamada ao modelo em uma camada que você controla, para que trocar de fornecedor seja uma mudança de configuração. E mantenha um log por chamada — modelo, versão do prompt, quantidades de texto e tempo — ou perguntas como 'quando a qualidade caiu' ficam sem resposta.