IAAvançado
Avaliação de LLM: montando seus evals
Crie um harness de evals: golden set de testes, métricas (determinísticas e LLM-as-judge), integração em CI. Detecte regressão antes do deploy.
9 de agosto de 202613 min de leitura
Conteúdo
Código que roda, números reais e o trade-off explícito de quando não usar. Filtre por categoria, nível ou tag.