Avaliação de agentes: o que medir antes de escalar
Sem conjunto de avaliação versionado, toda mudança de prompt ou de modelo é uma aposta. O mínimo viável para medir qualidade de agente.
ARTIGO1 MIN DE LEITURAGABRIEL ALONSO
Trocar o modelo de um agente sem um conjunto de avaliação é apostar que nada regrediu. Às vezes dá certo.
O mínimo viável
Um conjunto de avaliação não precisa ser sofisticado para ser útil. Precisa ser versionado, rodar automaticamente e cobrir os casos que doem.
- Vinte a cinquenta casos reais, retirados de uso de produção
- Saída esperada descrita como critério, não como texto exato
- Execução a cada mudança de prompt, modelo ou ferramenta
- Resultado comparável entre versões
O erro comum
Avaliar por inspeção humana de alguns exemplos escolhidos a dedo. Isso não escala, não detecta regressão, e tende a selecionar justamente os casos em que o sistema já ia bem.
A régua que importa é a taxa de sucesso medida sobre casos que o sistema ainda não viu.