Avaliação de agentes: o que medir antes de escalar

Sem conjunto de avaliação versionado, toda mudança de prompt ou de modelo é uma aposta. O mínimo viável para medir qualidade de agente.

ARTIGO1 MIN DE LEITURAGABRIEL ALONSO

Trocar o modelo de um agente sem um conjunto de avaliação é apostar que nada regrediu. Às vezes dá certo.

O mínimo viável

Um conjunto de avaliação não precisa ser sofisticado para ser útil. Precisa ser versionado, rodar automaticamente e cobrir os casos que doem.

  • Vinte a cinquenta casos reais, retirados de uso de produção
  • Saída esperada descrita como critério, não como texto exato
  • Execução a cada mudança de prompt, modelo ou ferramenta
  • Resultado comparável entre versões

O erro comum

Avaliar por inspeção humana de alguns exemplos escolhidos a dedo. Isso não escala, não detecta regressão, e tende a selecionar justamente os casos em que o sistema já ia bem.

A régua que importa é a taxa de sucesso medida sobre casos que o sistema ainda não viu.