Quanto custa rodar um agente de IA em escala
O custo por execução é a métrica que decide se um agente sobrevive ao primeiro trimestre. Como estimar antes de construir, e onde ele costuma escapar.
A conta que quase ninguém faz antes de construir é a mais simples de todas: quanto custa uma execução, multiplicado pelo número de execuções por mês.
A fórmula base
O custo de uma execução de agente é a soma dos tokens de todas as chamadas ao modelo dentro do loop — não de uma chamada só. É aqui que a estimativa costuma errar por uma ordem de grandeza.
Um agente que faz em média 6 chamadas por execução, com 8 mil tokens de entrada e 800 de saída em cada, consome cerca de 53 mil tokens de entrada por execução. Não 8 mil.
Onde o custo escapa
O contexto que só cresce
O padrão mais caro é acumular todo o histórico a cada iteração. Na sexta chamada, o agente reprocessa tudo que veio antes. O custo cresce de forma quadrática com o número de passos, não linear.
Retry silencioso
Uma ferramenta que falha e é chamada de novo dobra o custo daquele trecho. Sem contabilizar retries, a estimativa fica sistematicamente otimista.
Ferramenta que devolve demais
Uma consulta que retorna 500 linhas quando 5 bastariam paga tokens de entrada em toda chamada subsequente que carregar aquele resultado no contexto.
O que reduz custo sem reduzir qualidade
- Cache de prompt — instruções e contexto estáveis passam a custar uma fração. É a otimização de maior retorno e a mais simples.
- Truncar o histórico — manter os últimos N passos mais um resumo, em vez do log inteiro.
- Modelo menor onde cabe — classificação e roteamento raramente precisam do modelo mais capaz.
- Limitar o retorno das ferramentas — paginar e projetar só os campos usados.
A métrica que importa é por resultado
Custo por execução é diagnóstico. A métrica de decisão é custo por resultado útil — dividido pela taxa de sucesso. Um agente de R$ 0,40 por execução com 60% de sucesso custa R$ 0,67 por resultado; um de R$ 0,55 com 95% custa R$ 0,58. O segundo é mais barato, apesar de parecer mais caro.
Sem medir a taxa de sucesso, essa comparação é impossível — que é outra razão para a avaliação existir desde o começo.