Acurácia Média de Modelo de IA: Por Que Ela Sobe Enquanto o Sistema Piora

Um classificador que acerta 94% das previsões parece pronto para produção. Ele pode ser o pior modelo do seu portfólio. A acurácia média é a métrica mais citada em apresentação de resultado de IA e uma das que menos ajuda a decidir alguma coisa — porque ela comprime, em um único número, um comportamento que quase nunca é uniforme entre os segmentos que importam.

O problema tratado aqui é específico: como saber se um modelo em produção está melhorando de verdade ou apenas parecendo melhor no slide. Vale para classificação de tickets de atendimento, score de propensão de compra, roteamento de chamados, detecção de fraude e para qualquer sistema em que a saída do modelo vira decisão automática sem revisão humana.

Por que a média sobe enquanto o sistema piora

A acurácia é uma média ponderada pelo volume de cada classe. Quando a distribuição da base é desequilibrada — e em problemas de negócio ela quase sempre é —, a classe majoritária domina o resultado. Em uma base com 95% de transações legítimas e 5% de fraude, um modelo que classifica tudo como legítimo entrega 95% de acurácia sem ter aprendido nada.

Esse caso é caricato e todo mundo reconhece. A versão perigosa é mais sutil: o modelo melhora na classe majoritária, piora na minoritária e a média sobe. O dashboard mostra evolução. A operação sente degradação. As duas leituras estão corretas, e só uma delas é sobre o que a empresa contratou o modelo para fazer.

Há um segundo efeito, menos discutido: mudança na composição da base entre um período e outro. Se o mix de canais, regiões ou produtos mudou, a acurácia agregada muda mesmo com o modelo congelado. Comparar 94% de junho com 91% de agosto sem verificar se a base é comparável é comparar duas coisas diferentes e chamar de série histórica.

Em bases desequilibradas, a diferença entre a acurácia agregada e a acurácia no pior segmento costuma passar de 20 pontos percentuais. É esse pior segmento que gera reclamação, retrabalho e chamado — não a média.

Mito: “a métrica subiu, então o modelo melhorou”

Essa afirmação só se sustenta sob três condições que raramente são verificadas antes de repeti-la: a base de avaliação é a mesma nos dois períodos, o limiar de decisão não mudou, e a métrica escolhida penaliza o erro que custa dinheiro.

O limiar é o ponto cego mais comum. A maioria dos modelos de classificação devolve uma probabilidade, e alguém em algum momento decidiu que acima de 0,5 é positivo. Esse 0,5 é arbitrário. Mexer nele muda precisão e recall em direções opostas sem alterar uma linha do modelo. Times mudam limiar para resolver reclamação pontual, não registram a mudança, e três meses depois ninguém sabe explicar por que a série histórica tem um degrau.

A evidência que substitui a crença é simples de produzir: fixe a base de avaliação, fixe o limiar, e só então compare. Se algum dos dois precisar mudar, a comparação vira “antes e depois da mudança”, não “evolução do modelo”. Parece burocracia. É o que separa medição de narrativa.

Há uma terceira armadilha, específica de quem reavalia com dados recentes: vazamento temporal. Se a base de teste contém informação que só existiria depois do momento da decisão — um campo preenchido pelo atendente após a análise, um status atualizado retroativamente —, o modelo acerta na avaliação e erra em produção. O sintoma clássico é uma métrica excelente no teste que não se reproduz no primeiro mês real. Antes de comemorar salto grande de desempenho, a pergunta certa é qual variável nova entrou e em que instante ela ficaria disponível na vida real.

O que medir no lugar da média

Nenhuma métrica isolada resolve. O conjunto mínimo defensável para um classificador binário em produção tem quatro elementos, e cada um responde a uma pergunta diferente:

  1. Precisão na classe de interesse — de tudo que o modelo apontou como positivo, quanto era mesmo. Responde ao custo do falso positivo: quantas vezes a operação foi acionada à toa.
  2. Recall na classe de interesse — de tudo que era positivo, quanto o modelo pegou. Responde ao custo do falso negativo: quanto passou batido.
  3. Calibração — quando o modelo diz 0,8, aproximadamente 80% daqueles casos são positivos. Um modelo pode ordenar bem e mentir na probabilidade, e isso quebra qualquer regra de negócio construída sobre faixas de score.
  4. Desempenho no pior segmento — a mesma métrica, recalculada dentro de cada corte relevante. É o número que prevê reclamação.

Se for para escolher uma para o comitê que não vai ler o resto, escolha a quarta. A média agregada é a métrica que mais engana justamente porque é a mais fácil de reportar.

Fatiar a avaliação: onde o número muda de sinal

Recalcular a métrica por segmento é a intervenção de maior retorno em avaliação de modelo, e é barata. A tabela abaixo mostra o padrão típico de um score de propensão avaliado de forma agregada e depois fatiado — os valores são ilustrativos, mas a forma da distorção se repete em praticamente todo projeto:

Corte da base Volume relativo Precisão Recall Leitura
Agregado 100% 0,81 0,74 Aprovado no comitê
Clientes com histórico longo ~65% 0,88 0,83 Carrega a média
Clientes novos (menos de 90 dias) ~20% 0,62 0,51 Onde nasce o problema
Canal de menor volume ~8% 0,55 0,44 Pior que o acaso informado

Os cortes que valem a pena são sempre os mesmos quatro tipos: tempo de relacionamento, canal de origem, faixa de valor e recorte geográfico ou de produto. Não é necessário inventar segmentação nova — basta usar as dimensões que já existem no relatório gerencial, porque são elas que a área de negócio usa para cobrar resultado.

Uma regra prática: qualquer segmento com mais de 5% do volume merece métrica própria. Abaixo disso, o intervalo de confiança fica largo demais para sustentar decisão, e o correto é reportar a incerteza em vez de reportar o número.

Drift: o que o dashboard não mostra

Modelo em produção degrada mesmo sem ninguém tocar nele, porque o mundo que gerou os dados de treino muda. Há dois tipos e eles pedem respostas diferentes.

O primeiro é a mudança na distribuição das entradas — o perfil de quem chega mudou. É detectável sem nenhum rótulo, comparando a distribuição das variáveis de entrada da semana contra a janela de treino. É o alerta precoce, e o único que se consegue antes de o estrago aparecer no resultado.

O segundo é a mudança na relação entre entrada e saída — o mesmo perfil passou a se comportar de outro jeito. Esse só é detectável quando o rótulo verdadeiro chega, e o atraso até ele é a variável que define o quanto se está voando às cegas. Em fraude, o rótulo chega em dias. Em churn ou propensão de compra, pode levar meses. Quanto maior esse atraso, mais peso deve ter o monitoramento de entrada, porque é o único sinal disponível no intervalo.

Vale dizer o que é honesto: quase todo alerta de drift em produção é ruído sazonal. Fim de mês, campanha, feriado e mudança de layout no formulário produzem deslocamento de distribuição que não tem nada a ver com o modelo. Alerta de drift sem calendário de negócio ao lado gera fadiga de alarme e, em poucas semanas, ninguém olha mais.

Um protocolo de avaliação que sobrevive à auditoria

O que separa um time que mede de um time que apresenta número é a existência de um procedimento escrito antes do resultado. Seis passos bastam:

  1. Congele uma base de referência. Um conjunto rotulado, fora do treino, que não muda entre avaliações. Toda comparação de versão roda contra ele.
  2. Defina a métrica primária antes de rodar. Uma só, escolhida pelo custo do erro que dói mais. As outras entram como secundárias.
  3. Registre o limiar junto com o resultado. Métrica sem limiar declarado é um número sem unidade.
  4. Reporte por segmento, sempre. O agregado entra como contexto, não como conclusão.
  5. Traduza para unidade de negócio. Quantos chamados a mais, quantas horas de análise economizadas, qual valor em risco. Um ganho de três pontos em recall que não muda nada operacionalmente é ruído estatístico com apresentação bonita.
  6. Guarde a versão do modelo, dos dados e do código de avaliação. Resultado que não pode ser reproduzido em seis meses não é evidência.

Entre investir em um modelo mais sofisticado e investir nesse protocolo, a escolha aqui é o protocolo — e sem hesitação. Ganho de arquitetura tem retorno decrescente rápido; capacidade de saber se o ganho existiu é o que permite tomar qualquer decisão seguinte. Times que pulam essa etapa acabam trocando de modelo por intuição e chamando isso de iteração.

Perguntas frequentes

Acurácia nunca serve para nada?

Serve quando as classes são razoavelmente equilibradas e o custo do falso positivo e do falso negativo é parecido. Isso é raro em problema de negócio, mas acontece — em algumas tarefas de classificação de conteúdo, por exemplo. O erro não é usar acurácia, é usá-la sem verificar se essas duas condições valem.

Qual o tamanho mínimo da base de avaliação?

Depende da taxa da classe rara, não do total. O que importa é ter casos positivos suficientes para que a métrica não oscile com meia dúzia de exemplos. Uma referência de trabalho: algumas centenas de positivos por segmento que se pretende reportar. Com menos que isso, reporte o intervalo, não o ponto.

Com que frequência reavaliar um modelo em produção?

Monitoramento de distribuição de entrada, contínuo ou semanal. Reavaliação completa com rótulo verdadeiro, na cadência em que o rótulo chega — não faz sentido rodar avaliação mensal se o rótulo leva noventa dias para materializar. Ajuste a frequência ao dado, não ao calendário da reunião.

E para modelos de linguagem, vale o mesmo raciocínio?

A lógica vale, as métricas mudam. Não há classe positiva óbvia, então a avaliação passa por conjuntos de casos representativos com critério de aceitação declarado por tipo de tarefa. O princípio permanece: nota média agregada esconde a categoria de pergunta em que o sistema falha, e é essa categoria que vira reclamação.

Comentários

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *