A pergunta que sustenta quase todo projeto de assistente de IA em atendimento é simples de enunciar e difícil de responder: quanto custava atender um cliente antes e quanto custa agora. O indicador que a maioria das empresas leva para a reunião de resultado é a taxa de contenção — o percentual de conversas que o assistente encerrou sem transbordar para um humano. Uma contenção de 60% soa como economia de 60%. Quase nunca é.
A contenção mede desvio de volume, não custo. Ela ignora o que acontece depois: o cliente que volta duas horas mais tarde pelo mesmo motivo, a conversa que chegou ao humano já degradada e demorou mais para resolver, o custo de inferência que subiu quando o time trocou o modelo por um mais capaz. Um assistente pode conter 60% das conversas e deixar o custo por resolução exatamente onde estava. Este texto descreve como montar a medição que separa um caso do outro.
Por que a taxa de contenção engana com tanta frequência
Contenção costuma ser definida como conversas encerradas no assistente sobre conversas totais. O problema mora nos dois lados da fração.
No numerador, “encerrada” quase sempre significa “o cliente parou de responder”. Abandono e resolução produzem exatamente o mesmo evento no log. Quem desiste e vai para o telefone, para o e-mail ou para a loja física entra na conta como sucesso. Em operações que já mediram isso com rastreamento de reincidência, a fatia de conversas contidas que reaparece em outro canal em até 72 horas costuma ficar na casa de dois dígitos — o número varia muito por setor e por qualidade do roteamento, mas raramente é desprezível o bastante para ser ignorado.
No denominador, o assistente muda o próprio volume que está medindo. Quando o atendimento fica instantâneo e disponível de madrugada, o cliente pergunta mais. Contatos que antes não aconteciam passam a acontecer. Isso é bom para experiência e péssimo para comparação: a base de conversas do mês 6 não é a mesma base do mês 1, e dividir custo pelo total de conversas produz uma queda artificial que não corresponde a nenhum real a menos na despesa.
A correção é trocar a unidade de análise. Não conte conversas. Conte problemas resolvidos.
Defina a unidade de custo antes de comparar qualquer coisa
Uma resolução é um problema do cliente que foi encerrado e não voltou dentro de uma janela definida. Os três parâmetros dessa definição precisam ser fixados por escrito antes da primeira medição, porque mexer neles depois permite provar qualquer coisa:
- A janela de reincidência. Sete dias funciona bem para a maioria dos casos de suporte transacional. Para cobrança, faturamento e qualquer assunto com ciclo mensal, use trinta dias — reincidência de fatura não aparece em sete.
- A chave de agrupamento. Duas conversas do mesmo cliente sobre o mesmo assunto dentro da janela são uma resolução, não duas. Sem essa regra, o assistente que devolve o cliente três vezes aparece nos números como três atendimentos bem-sucedidos.
- O escopo de canal. Se o cliente que desiste do chat liga no dia seguinte, essa ligação pertence à mesma resolução. Medir só dentro do canal onde o assistente vive é o erro mais caro da lista, porque esconde exatamente o custo que o assistente está gerando.
Com a unidade definida, o cálculo fica direto: custo por resolução é a soma de todas as despesas de atendimento do período dividida pelo número de resoluções únicas do período. É esse número, e só ele, que precisa cair.
O custo que não aparece na fatura do modelo
A conta de inferência é a parte visível e normalmente a menor. Quando se soma o custo total, a fatura do provedor de modelo costuma responder por uma fração modesta do gasto do projeto — a maior parte está em trabalho humano que ninguém contabiliza como custo de IA. Os itens que precisam entrar na soma:
| Componente | Como capturar | Frequência |
|---|---|---|
| Inferência e API | Fatura do provedor, separada por ambiente de produção e testes | Mensal |
| Curadoria da base de conhecimento | Horas do time de conteúdo × custo-hora | Mensal, tende a ser subestimado |
| Revisão de conversas e rotulagem | Horas de quem audita amostras e corrige intenções | Semanal no início |
| Engenharia de manutenção | Horas de dev alocadas a ajustes de fluxo e integração | Mensal |
| Tempo humano no transbordo | Tempo médio de atendimento das conversas que vieram do assistente | Contínuo |
| Retrabalho por erro do assistente | Tickets abertos para corrigir informação errada dada pelo bot | Contínuo |
O quinto item merece atenção separada. Existe uma suposição confortável de que o assistente entrega ao humano uma conversa pré-qualificada, com contexto pronto, e portanto mais rápida de resolver. Acontece o contrário com frequência suficiente para justificar medição: o cliente chega ao humano já irritado, repetindo informação que julgava ter dado, e o atendente gasta os primeiros minutos desfazendo o que o assistente entendeu errado. Compare o tempo médio de atendimento das conversas transbordadas com o das conversas que entraram direto na fila humana. Se o transbordo demora mais, parte da economia de volume está sendo devolvida em minutos.
Como isolar o efeito do assistente do resto da operação
Comparar o mês anterior com o mês atual não prova nada. Atendimento tem sazonalidade forte, campanhas de marketing mudam o mix de contatos, uma falha de produto pode inflar o volume por duas semanas, e mudanças de política de reembolso alteram tempo de resolução sem que ninguém do time de IA saiba.
O desenho que resolve isso é o mais simples: mantenha uma fatia do tráfego fora do assistente. Um grupo de controle de 10% a 20% dos contatos, sorteado no momento da entrada e roteado direto para o fluxo humano, dá a linha de base contra a qual o restante é comparado. Rode por pelo menos quatro semanas — abaixo disso o ruído semanal domina o resultado.
Duas armadilhas de execução aparecem sempre. A primeira é sortear por cliente e não por conversa: se o mesmo cliente cai ora no controle, ora no tratamento, a atribuição de reincidência fica ambígua. Sorteie por cliente e mantenha a alocação estável durante todo o período. A segunda é deixar o grupo de controle ser atendido por um subconjunto diferente de atendentes — normalmente os mais experientes, porque a fila é menor. Isso contamina a comparação inteira.
Quando o controle aleatório não é viável — operações pequenas, ou casos em que negar o assistente a um grupo é politicamente impossível — a alternativa aceitável é o corte geográfico ou por linha de produto, com uma janela pré-lançamento longa o suficiente para caracterizar a diferença estrutural entre os grupos antes da intervenção. É pior que o sorteio, e o resultado deve ser apresentado como estimativa com margem, não como número fechado.
Sete campos que sustentam o cálculo inteiro
A medição não exige ferramenta nova. Exige que o log de cada conversa carregue os campos certos desde o primeiro dia, porque reconstruir isso depois é caro e frequentemente impossível. O mínimo viável:
- ID do cliente — estável entre canais, não o ID da sessão. Sem isso não existe cálculo de reincidência.
- Grupo experimental — controle ou tratamento, gravado na conversa e não inferido depois.
- Intenção classificada — o assunto, em um vocabulário fechado. É a chave que agrupa conversas na mesma resolução.
- Desfecho — resolvido pelo assistente, transbordado, ou abandonado, com abandono registrado como categoria própria e nunca somado a resolvido.
- Tempo humano consumido — minutos de atendente, separando conversas transbordadas das nativas da fila.
- Custo de inferência da conversa — tokens ou chamadas, atribuídos à conversa e não rateados no fim do mês.
- Carimbo de tempo de entrada e de encerramento — necessário para aplicar a janela de reincidência sem ambiguidade.
Com esses sete campos, o custo por resolução de cada grupo sai de uma consulta. Sem eles, qualquer número apresentado é reconstrução aproximada, e vale dizer isso na reunião.
Que resultado esperar, e quando o projeto não se paga
Assistentes bem implantados entregam economia real, mas ela costuma vir de uma faixa estreita de assuntos: consultas repetitivas, de resposta determinística e verificável — status de pedido, segunda via, horário de funcionamento, elegibilidade simples. Nessa faixa, a queda de custo por resolução é consistente e defensável.
Fora dela, a economia some rápido. Assuntos com exceção contratual, negociação, ou qualquer coisa em que a resposta errada gera custo maior que o atendimento economizado — cobrança indevida, cancelamento, informação regulada — tendem a ficar no vermelho quando se soma o retrabalho. A decisão prática, havendo dúvida, é restringir o escopo do assistente aos assuntos de resposta verificável e transbordar cedo no resto, mesmo que a taxa de contenção caia. Um assistente com 35% de contenção e custo por resolução 20% menor vale mais do que um com 70% de contenção e custo estável.
Se depois de oito a doze semanas de medição com grupo de controle o custo por resolução do grupo tratado não estiver abaixo do controle por uma margem maior que a variação semanal observada, o projeto está entregando velocidade e disponibilidade — o que pode ser suficiente para justificá-lo — mas não está entregando economia. São coisas diferentes e merecem ser apresentadas como tal.
Perguntas frequentes
Quanto tempo de medição é suficiente para concluir alguma coisa?
Quatro semanas é o mínimo para ter sinal acima do ruído semanal; oito a doze semanas dá conforto para decidir investimento. Janelas mais curtas capturam efeito de novidade, tanto do cliente quanto do time, e superestimam o resultado.
Dá para medir sem grupo de controle?
Dá, com perda de confiança. A alternativa é comparar antes e depois controlando por mix de intenção e por volume, e apresentar o resultado como faixa. O risco é atribuir ao assistente uma queda que veio de mudança de produto, de política ou de sazonalidade.
O custo de inferência deve ser rateado ou atribuído por conversa?
Atribuído por conversa, sempre que a plataforma permitir. Rateio pelo total mensal esconde a distribuição: em operações típicas, uma minoria de conversas longas consome uma fatia desproporcional do gasto, e é essa cauda que costuma inviabilizar assuntos específicos.
Reincidência em outro canal realmente muda tanto o resultado?
Muda o suficiente para inverter conclusões em operações multicanal. Se o rastreamento entre canais não existe, a recomendação é declarar essa limitação junto com o número, em vez de apresentar o custo por resolução como se ele estivesse completo.
Qual métrica levar para a diretoria em uma linha só?
Custo por resolução do grupo tratado contra o do grupo de controle, no mesmo período, com o número de resoluções de cada lado. Contenção e satisfação entram como contexto, nunca como resposta à pergunta de custo.
Deixe um comentário