Inteligência Artificial

Métricas de IA em SaaS

Quando o custo por inferência deixa de ser o denominador certo

10 de ago. de 2026·Ricardo Coelho

Acompanhei um cliente que colocou uma feature de IA em produção com F1 score acima de 0,85, e o time de produto declarou sucesso. Três meses depois, 11% dos usuários ativos tinham tocado nela alguma vez, enquanto o custo de inferência subia 40% sem aumento proporcional de receita. Ninguém conseguia responder se aquilo gerava retenção ou apenas tokens. É um padrão recorrente: as empresas que embarcam IA rastreiam acurácia, latência e uptime com precisão, mas deixam sem instrumentação tudo que existe entre a inferência e o impacto no negócio.

A adoção continua sendo a mais subestimada das métricas, e é por onde começo qualquer diagnóstico. A feature usage rate, ou seja, o percentual de usuários ativos que tocam na funcionalidade ao menos uma vez por período, possui valores de referência bem mapeados. A adoção média de core features em SaaS fica em torno de 24,5%. Se chega a 28%, isso já indica engajamento saudável. Em produtos onde a IA não é o core, a marca costuma ficar abaixo de 15%. Times gastam meses ajustando os prompts e a latência de um recurso que 9 em 10 usuários sequer sabiam que existia. Ora, se ninguém usa, a acurácia é irrelevante.

A adoção sem efeito prático também não sustenta nada. A task completion rate mede a fração de interações que terminam em tarefa concluída sem intervenção manual. É um dado diferente da acurácia: uma resposta correta que o usuário precisa reformatar não concluiu a tarefa. Plataformas de suporte com resolução por IA madura reportam first contact resolution entre 55% e 70% no primeiro ano, e a Gartner registra mediana de 1,84 dólar por contato em autoatendimento contra os 13,50 do canal assistido. O complemento é time saved per interaction, que exige uma linha de base sem IA pra comparar, e que quase ninguém se preocupa em montar antes de lançar.

Quem fez da IA generativa seu foco principal precisa estar preparado para atualizar o vocabulário constantemente. Só em 2026 vimos uma progressão com pelo menos quatro degraus: a skill, que nomeia a capacidade empacotada que o modelo aciona; o harness, ou o ambiente que dá a ela ferramenta, permissão e estado durável; o loop, que fornece um ciclo de agir e verificar até bater o critério de sucesso ou estourar o teto de orçamento; e o grafo, que amarra vários agentes em caminhos explícitos, com portas humanas e rotas de recuperação. O grafo aqui é topologia de execução, quais nós rodam, em que ordem e o que corre em paralelo, e não a representação semântica do estoque de informação que o mesmo termo carrega em outros contextos. A consequência para medição é que uma ação do usuário deixou de custar uma inferência e passou a custar uma trajetória inteira. Cost per inference não é mais o denominador ideal, e seu lugar foi tomado pela tarefa concluída, acompanhada da taxa de intervenção humana e do número de repetições do loop até fechar.

Especificamente no universo dos SaaS, o custo unitário é o palco mais fértil para severidade de consequências decorrentes de um engano. O indicador que conecta a infraestrutura ao negócio é a razão (custo de inferência / receita gerada), medida por coorte de cliente. O ICONIQ Growth, no State of AI de janeiro de 2026, mostra a inferência respondendo por 23% do gasto total do produto de IA em estágio de escala, contra 20% na fase pré-lançamento. Ela não barateia com escala, mas engorda. O padrão é sempre o mesmo: a diferença está na granularidade com que cada empresa roteia chamada pra modelo de preço apropriado. Pra quem atende carteiras enterprise e SMB com o mesmo modelo, a consequência direta é você subsidiar uma conta com a margem da outra, e sem essa razão por coorte a compressão de margem só vai ser percebida na avaliação trimestral.

Qualidade percebida merece atenção separada da acurácia, até porque os números divergem de forma brutal quando saem do benchmark pra produção. A geração atual do Vectara Hallucination Leaderboard, com dataset ampliado pra mais de 7.700 artigos e textos de até 32 mil tokens, derrubou a ilusão de taxa próxima de zero: o melhor modelo fica na casa dos 3%, e Claude Sonnet 4.5, GPT-5 e Grok-4 passam de 10%. O estudo Hallucinating Law, do RegLab de Stanford, testou GPT-3.5, PaLM 2 e Llama 2 em perguntas sobre jurisprudência federal americana e encontrou taxas de 69% a 88%. User override rate, a fração de respostas que o usuário edita ou descarta antes de usar, é o que dá pra acionar no dia a dia, até porque quem corrige a IA sistematicamente já está a caminho de desligar o recurso.

Nada disso importa se não conecta a retenção e expansão. A Andreessen Horowitz, em relatório de setembro de 2025, perguntou se empresas de IA chegariam a 150% de net dollar retention acima de 500 milhões de dólares em ARR e respondeu que talvez, pela primeira vez. O dado de campo é bem menos generoso: a ChartMogul, olhando cerca de 200 empresas de IA nativa em 2025, achou retenção bruta mediana de 40% e líquida de 48%, contra 82% no B2B SaaS tradicional. A separação está no preço, com produtos acima de 250 dólares por mês chegando a 70% e 85%, enquanto os abaixo de 50 dólares ficam em 23% e 32%. É o retention lift, ou a diferença de NRR entre coortes que usam e coortes que não usam o recurso, que separa a IA entre casos de falha e sucesso.

Se eu tivesse que escolher um ponto de partida, começaria pelo custo por tarefa concluída, medido por coorte. Adoção e qualidade percebida são mais intuitivas, mas o unitário contextualizado é o número que muda a natureza da conversa com CFO e board. O erro a não cometer é começar pelo lado do modelo e nunca chegar no lado do negócio. A instrumentação deve pertencer à funcionalidade desde o primeiro sprint, e não instrumentar não é uma opção de verdade, mas a escolha de trabalhar no escuro com um custo variável que escala com o uso.