ia-atendimento

Speech Analytics em 2026: como usar IA nas chamadas

Entenda como a IA mudou o Speech Analytics e como usar transcrição e análise de chamadas para avaliar o atendimento do seu contact center.

TL;DR — Speech analytics deixou de auditar 3% das chamadas por amostragem pra julgar 100% delas. A receita que se consolidou é empilhar três gerações de tecnologia: sinais acústicos baratos, regras auditáveis e LLM com citação literal — cada camada acionada por custo, não por moda. Quem ainda vende monitoria por amostragem ficou pra trás; quem joga LLM em tudo quebra na primeira inspeção regulatória. O divisor de águas não é mais “tem ou não tem speech analytics” — é “monitora 100% com evidência rastreável, ou ainda sorteia 3%?”.

Dois anos atrás a conversa era outra

Quem trabalha em operação de contact center conhece o paradoxo da monitoria: a área que mais influencia a qualidade do atendimento é, também, a que enxerga menos. A regra silenciosa do mercado sempre foi a mesma — auditar de 2% a 5% das chamadas, sortear amostras, treinar o avaliador pra julgar com critério. Os outros 95% a 98% das ligações ficavam fora do radar. E era nesse espaço cego que moravam as não-conformidades que ninguém pegava.

Em 2024 essa equação começou a virar. Em 2026 ela já virou. Plataformas como NICE, Verint, Five9, Genesys, Observe.AI, Cresta, Talkdesk e MaestroQA hoje vendem como tabela básica algo que era impensável há três anos: monitorar 100% das interações automaticamente, com nota, com justificativa e com trecho citado. O mercado brasileiro de contact center analytics deve sair de US$ 95,7 milhões em 2025 para US$ 352 milhões em 2035 [Market Research Future] — e a velocidade de adoção é mais sintoma do que causa. Quando a tecnologia fica boa o suficiente, o argumento de “amostragem é o que dá” simplesmente some.

Este post é um mapa do que está acontecendo, traduzido pra quem precisa decidir o que comprar, o que cobrar do fornecedor atual e como conversar com a diretoria sobre o assunto. Sem hype, com a parte chata da regulação incluída — porque é nela que a maioria das demos escorrega.

As três gerações de speech analytics que hoje convivem na mesma plataforma

Quando um fornecedor diz “nós temos IA”, ele está, na prática, oferecendo uma mistura de três tecnologias diferentes que conviveram historicamente em camadas distintas. Cada uma resolve um problema, cada uma tem um custo, cada uma tem um limite. Entender as três é a forma de não pagar caro por uma feature que você já tem nem ficar de fora de uma que mudaria o jogo.

Geração 1 — a camada que ouve o ritmo, não as palavras

A análise mais antiga não transcreve nada. Ela mede o sinal de áudio diretamente: quanto tempo o atendente falou, quanto tempo o cliente falou, quantos segundos de silêncio teve, quantas vezes os dois falaram por cima (o “overtalk”), quão rápido foi o ritmo, se houve alteração de tom. São métricas que rodam em centavos por mil chamadas e cabem em 100% do volume desde sempre.

Pra quem toca a operação, isso traduz coisas concretas: silêncio prolongado costuma ser pesquisa em sistema mal indexado; atendente falando muito mais que o cliente numa chamada de retenção é sinal de script lido sem escuta; overtalk geralmente é cliente irritado tentando interromper; ritmo acelerado pode ser ansiedade ou alguém querendo encerrar logo. A Cogito — comprada pela Verint em outubro de 2024 — construiu o negócio inteiro em cima de mais de 200 sinais acústicos e linguísticos processados em tempo real [Cogito / Verint]. A autenticação por voz da NICE usa o mesmo tipo de sinal pra confirmar identidade em poucos segundos, só pelo jeito de falar.

O que mudou nessa geração? Nada. Ela continua igual. O que mudou é que deixou de ser o ponto alto da arquitetura — virou a triagem barata que aciona as camadas caras só quando faz sentido.

Geração 2 — regras escritas, scorecard automático

A geração que dominou os contratos entre 2010 e 2022 transcrevia tudo e depois deixava o analista escrever regras: a categoria “objeção de preço” são as frases X, Y, Z ditas pelo cliente dentro de 8 palavras das frases A, B, C; a categoria “atendente se identificou” são as frases do atendente nos primeiros 30 segundos; “menção à concorrência” é a lista de nomes do setor. CallMiner com a Eureka Query Language, Verint com Categories e Themes, NICE Nexidia com indexação fonética, Genesys Cloud com Topics e Programs — todos convergiram pro mesmo modelo de regras booleanas com proximidade e filtro de canal [CallMiner], [Genesys].

Em linguagem de operação: o sistema entrega um scorecard preenchido automaticamente, onde “sim/não” é decidido por regra. “Cliente reclamou de cobrança?” — verdadeiro se a categoria correspondente disparou. Cada item tem peso, soma o total, sai a nota. Roda em 100% das chamadas em CPU comum, dá pra auditar a regra inteira em texto e, quando o atendente contesta, o supervisor mostra exatamente qual frase, em que segundo, disparou o sinalizador.

Essa camada não morreu — pelo contrário. Continua sendo o substrato regulatório aceito por Anatel, Procon e perícia trabalhista, porque regra escrita é determinística, explicável e versionável. Guarde essa frase, ela volta no fim do post: LLM responde, regra audita.

Geração 3 — perguntar em português e receber resposta em segundos

A virada dos últimos dois anos. Em vez de configurar expressão booleana, o supervisor escreve em texto livre: “o atendente ofereceu o produto complementar?”, “o cliente mencionou a concorrência?”, “por que essa venda não fechou?”. O LLM lê a transcrição segmentada, responde sim ou não, atribui pontuação e — o detalhe que muda tudo — cita o trecho exato da fala que sustenta a resposta, com o timestamp clicável pro supervisor ouvir.

Observe.AI vende isso como Auto-QA: o sistema preenche o formulário humano e mostra a evidência. MaestroQA tem o AskAI, onde o usuário pergunta em linguagem natural sobre listas de até mil conversas (“o que os clientes do estado X estão reclamando esta semana?”). Cresta tem o AI Analyst. NICE tem o Enlighten, voltado pra diretoria fazer perguntas tipo “por que o CSAT caiu na região Sul?”. Talkdesk, Dialpad e Sprinklr correram pro mesmo lugar. Cinco coisas viraram tabela nessa camada:

A primeira é a citação literal obrigatória. Toda resposta do LLM precisa estar ancorada num trecho específico da gravação. Sem isso, contestação do atendente vira disputa de palavra e a plataforma perde credibilidade no primeiro confronto. Pesquisa acadêmica recente já está medindo a factualidade de afirmações de LLM sobre transcrição de call center — sinal de que o setor reconheceu o problema do “alucinar com confiança”.

A segunda é a calibração progressiva como parte da experiência, não como bug. Humano e máquina avaliam lado a lado, o supervisor concorda ou discorda, e o sistema ajusta. É ciclo de tuning, não promessa de acerto perfeito no dia um.

A terceira é o coaching automático escrito. O sistema redige o feedback que o supervisor entregaria — pontos fortes, pontos a melhorar — e o atendente pode receber antes mesmo da reunião formal. Reduz a dependência da agenda do supervisor.

A quarta é a interface conversacional sobre o acervo. A diretoria deixa de ouvir gravação ou ler dashboard e passa a perguntar. O Gong popularizou isso em vendas com o “Ask Anything”; o contact center copiou a experiência.

A quinta é multi-LLM por desenho. Verint Open Platform e MaestroQA deixam o cliente escolher o modelo por jurisdição, custo ou idioma. Ficar preso num único provider virou fraqueza competitiva no discurso enterprise — com a ressalva, importante pra qualquer operação regulada, de que multiplicar modelos sem governança multiplica também a superfície de auditoria.

Speech ou interaction analytics? Você vai ver os dois termos. “Speech analytics” é a análise da fala — a chamada de voz. “Interaction analytics” é o guarda-chuva que inclui também texto (chat, e-mail, WhatsApp). As três gerações acima nasceram na voz e é por isso que este post fala de speech analytics: é onde o problema é mais difícil (transcrever áudio ruim) e onde o ganho de cobertura é maior.

As três gerações em uma tabela

GeraçãoO que analisaRoda em quanto do volumeCusto relativoO limite
1 — AcústicaRitmo, silêncio, overtalk, tom — o sinal, não as palavras100% sempreCentavos / mil chamadasNão sabe o que foi dito
2 — Regras + scorecardCategorias booleanas sobre a transcrição (frase X perto da frase Y)100%Alguns dólares / mil chamadasSó pega o que você previu numa regra
3 — LLM com citaçãoPergunta em linguagem natural, resposta com trecho citado5% a 20% (acionado pelas camadas anteriores)Caro por chamadaPrecisa de citação literal pra ser auditável

O pipeline em camadas que sustenta tudo isso

A pergunta natural de quem toca operação é: se cada chamada precisa de transcrição mais regra mais LLM, o custo não explode? Não — porque ninguém roda tudo em todas as chamadas. O padrão de arquitetura que se consolidou tem até nome em patente americana (“multi-pass speech analytics”, [USPTO 9171547]) e foi formalizado num paper recente da Cisco [arXiv 2503.19090].

A ideia é simples e tem cara de operação de BPO bem feita: as camadas baratas rodam em todo mundo, e as caras só disparam quando vale a pena. Acústica e metadados (silêncio, overtalk, duração, transferências) rodam em 100% por centavos. Transcrição mais regras rodam em 100% por alguns dólares por mil chamadas. NLP leve (classificação, sinais de insatisfação) roda em 100% também. O LLM caro — o que dá a resposta sofisticada com citação — roda em 5% a 20% das chamadas, só as que as camadas anteriores sinalizaram como dignas de atenção: flag de compliance, score baixo, sinal de cliente irritado, supervisor pediu, atendente recém-contratado.

É o oposto do que muita operação faz hoje (sortear 3% no aleatório) e o oposto do que um fornecedor desavisado faria (jogar LLM em tudo e repassar a conta). É monitoria do problema, não da sorte.

O que muda no dia a dia da operação

Quatro mudanças concretas que um gestor percebe nos primeiros 90 dias, depois de implantar a coisa direito.

Cobertura passa de 3% para 100%. Compliance que escaparia da amostra é capturado em tempo quase real. Não é só “monitorar mais” — é monitorar diferente. Em vez de sortear chamada pra julgar tudo, o sistema julga tudo e prioriza o que merece olho humano.

A monitoria deixa de ser gargalo. O scorecard humano vira scorecard preenchido automaticamente, e o monitor passa a calibrar e contestar, não a preencher. Operações que tinham fila de monitoria atrasada em dias passam a operar em D+0 com folga.

O coaching sai por escrito sem esperar a agenda do supervisor. Cada atendente recebe feedback redigido, com trechos da própria chamada citados, minutos depois da ligação. Quando o supervisor faz a reunião, está ratificando o que o atendente já viu — economiza tempo e reduz atrito.

A diretoria pergunta direto à base. O diretor de operações deixa de pedir relatório e passa a perguntar: “o que mudou nas reclamações esta semana?”, “as objeções de preço aumentaram desde a campanha nova?”, “o time da Joana está mencionando concorrente mais que os outros?”. Resposta em segundos, com a lista de chamadas pra abrir e conferir.

O que NÃO mudou — e por que isso importa

Aqui está a parte que costuma escapar nas demos vendedoras: regulação não mudou, contestação trabalhista não mudou, fluxo de feedback assinado não mudou.

A Anatel não relaxou nada. O Regulamento Geral de Direitos do Consumidor — hoje a Resolução 765/2023, que substituiu a antiga 632/2014 — mantém a gravação das interações de call center como obrigação, com retenção por prazo mínimo (a referência histórica do regulamento é de seis meses) e direito do consumidor a pedir cópia. Se algo mudou no entorno, foi pra apertar: a Resolução 777/2025 caminha pra tornar obrigatória a autenticação de chamadas até 2028.

A LGPD continua tratando a gravação de atendimento como dado pessoal — e como dado sensível quando há biometria de voz envolvida, ou quando o cliente verbaliza CPF, dado bancário ou de saúde no meio da chamada, o que acontece o tempo todo. E a perícia trabalhista vai continuar pedindo a mesma coisa de sempre quando um atendente contestar uma demissão: regra escrita, segundo exato, gravação preservada.

A consequência prática é direta: a Geração 2 (regras + scorecard auditável) não morre — ela vira o substrato regulatório por baixo da Geração 3. O LLM responde, mas a regra é o que se mostra pro perito. Por isso quem está construindo plataforma séria hoje, em vez de aposentar as regras, está empilhando: a regra valida o que é auditável, o LLM cobre o que não cabe em regra.

Três armadilhas comuns na adoção

Comprar pela demo. Demonstrações de speech analytics são feitas em chamadas curadas: áudio limpo, sotaque neutro, cliente educado. A operação real tem ruído de telefonia, sotaques regionais, dois ou três interlocutores falando juntos, atendente lendo script colado. O Whisper, hoje uma das referências em transcrição aberta, fica em torno de um dígito de WER (taxa de erro por palavra) em PT-BR bem gravado e sobe pra faixa de 17% a 22% (ou mais) em telefonia ruim [Whisper / WER]. Toda regra e todo prompt que dependem da transcrição herdam esse erro. Pedir piloto em 200 chamadas reais da sua operação, com o áudio do seu gravador e o sotaque da sua base, é o mínimo pra não ser enganado.

Não exigir citação literal. Se a plataforma só te dá um “sim/não” sem mostrar onde, na chamada, a coisa foi dita, ela está te empurrando uma opinião computacional. Na primeira contestação séria, vira a sua palavra contra a do atendente. Citação clicável no áudio é o teste de fogo — peça pra ver na demo, com uma chamada sua.

Assumir que LLM substitui regra. O mercado já fez essa curva: começou em 2023 dizendo que o LLM resolveria tudo e voltou em 2025 dizendo que LLM mais regra é o padrão. Quem mantém as duas camadas em paralelo — regra auditável + LLM gerador de evidência — é quem está passando em compliance regulado. Plataforma que joga a regra fora tem dificuldade na primeira inspeção da Anatel ou na primeira perícia.

Pra onde isso vai

Três movimentos visíveis nos próximos dezoito meses, pra quem está de olho.

Convergência de canais. Voz, chat, e-mail, WhatsApp e ticket indo pra mesma camada de análise, com o mesmo scorecard, o mesmo Auto-QA e a mesma busca conversacional sobre o acervo inteiro. NICE e CallMiner trabalham isso há tempo, mas é em 2026 que o discurso encosta no produto.

Assistência em tempo real virando expectativa, não diferencial. Sugestões na tela do atendente durante a ligação — Cresta, Cogito, Dialpad, Talkdesk, NICE. Vai chegar a hora em que operação sem assistência ao vivo vai parecer operação sem URA: coisa dos anos 2000.

Bolsa de modelos, não modelo único — no discurso enterprise. O cliente escolhe qual LLM roda pra cada tipo de análise, equilibrando custo, idioma e residência de dados. Operações sensíveis a LGPD tendem a preferir modelos com cláusula clara de tratamento e dados hospedados sob regra brasileira. Vale a ressalva que já fizemos: flexibilidade de modelo é poder, mas cada modelo a mais é mais uma superfície pra auditar.

Onde o Interaflow se encaixa

A gente construiu o Interaflow com uma tese clara sobre essa categoria: a maioria das operações brasileiras de 20 a 200 PAs não precisa da suíte enterprise inteira — precisa da cobertura de 100% pelo preço que o mid-market consegue pagar. Por isso o nosso Speech Analytics é deliberadamente “Light”.

Na prática, isso quer dizer: transcrição em PT-BR em 100% das chamadas, busca full-text em todo o acervo de gravação, classificação por critério que o supervisor configura (“compliance dito?”, “objeção de preço tratada?”, “promessa fora da alçada?”), heatmap de fase × resultado e flag automático no painel quando um critério bate — a chamada entra como “requer revisão” em vez de dormir no aleatório. Em cima disso roda a Monitoria de Qualidade, que aplica o scorecard e a avaliação automática por IA nas conversas elegíveis. É a lógica do pipeline em camadas deste post, montada pra operação brasileira.

E a parte que a gente conta sem rodeio, porque é onde a honestidade separa fornecedor de vendedor: análise de sentimento por trecho em tempo real, topic modeling automático em escala e modelagem preditiva (churn, propensão) ainda não estão no produto — estão no roadmap. Quem precisa disso desde ontem, a comparação certa é com suíte enterprise, e a gente trata isso de frente na página comparação com NICE / Verint / CallMiner. Quem resolve a vida com classificação configurada, busca e citação de trecho — que é a maioria — encontra no Interaflow o essencial sem o projeto de seis meses.

Se quiser o detalhe técnico (como entra o áudio do seu PABX legado, como funciona a classificação, o que está incluído no plano), o lugar é a página Speech Analytics. Se o seu problema é mais o scorecard e a nota por atendente, comece por Monitoria de Qualidade.

Fechando

A linha que separa um BPO competitivo de um que só sobrevive em 2026 não é mais “tem ou não tem speech analytics”. É outra, e cabe em três perguntas:

  1. Monitora 100% das chamadas com evidência rastreável, ou ainda sorteia 3%?
  2. Tem citação clicável da gravação, ou só dashboard colorido?
  3. Deixa o diretor perguntar à base em português, ou só entrega relatório?

A tecnologia pra responder “sim” às três existe, é provada e está disponível tanto em fornecedor global quanto em opção nacional com aderência à LGPD. O que decide quem vai usar bem e quem vai jogar dinheiro fora é a clareza sobre as três camadas — qual problema cada uma resolve, qual roda em todo mundo e qual roda só nos casos selecionados, e onde está o tribunal final quando o atendente contestar.

A IA passou a ouvir todas as chamadas. A pergunta agora é o que a sua operação vai fazer com isso.

Para se aprofundar

  • Verint Speech Analytics / Open Platform — referência da Geração 2 que evoluiu pra multi-LLM. [Verint]
  • NICE Enlighten — interface conversacional pra diretoria perguntar à base. [NICE]
  • Observe.AI Auto-QA — referência prática de citação literal e calibração humano/máquina. [Observe.AI]
  • MaestroQA AskAI — pergunta livre sobre acervo de até mil conversas, com escolha de modelo. [MaestroQA]
  • LLM-Based Insight Extraction for Contact Center Analytics (Cisco) — paper que formaliza o pipeline em camadas com roteamento por custo: arxiv.org/abs/2503.19090
  • Patente USPTO 9.171.547 — Multi-pass speech analytics — a descrição patentária do princípio “camada barata aciona camada cara”: patents.google.com/patent/US9171547
  • Mercado brasileiro de Contact Center Analytics (Market Research Future) — projeção 2025–2035: marketresearchfuture.com

Última atualização: junho de 2026. Esse post é mantido vivo — se a regulação, o mercado ou a plataforma mudaram desde então, conta pra gente.

FAQ