Transcrição de chamadas: como transcrever ligações
Passe a gravação de um webinar por qualquer ferramenta de transcrição moderna e o resultado sai quase perfeito. Passe a ligação de vendas da última terça-feira pela mesma ferramenta e metade dos sobrenomes estão errados, os preços mudaram e, em algum ponto no meio, as duas pessoas aparentemente viraram uma só. Mesmo software, mesmos falantes, resultados completamente diferentes — e o motivo quase não tem nada a ver com o modelo.
A transcrição de chamadas é tratada como um subconjunto da transcrição comum. Está mais perto de ser uma disciplina à parte. Tudo o que você costuma presumir sobre qualidade de áudio, separação de falantes e onde o arquivo fica muda no momento em que a conversa passa por uma linha telefônica em vez de entrar num microfone. Se você quer a mecânica geral de transformar fala em texto, explicamos como a transcrição realmente funciona em outro artigo. Este é sobre a parte que as ligações telefônicas quebram.
Por que uma ligação telefônica é um problema mais difícil que uma reunião
Comece pelo que a rede joga fora. A telefonia tradicional é de banda estreita: o áudio é amostrado a 8 kHz, o que significa que tudo acima de cerca de 3,4 kHz é descartado antes mesmo de chegar a um gravador. Essa faixa não é decorativa. É onde mora a diferença entre um s e um f, onde o ch se separa do s, onde uma sibilante carrega detalhe suficiente para distinguir sessenta de setenta. O áudio de banda larga, amostrado a 16 kHz, preserva essa faixa. Uma linha telefônica, não.
Os sistemas de reconhecimento de fala modernos são treinados majoritariamente com áudio de banda larga e, quando recebem uma entrada de 8 kHz, a maioria primeiro a reamostra para cima. A reamostragem deixa o arquivo no formato certo. Ela não devolve o que foi removido. Não há informação nas frequências reconstruídas, porque nunca houve.
As consequências aparecem nos números, e é por isso que os benchmarks publicados enganam com tanta consistência. Estudos controlados que mudam apenas a taxa de amostragem constatam que a banda estreita, sozinha, já custa precisão. As ligações reais ainda empilham por cima a compressão do codec, as redes móveis, as falas sobrepostas e o ruído de fundo, e as taxas de erro em áudio real de central de atendimento costumam ser relatadas em várias vezes os números dos rankings. Os benchmarks dos fornecedores quase sempre são feitos com gravações limpas de banda larga, então trate qualquer número de precisão em destaque como um teto para o áudio telefônico, não como uma previsão.
A compressão acrescenta sua própria camada. O G.711, ainda o codec de batalha da rede telefônica, é de banda estreita por definição. G.722, Opus e EVS transportam áudio de banda larga ou superior e soam visivelmente melhor, mas só ajudam se cada trecho da chamada os suportar. Um único participante que entra pelo celular puxa a conversa inteira para o menor denominador comum, porque a rede precisa transcodificar para algo que as duas pontas entendam.
Um diagnóstico que leva trinta segundos. Abra uma chamada gravada em qualquer editor de áudio e mude para a visualização de frequências. Se a energia para de repente numa linha reta em torno de 3,4 kHz, você está lidando com áudio de banda estreita, e nenhuma troca de fornecedor de transcrição vai resolver isso. Mudar a forma como a chamada é transportada — um trecho VoIP em vez de um móvel, um headset em vez do viva-voz — vai.
Um canal ou dois, e por que isso decide tudo
A segunda coisa que separa o áudio de chamadas do áudio de reuniões é quantas faixas você acaba tendo, e isso importa mais do que a maioria dos compradores percebe.
Uma chamada tem dois trechos. Se a sua gravação os captura separadamente — quem ligou no canal esquerdo, o agente no direito —, a separação de falantes deixa de ser um problema de machine learning. Passa a ser um fato do arquivo. Cada palavra do canal um pertence a uma pessoa, cada palavra do canal dois pertence à outra, e a transcrição sai rotulada corretamente mesmo quando as duas falam ao mesmo tempo.
Misture esses dois trechos numa única faixa mono e você jogou essa certeza fora. Agora o software precisa distinguir os falantes só pela voz, usando altura, timbre e ritmo. Com áudio limpo de banda larga, isso funciona razoavelmente bem. Numa linha telefônica de banda estreita, em que justamente as frequências que distinguem uma voz da outra foram filtradas, funciona bem pior — e as conversas por telefone estão cheias exatamente da situação que quebra isso, porque, sem pistas visuais, as pessoas se interrompem muito mais do que cara a cara.
As plataformas de central de atendimento gravam em dois canais por padrão há anos justamente por isso. Muitos sistemas de telefonia empresarial e a maioria dos apps de gravação para consumidores ainda entregam um único arquivo mixado. Antes de concluir que uma ferramenta de transcrição é ruim com as suas chamadas, confira qual dos dois você está entregando a ela.
PSTN, VoIP e o elo mais fraco da corrente
Três caminhos levam as chamadas empresariais, e eles produzem três qualidades diferentes de gravação.
A PSTN (a rede de telefonia fixa comutada) e o celular são o caminho legado: banda estreita, sempre, com o celular acrescentando sua própria compressão por cima. Esse é o piso. O VoIP pode ser muito melhor, já que uma chamada de softphone para softphone em Opus ou G.722 é de banda larga de verdade, mas isso só vale quando os dois terminais e cada salto no meio do caminho negociam um codec de banda larga. Chamadas mistas caem para o padrão inferior. Plataformas de conferência como Zoom, Google Meet e Microsoft Teams são de banda larga de ponta a ponta quando todos entram por um app, e esse é o verdadeiro motivo pelo qual as transcrições de reuniões são tão mais legíveis que as de chamadas.
Esse último ponto tem uma consequência prática. Uma reunião no Teams com seis pessoas em notebooks e uma pela linha de discagem não produz apenas um falante ruim — muitas vezes produz uma reunião em que o participante por telefone é transcrito visivelmente pior que todos os outros, e em que qualquer coisa que ele diga por cima de outra pessoa provavelmente se perde. Se um stakeholder sempre entra por telefone, vale saber disso antes de confiar no registro.
Cinco maneiras de transcrever uma chamada
Não existe uma resposta única aqui, só trade-offs, e a certa depende muito mais de onde a transcrição precisa parar do que de qual motor está uma fração mais preciso neste trimestre.
| Caminho | Precisão em áudio telefônico | Estrutura de custo | Onde a transcrição vai parar | Melhor quando |
|---|---|---|---|---|
| Telefonia nativa ou ligações pelo CRM | Razoável. Geralmente mono, raramente ajustada ao seu vocabulário | Incluído no assento, mas condicionado. A HubSpot só transcreve chamadas feitas com um assento Professional ou Enterprise do Sales Hub ou do Service Hub; o Starter inclui 500 minutos de ligação por mês por conta, e contas gratuitas recebem pouco ou nada | Automaticamente no registro do contato ou do negócio | Os vendedores já ligam de dentro do CRM |
| API de telefonia ou CPaaS | Teto mais alto. Você escolhe o motor e pode pedir dois canais | Medido e cumulativo. A Twilio, por exemplo, cobra a transcrição por minuto, com a gravação e a própria chamada cobradas em linhas separadas | Onde você escrever código para colocá-la | Você tem engenheiros e requisitos incomuns |
| Assistente de reuniões | Forte em chamadas por app, mais fraca nos trechos por discagem | Por usuário por mês, muitas vezes com uma franquia gratuita | No próprio espaço de trabalho, mais sincronização com o CRM onde houver | A maioria das chamadas acontece no Zoom, Meet ou Teams |
| Suíte de central de atendimento | A melhor da categoria em telefonia. Dois canais por padrão, ajustada para banda estreita | Pesado. O plano de voz da Five9 aparece em tabela por volta de $159 por usuário simultâneo por mês, com mínimo de 50 assentos; o Genesys Cloud CX 4 aparece a $240 | A plataforma, com assistência ao agente ao vivo durante a chamada | Você opera volume de chamadas, não reuniões |
| Serviço humano ou híbrido | A mais alta em áudio realmente ruim | O mais caro por chamada, e o mais lento | Um arquivo entregue que você mesmo encaminha | A chamada vai ser lida por um tribunal ou um órgão regulador |
Os preços são preços de tabela publicados em 2026; os contratos de central de atendimento, em particular, costumam ser negociados bem abaixo disso quando há volume.
A maioria dos times pensa demais na coluna "Precisão em áudio telefônico" e de menos na coluna "Onde a transcrição vai parar". Uma suíte de central de atendimento é a resposta tecnicamente correta para telefonia e a compra errada para uma empresa de doze pessoas que faz quatro chamadas de descoberta por semana no Google Meet. Para um time desse formato, o caminho do assistente de reuniões costuma ganhar em custo e naquilo que realmente importa, que é se o resultado chega ao CRM. Uma ferramenta como o assistente de reuniões com IA da Laxis fica nessa faixa: captura no Zoom, no Google Meet e no Microsoft Teams, aceita arquivos MP3, WAV e M4A enviados de chamadas gravadas em outro lugar e, no plano Business, envia resumos e itens de ação para o HubSpot ou o Salesforce. A ressalva honesta é a mesma que vale para qualquer ferramenta dessa coluna: ela é construída em torno de reuniões e conversas, não de volume de chamadas de central de atendimento, então, se você transcreve quatro mil chamadas por dia, compre a plataforma feita para isso. Há uma seleção mais completa de anotadores com IA se é nessa coluna que você está comprando.
Ao vivo, ou depois que todo mundo desligou
Transcrição em tempo real e transcrição pós-chamada parecem o mesmo recurso e não se comportam nem um pouco da mesma forma.
A transcrição em streaming devolve o texto um ou dois segundos depois de as palavras serem ditas, e é isso que torna possíveis a assistência ao vivo para agentes, os alertas de compliance e a tradução na tela. O preço é a precisão. Um sistema em streaming precisa se comprometer com um palpite antes de ouvir o fim da frase e, embora revise as palavras anteriores à medida que chega mais áudio, nunca tem o luxo do contexto completo. O processamento pós-chamada tem. Ele dispõe da gravação inteira, pode olhar para a frente e para trás, e em geral é mais preciso e mais barato por minuto.
A jogada útil é parar de tratar isso como uma escolha única. A saída ao vivo serve para o que precisa acontecer durante a chamada. A saída pós-chamada serve para o registro, o resumo, a entrada no CRM e tudo o que alguém vai ler depois. Muitas plataformas fazem as duas coisas, e não há motivo para a mesma chamada não produzir um feed ao vivo aproximado e uma transcrição final limpa.
Duas melhorias baratas que valem mais que trocar de fornecedor. Carregue um vocabulário personalizado com os nomes dos seus produtos, dos concorrentes, os formatos de SKU e os sobrenomes que seus vendedores estropiam — nomes próprios são onde as transcrições de ligações falham de forma mais visível, e nenhum modelo os adivinha sem ajuda. Depois, coloque todo mundo de headset. Viva-voz numa sala de paredes duras acrescenta eco, e o eco confunde a separação de falantes mais rápido do que qualquer sotaque.
A parte que decide se tudo isso valeu a pena
Esta é a verdade incômoda sobre software de transcrição de chamadas: a precisão é o que todo mundo avalia, e o fluxo de trabalho é o que determina se a compra se paga.
Uma transcrição parada numa ferramenta que ninguém abre não tem valor. Uma transcrição vinculada ao contato certo, na oportunidade certa, pesquisável ao lado do restante do histórico daquela conta, muda a forma como um negócio é conduzido. A distância entre esses dois resultados é uma questão de encanamento, e vale a pena resolvê-la antes de comparar motores.
Três coisas fazem a diferença. A transcrição precisa estar vinculada a um registro, não apenas armazenada — contato, empresa e negócio em aberto, identificados automaticamente pelo número de telefone ou pelo convite da agenda. Precisa ser reduzida a algo legível, porque ninguém rola um registro literal de quarenta minutos procurando a objeção; o que se usa é um resumo e uma lista de compromissos com nomes ao lado. E precisa chegar sem uma etapa humana, já que qualquer fluxo que dependa de um vendedor se lembrar de colar algo vai parar de funcionar silenciosamente na terceira semana.
É nesse último requisito que a maioria das configurações falha, e é por isso que as ligações nativas do CRM e os assistentes que sincronizam com o CRM rendem acima do que suas notas de precisão sugerem. O Laxis, por exemplo, extrai itens de ação já com responsáveis e, no plano Business, sincroniza o resultado com o HubSpot ou o Salesforce sem que ninguém abra a transcrição; o processamento acontece na nuvem, e não no seu dispositivo, o que vale conferir com a sua própria política antes de se comprometer.
O que esperar e como descobrir gastando pouco
Não compre com base num número de precisão publicado. Pegue cinco gravações reais — a da linha ruim, a do sotaque forte, aquela em que o responsável de compras do cliente fala por cima do seu executivo de contas — e passe-as por todas as ferramentas da sua lista final. Conte os erros que realmente custariam algo a você: números errados, nomes errados, atribuição errada de quem concordou com o quê. Erros de digitação em palavras de preenchimento são ruído.
Ajuste as expectativas de acordo. Numa chamada VoIP limpa, com duas pessoas de headset, bons sistemas chegam ao mesmo patamar do áudio de reuniões. Numa ligação de celular com barulho de trânsito e um sotaque que o modelo pouco ouviu, a transcrição vai servir para relembrar e não vai ser confiável para citar. As duas coisas podem valer para o mesmo fornecedor no mesmo dia, e é exatamente por isso que o fornecedor não consegue dar a você um número único e falar sério.
Uma coisa não é opcional: acerte o consentimento antes de qualquer coisa disso rodar, porque as regras variam por jurisdição e as penalidades não são teóricas. Nosso guia sobre como gravar uma ligação telefônica cobre a mecânica prática e as regras de consentimento, incluindo os estados dos EUA que exigem a concordância de todas as partes.
Onde isso deixa você
A mudança interessante na transcrição de chamadas não é que os modelos melhoraram, embora tenham melhorado. É que o gargalo mudou de lugar. Durante a maior parte da última década, a parte difícil era acertar as palavras. Agora, a parte difícil é uma faixa de frequências que a rede telefônica vem descartando há décadas e um conjunto de decisões sobre como a gravação é capturada — um canal ou dois, app ou discagem, banda larga ou o que a rede conseguiu negociar. Essas escolhas são feitas por quem configura o sistema de telefonia, normalmente sem que ninguém mencione transcrição.
O que torna esta uma situação rara em que a melhoria mais barata disponível não é uma compra. É uma conversa com quem cuida da sua telefonia, com duas perguntas: dá para gravar os dois trechos separadamente, e dá para manter mais chamadas num caminho de banda larga. Responda a essas duas e quase qualquer motor competente dá conta.
Perguntas frequentes
O que é transcrição de chamadas?
Transcrição de chamadas é a conversão de uma conversa por telefone ou VoIP em texto pesquisável, geralmente com cada falante identificado e cada linha com marcação de tempo. Ela difere da transcrição de um arquivo de áudio comum num ponto importante: o som passou por um canal telefônico comprimido e pode chegar como uma única gravação mixada ou como dois trechos separados.
Qual é a precisão da transcrição de chamadas em áudio telefônico?
Espere uma precisão visivelmente menor do que os números que os fornecedores publicam, porque eles vêm de gravações limpas de banda larga. A banda estreita, sozinha, já custa precisão, e as ligações reais acrescentam compressão, falas sobrepostas e ruído por cima, de modo que as taxas de erro em áudio telefônico podem ser várias vezes maiores que o número em destaque. Gravação em dois canais e vocabulário personalizado recuperam boa parte disso.
Dá para transcrever ligações telefônicas automaticamente?
Sim. A maioria dos sistemas de telefonia empresarial, dos CRMs com telefonia nativa e das plataformas de central de atendimento transcreve automaticamente assim que a gravação é ativada, e as APIs de telefonia devolvem texto ao vivo se você desenvolver em cima delas. A limitação prática costuma ser de licenciamento, e não de tecnologia, já que muitos planos restringem a transcrição a um nível de assento pago ou a uma franquia mensal de minutos.
Qual é a melhor forma de transcrever chamadas de vendas?
Escolha o caminho que coloca a transcrição no registro certo do CRM sem que ninguém copie nada. Na prática, isso significa ou um discador com registro nativo no CRM, ou um assistente de reuniões que sincronize com o HubSpot ou o Salesforce para chamadas feitas no Zoom, Google Meet ou Teams. A precisão bruta importa menos do que um vendedor chegar a abrir o documento.
A transcrição de chamadas funciona em tempo real?
Sim, embora a transcrição ao vivo e a pós-chamada sejam, na prática, produtos diferentes. Sistemas de streaming devolvem texto em um ou dois segundos e revisam palavras anteriores à medida que chega mais áudio, o que limita sua precisão, porque eles não conseguem ver o que vem a seguir. O processamento depois da chamada tem a gravação inteira disponível e costuma ser mais preciso e mais barato.
Onde as transcrições de chamadas devem ser armazenadas?
Onde as pessoas que precisam delas já trabalham, o que, para times de receita, significa o CRM, vinculadas ao contato e à oportunidade em aberto em vez de estacionadas numa ferramenta separada. Times regulados acrescentam prazos de retenção e controles de acesso por cima. Uma transcrição que ninguém encontra na hora de escrever um follow-up custou dinheiro em vez de economizar.