Por que o ditado por voz é tão ruim? Causas e soluções
Por que o ditado por voz é tão ruim? (Ou voz para texto, ou digitação por voz: os mesmos motores, a mesma pergunta.) Principalmente porque o reconhecimento de voz é uma corrente (microfone, ambiente, voz, vocabulário, modelo) e a sua transcrição só é tão boa quanto o elo mais fraco. Você disse "their" e saiu "there" (duas palavras em inglês com o mesmo som). Você disse o sobrenome do seu gestor e saiu um legume. Você parou para pensar, e apareceu uma frase que você nunca disse.
Cada caso tem uma causa e uma solução diferentes. A seguir: sintomas, causas, soluções e, por fim, uma resposta direta sobre se o ditado por voz conta como IA. Está procurando uma ferramenta? Comece pelo nosso comparativo de softwares de ditado.
O ditado por voz falha por um punhado de motivos previsíveis
O ditado por voz erra palavras quando o áudio não está claro, quando as palavras são daquelas que o modelo raramente encontrou no treinamento ou quando falta contexto para escolher entre palavras que soam iguais. A maioria das reclamações vem de uma dessas três causas, e o sintoma geralmente mostra qual.
| O que você vê | Causa provável | Tente primeiro |
|---|---|---|
| Palavras erradas aleatórias, pior em alguns ambientes | Microfone longe demais, ou ambiente com eco ou barulhento | Aproxime o microfone a um palmo da boca; confira qual microfone está selecionado |
| Bem na sua mesa, inútil na rua | Vento e trânsito batendo no microfone do celular | Proteja o celular com a mão ou use fones com microfone no fio |
| Nomes, marcas e siglas sempre errados | Palavras que o modelo raramente viu | Um dicionário personalizado, ou corrigir por voz |
| "There" no lugar de "their", "two" no lugar de "to" | Palavras de mesmo som resolvidas pelo contexto | Fale em frases inteiras; revise de propósito procurando essas palavras |
| Faltam a primeira ou as duas primeiras palavras | Falar antes de ele começar a ouvir | Espere o sinal de escuta |
| Frases que você nunca disse, depois de uma pausa longa | O modelo preenchendo o silêncio | Pause o microfone enquanto pensa |
| Algo sem sentido, ou o idioma errado | Idioma ou região de ditado incorretos | Configure o idioma e a variante regional mais próxima |
| De repente piorou | Algo mudou na corrente | Refaça o caminho: fones novos, atualização, teclado novo, pacote offline |
O microfone importa mais que o modelo
Áudio ruim é a primeira coisa a descartar quando o ditado por voz vai mal: um microfone longe da boca grava o ambiente quase tão alto quanto a sua voz, e nenhum modelo consegue recuperar palavras que nunca chegaram com clareza. Microfones de notebook ficam ao lado de ventoinhas e teclados. Um celular segurado com o braço esticado numa rua movimentada grava principalmente a rua.
Headsets não são automaticamente melhores. Muitos fones Bluetooth passam para um modo de chamada de qualidade mais baixa enquanto o microfone está ativo, então um par com fio barato pode superar modelos sem fio caros. E confira o que o computador está ouvindo: o Ditado do Mac, a digitação por voz do Windows e o Dictate do Word permitem escolher o microfone, e o microfone de uma webcam do outro lado da sala pode virar o padrão sem você perceber.
Os fabricantes concordam. A página de solução de problemas da Microsoft para o Dictate do Word sugere um headset ou microfone externo e menos ruído de fundo; a ajuda do Google sobre digitação por voz recomenda ir para um lugar silencioso e conectar um microfone externo.
Ouça o que o software ouve: grave vinte segundos no app de gravador de voz do celular, exatamente de onde você costuma ditar, e depois ouça com fones. Se você ouvir a lava-louças, o exaustor ou o seu próprio teclado, o reconhecedor também ouve, e mudar o microfone de lugar vai ajudar mais do que trocar de app.
O jeito como você fala muda o que ele ouve
O jeito de falar afeta a precisão porque os reconhecedores aprendem em grande parte com fala natural e fluente; então deixar a frase morrer, engolir o final das frases ou ditar uma palavra de cada vez, bem devagar, dá menos material para o modelo. O conselho da Microsoft de "falar de forma mais deliberada" vale se deliberada significar completa, não lenta: pense a frase até o fim e diga tudo de uma vez.
Pausas longas trazem um risco mais estranho. Num estudo de 2024 intitulado "Careless Whisper", Allison Koenecke e colegas descobriram que cerca de 1% das transcrições do Whisper, da OpenAI, continham expressões ou frases inteiras que não estavam no áudio, e que essas alucinações aconteciam de forma desproporcional com falantes que tinham trechos de silêncio mais longos. A maioria das ferramentas de ditado não é construída sobre esse modelo específico, mas a lição vale do mesmo jeito.
Pense com o microfone desligado: quando precisar de mais do que alguns segundos para encontrar a próxima frase, pare o ditado, pense e recomece com a frase inteira pronta. Você terá menos frases pela metade, e o motor nunca terá um silêncio longo para preencher.
Nomes, jargões e homófonos precisam de um contexto que ele não tem
O ditado por voz tem dificuldade com nomes e jargões porque um reconhecedor tende para as palavras que encontrou com frequência no treinamento, e escolhe entre palavras de mesmo som, como "their" e "there" (em inglês, "deles" e "lá"), usando um contexto que muitas vezes lhe falta. Um teclado de celular ouve uma frase isolada. Ele não sabe que você está respondendo à Aoife sobre a renovação do terceiro trimestre, então apela para as palavras mais comuns que combinam com os sons.
Para palavras raras, entregue o seu vocabulário à ferramenta. Apps de ditado com IA dedicados têm dicionários personalizados; o Laxis Voice Keyboard chama o dele de Personal Dictionary, para nomes, siglas e termos técnicos. O ditado nativo quase nunca tem um, então corrija na hora: no Mac, clique numa palavra sublinhada em azul para ver alternativas; no iPhone, diga "change" e soletre a correção; no Pixel, toque na palavra mal reconhecida. Segundo o Google, a digitação por voz avançada do Pixel melhora a partir das palavras que você corrige.
Homófonos pedem outro hábito. Frases mais longas dão mais pistas à parte de linguagem do modelo, então "send it to their office" ("mande para o escritório deles") sai melhor do que "their" dito sozinho. Depois, revise especificamente palavras de mesmo som, números e negações, os três pontos em que uma única palavra errada inverte o sentido.
Sotaques e dialetos são atendidos de forma desigual
O ditado por voz é mensuravelmente menos preciso para alguns sotaques e dialetos, porque os dados de treinamento da maioria dos motores super-representam certos jeitos de falar. A evidência mais conhecida é um estudo de Stanford de 2020 publicado na PNAS e liderado por Allison Koenecke: sistemas da Amazon, Apple, Google, IBM e Microsoft, testados em 2019, reconheceram errado em média 35% das palavras de falantes negros, contra 19% das de falantes brancos. Os motores melhoraram desde então, mas ninguém demonstrou que a diferença foi eliminada.
Escolher a variante regional mais próxima do seu jeito de falar ajuda e não custa nada. Vamos além no nosso guia sobre ditar com sotaque ou em dois idiomas.
Teclados de celular rodam modelos pequenos; serviços na nuvem podem rodar modelos grandes
O ditado no celular muitas vezes roda no próprio aparelho, onde o modelo de fala precisa caber na memória e no orçamento de bateria de um celular, enquanto serviços na nuvem podem rodar modelos muito maiores. A Apple diz que o ditado no iPhone é processado no aparelho em muitos idiomas, sem precisar de internet. O Google diz que a digitação por voz avançada do Pixel mantém o que você fala no celular, a menos que você use recursos como o Fix it. Já a digitação por voz do Windows usa reconhecimento online com tecnologia dos serviços Azure Speech da Microsoft.
Processar no aparelho não é pior por definição. É privado, funciona no avião, e os fabricantes de celulares estão adicionando modelos de linguagem locais para dar um acabamento ao resultado; no iOS 27, a Apple usa um para melhorar ortografia, pontuação e maiúsculas em inglês no iPhone 17 Pro, no iPhone Air e em modelos mais novos. Mas é uma troca, e um dos motivos pelos quais a mesma frase pode sair diferente no celular e no notebook; nosso artigo sobre transcrição no aparelho versus na nuvem cobre o lado da privacidade.
Se parece que o ditado por voz está piorando, provavelmente a tecnologia não regrediu; algo mudou na sua corrente, como fones novos, um novo teclado padrão, uma atualização do sistema ou um pacote de idioma offline. Teste de novo perto do microfone num ambiente silencioso para ver se o problema acompanha o áudio ou o software.
Ditado por voz é IA?
O ditado por voz é IA no sentido de aprendizado de máquina: os reconhecedores de fala modernos são redes neurais treinadas com grandes quantidades de fala gravada acompanhada de transcrições, e não conjuntos de regras escritas à mão. Então sim, conta. O Whisper, da OpenAI, descrito num artigo de 2022 de Alec Radford e colegas, foi treinado com 680.000 horas de áudio coletadas da web. Todo motor de ditado popular hoje é construído assim.
Isso explica a maior parte do comportamento descrito acima. O modelo prevê as palavras mais prováveis para o que ouviu, com base no que aprendeu, então é forte com fala comum e mais fraco com nomes raros e vozes sub-representadas. Ele pode errar com toda a confiança e, de vez em quando, produzir palavras que ninguém disse. Nosso guia de reconhecimento de fala se aprofunda em como os reconhecedores funcionam.
O que isso não significa é que o ditado escreve por você. O ditado por voz básico transcreve; não é IA generativa no sentido dos chatbots. A fronteira está ficando borrada, porque muitas ferramentas adicionam uma segunda etapa que edita as suas palavras com um modelo de linguagem: o Fluid dictation do Windows, o Fix it do Pixel, o modelo do iOS 27 da Apple e o Verbal Cleanup da Laxis fazem versões disso. Se uma política da escola ou da empresa restringe "IA", pergunte se ela se refere à transcrição ou à reescrita e depois confira quais extras estão ativados.
Quando o ditado nativo é suficiente
O ditado nativo é suficiente para mensagens curtas, pesquisas e anotações rápidas num ambiente silencioso, e é gratuito. Resolva primeiro o microfone, a configuração de idioma e as pausas. Se o que sobrar forem principalmente nomes, palavras de preenchimento e frases que se arrastam, um app de ditado com IA vale o que custa.
O Laxis Voice Keyboard funciona nos seus apps de desktop e de celular, remove palavras de preenchimento e repetições, pontua e usa o seu Personal Dictionary para nomes. Os limites: funciona só na nuvem, então precisa de conexão e o seu áudio sai do aparelho; e, no plano gratuito, ditado e reuniões consomem uma mesma cota mensal compartilhada de 300 minutos. O teste de 14 dias do Premium não pede cartão de crédito, então você pode colocá-lo à prova com os seus piores erros.
Perguntas frequentes
Por que o ditado por voz é tão ruim no iPhone?
O ditado por voz no iPhone costuma errar por causa da distância do microfone, do ruído de fundo ou de nomes e jargões que ele nunca aprendeu, e não por uma falha exclusiva do iPhone. Segure o celular mais perto, dite em frases completas e soletre nomes difíceis letra por letra. No iPhone 12 e posteriores, em inglês dos EUA, você também pode corrigir por voz uma palavra mal reconhecida com "change".
Por que o ditado por voz está piorando?
Quando o ditado por voz parece piorar, geralmente é porque algo mudou na sua configuração, e não porque a tecnologia regrediu. Os culpados mais comuns são fones Bluetooth novos, outro microfone padrão, uma atualização do sistema operacional, um novo app de teclado ou um pacote de idioma offline. Teste de novo com o microfone perto, num ambiente silencioso, para ver se o problema acompanha o áudio ou o software.
Ditado por voz é IA?
Sim. O ditado por voz moderno usa aprendizado de máquina: uma rede neural treinada com grandes quantidades de fala gravada e as transcrições correspondentes prevê as palavras mais prováveis para o som que ouve. O Whisper, da OpenAI, por exemplo, foi treinado com 680.000 horas de áudio. O ditado simples transcreve em vez de escrever, mas muitas ferramentas agora adicionam uma etapa de IA que organiza ou reescreve o texto.
Reconhecimento de voz é IA generativa?
O reconhecimento de voz básico não é IA generativa no sentido dos chatbots, porque transcreve o que você disse em vez de criar conteúdo novo. A fronteira está ficando borrada: os reconhecedores produzem o texto palavra por palavra e, de vez em quando, podem inserir frases que ninguém falou, e muitas ferramentas de ditado adicionam um modelo de linguagem que reescreve as suas palavras. Se uma política restringe IA generativa, confira quais recursos estão ativados.
Como deixar o ditado por voz mais preciso?
Aproxime o microfone da boca, reduza o ruído de fundo, fale em frases completas num ritmo normal e escolha o idioma e a variante regional certos. Depois, ensine o seu vocabulário à ferramenta, usando um dicionário personalizado quando houver. Esses passos resolvem a maioria dos erros; se nomes e palavras de preenchimento continuarem sendo o problema, experimente um app de ditado com IA dedicado.
Por que o ditado por voz erra nomes?
O ditado por voz erra nomes porque os reconhecedores favorecem palavras que viram com frequência no treinamento, e a maioria dos sobrenomes, marcas e siglas é rara. Sem contexto, o motor troca o nome pela palavra comum mais próxima. Adicionar o nome a um dicionário personalizado resolve nas ferramentas que têm um; o ditado nativo quase nunca tem, mas soletrar o nome letra por letra funciona no iPhone e nos Pixels mais novos.