Voltar aos Insights
Melhores Práticas•2026-09-29•10 min leitura

Ditado para programar: fale com o Claude Code, o Cursor e o ChatGPT

Ditado para programar: fale com o Claude Code, o Cursor e o ChatGPT
TL
Team Laxis
Equipe Laxis @ Laxis

Quarenta minutos depois de começar uma sessão no Claude Code, o agente refatora a camada errada. Você sabe por quê: o módulo de faturamento parece redundante, mas existe por causa de uma peculiaridade antiga de um fornecedor, e a correção deve ficar um nível acima. Explicar isso leva um parágrafo. Digitar um parágrafo no meio do fluxo parece um castigo, então você digita onze palavras, e a tentativa seguinte também erra. Essa lacuna é o motivo pelo qual o ditado para programar virou um dos usos mais discutidos da entrada por voz, e também por que ele não tem nada a ver com a programação por voz de uma década atrás.

Os desenvolvedores que tiram proveito real disso não ficam lendo colchetes e pontos e vírgulas em voz alta. Eles ditam a intenção: o prompt, a spec, a mensagem de commit, o motivo pelo qual um comentário de revisão importa. A sintaxe agora é trabalho do agente. Explicar continua sendo com você, e a maioria das pessoas explica mais rápido em voz alta do que com os dedos.

Programar por voz significava outra coisa antes de os agentes chegarem

Durante a maior parte da sua história, programar por voz foi uma disciplina, não uma conveniência. O Talon, muitas vezes combinado com a extensão Cursorless para VS Code, permite escrever e editar código sem as mãos por meio de um vocabulário compacto de comandos falados. Boa parte desse trabalho foi construída por e para desenvolvedores com LER (lesão por esforço repetitivo), e, se as suas mãos estão fora de combate, essa continua sendo a opção séria, depois de algumas semanas de prática.

O que mudou foi a unidade de trabalho. Quando um agente escreve a função, o que você produz é uma descrição da função: o que ela deve fazer, o que não pode quebrar, como você vai saber que está pronta. Isso é prosa. E prosa é exatamente o que o ditado comum sempre fez bem.

Leia as threads do Hacker News sobre o assunto, com títulos como “Ask HN: Anyone using dictation with coding agents?”, e repare no que está faltando. A conversa gira em torno de teclas de push-to-talk, dicionários personalizados e qual ferramenta para o sistema inteiro conectar a um agente de CLI. Quase ninguém pergunta como se fala um colchete.

O que os desenvolvedores realmente ditam (e o que ainda digitam)

Organize o seu dia pelo destinatário das palavras e a divisão fica óbvia. Tudo o que é dirigido a uma pessoa, ou a um modelo em linguagem simples, é candidato à voz. Tudo o que um compilador ou um shell precisa interpretar caractere por caractere geralmente não é.

TarefaDitar ou digitar?Por quê
Prompts para Claude Code, Cursor, Codex ou ChatGPTDitarContexto longo custa pouco para falar, e os modelos entendem sem problema uma redação solta
Specs, planos e descrições de issuesDitarÉ explicação; arrume a estrutura depois
Mensagens de commit e descrições de PRDitarDiga o que mudou e por quê enquanto está fresco, depois enxugue antes do push
Comentários de code reviewDitar, depois relerO tom chega a um colega, então confira antes de postar
Docstrings e comentáriosDitarProsa que por acaso mora num arquivo de código
Nomes de variáveis, regex, config, edições de uma linhaDigitarMaiúsculas e minúsculas, símbolos e caracteres exatos são lentos e sujeitos a erro em voz alta
Comandos de shellDigitar, ou pedir ao agenteUma flag mal entendida pode causar estrago de verdade

Sobre essa última linha: em vez de ditar um comando de shell palavra por palavra, descreva o objetivo ao agente e leia o comando que ele propõe antes de aprovar. Assim, um erro de reconhecimento nunca chega ao seu shell.

A anatomia de um prompt falado que funciona

Prompts falados falham de um jeito previsível: eles divagam. Você começa pelo objetivo, lembra de uma restrição no meio do caminho, volta atrás e termina numa digressão sobre a suíte de testes. Um modelo geralmente consegue desembaraçar isso, mas uma estrutura flexível que você consiga guardar na cabeça rende primeiras tentativas melhores.

O prompt de voz em quatro tempos

Contexto: onde estamos e o que já existe. Objetivo: a mudança que você quer, em uma frase. Restrições: o que não pode mudar, quais padrões seguir, o que evitar. Pronto quando: o teste, o comportamento ou a saída que prova que funcionou.

Fale nessa ordem e você raramente vai precisar de uma mensagem extra por algo que esqueceu.

Alguns hábitos separam um prompt que acerta de um que precisa de três correções:

  • Leia antes de enviar. O /voice do Claude Code espera o Enter por padrão, e essa é a configuração certa para manter. Uma olhada de dois segundos pega o nome de arquivo mal entendido antes que o agente saia procurando por ele. O modo de segurar (hold) também tem um breve aquecimento, então, se as primeiras palavras sumirem, a documentação sugere reatribuir o atalho a uma combinação com tecla modificadora, que grava desde o primeiro toque.
  • Atenção aos limites embutidos. Segundo a documentação do Claude Code, o modo de tocar para gravar (tap) para depois de 15 segundos de silêncio ou dois minutos no total. Para uma spec longa, dite primeiro num arquivo de rascunho ou numa nota e depois cole.
  • Chame as coisas do jeito que se escrevem. Diga “o arquivo user service na pasta auth” em vez de torcer para o mecanismo produzir o caminho exato, e passe ao agente o caminho real sempre que isso importar.
  • Fale com ele como com um colega novo de equipe. “Isso parece redundante, mas não é, porque...” é exatamente o contexto que os prompts digitados deixam de fora.

Um limite: se você está ditando o que foi decidido na revisão de design de ontem, isso é outro trabalho. Levar o contexto de reuniões para o Claude ou o ChatGPT é função dos servidores MCP, assunto do nosso artigo sobre como os apps de conversa estão se conectando ao MCP.

A entrada de voz embutida muitas vezes basta

Veja primeiro o que já existe nas suas ferramentas. Os principais agentes correram atrás, e para muitos desenvolvedores isso é suficiente.

  • Claude Code tem um comando /voice. Segure a barra de espaço para falar ou mude para o modo tap. Ele é ajustado para o vocabulário de programação, usa os nomes do seu projeto e da sua branch do git como dicas de reconhecimento e transmite o áudio para a Anthropic fazer a transcrição. Exige login no Claude.ai, então não está disponível se você se autentica com uma chave de API ou pelo Bedrock, e não funciona em sessões SSH.
  • Cursor adicionou o Voice Mode na versão 2.0, em outubro de 2025: voz para texto embutida para comandar o Agent, além de palavras-chave de envio personalizadas para que uma frase falada dispare a execução.
  • ChatGPT tem um botão de ditado na caixa de mensagem. A transcrição chega como texto editável, então você pode corrigi-la antes de enviar.
  • VS Code Speech, a extensão gratuita da Microsoft, adiciona chat por voz para o Copilot e ditado dentro do editor, e processa o áudio localmente.

Se o seu dia inteiro acontece dentro de uma dessas janelas, comece por aí. A lacuna aparece quando você sai dela: a descrição do PR fica numa aba do navegador, o comentário de revisão no GitHub, a atualização do stand-up no Slack. Cada microfone embutido funciona na sua própria caixa, então ou você faz malabarismo com vários hábitos de push-to-talk, ou volta a digitar tudo o que não é prompt. Esse é o argumento a favor de uma ferramenta de ditado para o sistema inteiro: um único atalho que digita onde quer que o cursor esteja, terminal incluído.

Jargão, identificadores e o terminal

A reclamação que mais aparece nas threads de desenvolvedores não é sobre velocidade; é sobre vocabulário. Mecanismos de fala genéricos aprenderam com fala genérica, então kubectl, useEffect, os nomes dos seus serviços internos e o sobrenome do seu colega voltam com uma grafia criativa. As ferramentas atacam isso de três formas.

A primeira é um dicionário personalizado: adicione os termos uma vez e o mecanismo para de chutar. No Laxis, isso é o Personal Dictionary; alimente-o com o seu stack, os seus serviços e os nomes da sua equipe antes de julgar a precisão. A segunda é ler o contexto da tela. O Wispr Flow consegue reconhecer nomes de funções, classes e variáveis visíveis no VS Code, no Cursor e no Windsurf, e pode marcar arquivos por voz nos painéis de chat do Cursor e do Windsurf; se os seus prompts estão cheios de camelCase, é uma vantagem de verdade. A terceira é um modelo de fala treinado com linguagem técnica, que é a proposta da Aqua Voice com o modelo Avalon.

O terminal é a outra armadilha. Muitos apps de ditado inserem o texto colando-o, e terminais são mais exigentes com colagem do que caixas de texto comuns; as próprias páginas de ajuda do Wispr Flow descrevem como dividir ditados longos em partes para o Claude Code e o Codex no Mac. Seja qual for a sua ferramenta, dite um prompt de 150 palavras no seu terminal de verdade e confirme que todas as palavras chegam e que nada é enviado antes da hora.

Para pontuação e formatação por voz, o nosso guia de comandos de ditado lista o que você pode dizer. Se o problema real é o reconhecimento, por que o voz para texto vive entendendo errado percorre as causas habituais e as soluções.

Muletas de fala não atrapalham um modelo, mas atrapalham quem revisa

Um modelo de linguagem lê sem se abalar “hã, então, espera, na verdade”. Um colega que lê a descrição do seu PR gosta bem menos disso. Uma limpeza que remove muletas de fala e junta frases repetidas importa mais para textos que pessoas leem do que para prompts, então avalie qualquer ferramenta pelas suas mensagens de commit e comentários de revisão, não por um prompt.

Para onde vai o seu áudio quando o código é proprietário

Todas as opções acima, exceto as locais, enviam a sua voz para um servidor. O /voice do Claude Code transmite para a Anthropic. O ditado do ChatGPT vai para a OpenAI. O Laxis também processa o ditado na nuvem, e preferimos dizer isso com clareza aqui a deixar você descobrir numa página de política.

Para a maioria dos prompts, isso acrescenta pouca exposição nova, porque o texto do prompt vai para o fornecedor do modelo de qualquer forma. O que muda é o número de empresas na cadeia: dite por um app separado e as suas palavras passam pelo fornecedor de ditado antes do fornecedor do agente. Para código proprietário, nomes de clientes ou qualquer coisa sob NDA, valide esse salto extra com quem cuida da segurança onde você trabalha.

Se o áudio não pode sair da máquina de jeito nenhum, existem opções reais: o VS Code Speech roda localmente, e o Superwhisper pode rodar os modelos dele no seu próprio hardware. Os prós e contras, e as perguntas que vale fazer a qualquer fornecedor, estão no nosso comparativo entre transcrição no dispositivo e na nuvem.

Três perguntas para a sua equipe de segurança

O áudio falado conta como código-fonte ou dados de clientes pela nossa política? A ferramenta de ditado está na lista de fornecedores aprovados, e não só o agente de código? Alguns repositórios exigem uma ferramenta com processamento local, enquanto outros não?

O que procurar numa ferramenta de ditado para programar

Aqui não é o lugar para um ranking; o nosso comparativo de softwares de ditado faz esse trabalho. Para programar, as perguntas são mais específicas:

  1. O mesmo atalho em todo lugar? Terminal, IDE, navegador e chat, ou você volta a ter quatro hábitos.
  2. Dá para ensinar o seu vocabulário a ela, e a lista acompanha você de uma máquina para outra?
  3. Segurar ou alternar? Segurar uma tecla combina com prompts curtos; um modo de alternar é mais gentil com specs longas e com mãos que não querem ficar apertando uma tecla.
  4. Quanto ela reescreve? Você quer as muletas removidas e a pontuação adicionada, não o seu significado técnico parafraseado.
  5. Onde o áudio é processado, e isso é aceitável para o código com que você trabalha?
  6. O que é tarifado? Palavras por semana, minutos por mês ou ilimitado, e se essa cota é compartilhada com mais alguma coisa.

Sobre esse último ponto, aqui vai o nosso. O plano gratuito do Laxis dá 300 minutos por mês numa cota única: reuniões e ditado consomem os mesmos minutos. Prompts são curtos, mas, se você também grava reuniões com ele, vai sentir a sobreposição. O Premium aumenta a cota para 2.000 minutos, e toda conta nova ganha quatorze dias de Premium grátis, sem cadastrar cartão. O Voice Keyboard do Laxis roda em Mac, Windows, iPhone e Android e digita em qualquer app, incluindo o VS Code e o terminal.

Conclusão

Durante anos, o argumento contra programar por voz era que código não é linguagem. Isso continua sendo verdade sobre o código. Não é mais verdade sobre o trabalho. A parte da programação que não para de crescer é aquela em que você explica o que quer para algo capaz de construí-lo, e explicar é o que as pessoas faziam em voz alta muito antes de alguém digitar qualquer coisa. Os desenvolvedores que mais tiram proveito dos agentes talvez acabem sendo os que melhor sabem falar com eles, e não os que digitam mais rápido na sala.

Perguntas frequentes

Dá para programar por voz?

Sim, de duas maneiras diferentes. Hoje a maioria dos desenvolvedores dita prompts em linguagem natural, specs e mensagens de commit para agentes de IA como o Claude Code e o Cursor, e deixa o agente escrever a sintaxe. Programar totalmente sem as mãos, falando e editando o próprio código, também é possível com ferramentas como Talon e Cursorless, mas exige algumas semanas de prática.

O Claude Code tem entrada por voz?

Sim. O Claude Code tem um comando /voice: segure a barra de espaço para gravar, ou mude para o modo tap, e a sua fala é transcrita no prompt. Ele é ajustado para termos de programação e usa os nomes do seu projeto e da sua branch como dicas. Exige login no Claude.ai, transmite o áudio para a Anthropic e não funciona via SSH nem com autenticação por chave de API.

Como usar a entrada por voz no Cursor?

O Cursor tem um Voice Mode embutido desde a versão 2.0, lançada em outubro de 2025, que permite falar prompts para o Agent e definir palavras-chave de envio personalizadas. Ele foi feito para a caixa de entrada do Agent. Para mensagens de commit, descrições de PR ou o terminal, os desenvolvedores costumam adicionar um app de ditado para o sistema inteiro que digita onde quer que o cursor esteja.

É seguro ditar prompts sobre código proprietário?

Depende de para onde o áudio vai e do que o seu empregador permite. A maior parte do ditado, incluindo o /voice do Claude Code, o ditado do ChatGPT e o Laxis, é processada na nuvem, o que acrescenta um fornecedor à cadeia. Se o áudio precisa ficar na sua máquina, VS Code Speech e ferramentas com modelos locais como o Superwhisper são as opções. Consulte antes a sua política de segurança.

Como faço o ditado escrever corretamente termos técnicos e nomes de variáveis?

Adicione-os a um dicionário personalizado antes de julgar a precisão. A maioria das ferramentas de ditado, incluindo o Laxis com o Personal Dictionary, permite salvar nomes de bibliotecas, serviços internos e colegas de equipe para que o mecanismo pare de chutar. Algumas ferramentas também leem os nomes visíveis no seu editor. Para identificadores com maiúsculas e minúsculas incomuns, digitá-los ou deixar o agente completá-los costuma ser mais rápido.

Um software de ditado consegue digitar no terminal?

Sim, a maioria dos apps de ditado para o sistema inteiro digita em terminais, além de editores e navegadores, embora os terminais tratem o texto colado de forma diferente das caixas de texto normais. Teste com um prompt longo no seu terminal de verdade e verifique se todas as palavras chegam. Evite ditar comandos de shell palavra por palavra; descreva o objetivo ao seu agente e revise o comando que ele propõe.