Dictée vocale pour coder : parler à Claude Code, Cursor et ChatGPT
Quarante minutes après le début d'une session Claude Code, l'agent refactorise la mauvaise couche. Vous savez pourquoi : le module de facturation a l'air redondant, mais il existe à cause d'une vieille bizarrerie d'un fournisseur, et le correctif se situe un niveau plus haut. L'expliquer demande un paragraphe. Taper un paragraphe en plein élan ressemble à une punition, alors vous tapez onze mots, et la tentative suivante rate aussi. Cet écart explique pourquoi la dictée pour coder est devenue l'un des usages de la saisie vocale dont on parle le plus, et pourquoi elle ne ressemble en rien au codage vocal d'il y a dix ans.
Les développeurs qui en tirent un vrai bénéfice ne récitent pas des crochets et des points-virgules. Ils dictent l'intention : le prompt, la spec, le message de commit, la raison pour laquelle un commentaire de revue compte. La syntaxe, c'est désormais le travail de l'agent. Expliquer reste votre affaire, et la plupart des gens expliquent plus vite à voix haute que du bout des doigts.
Le codage vocal voulait dire autre chose avant l'arrivée des agents
Pendant l'essentiel de son histoire, coder à la voix relevait de la discipline plutôt que du confort. Talon, souvent associé à l'extension Cursorless pour VS Code, permet d'écrire et de modifier du code sans les mains grâce à un vocabulaire compact de commandes parlées. Une grande partie de ce travail a été construite par et pour des développeurs souffrant de troubles musculosquelettiques liés aux gestes répétitifs, et si vos mains sont hors service, cela reste l'option sérieuse, après quelques semaines d'entraînement.
Ce qui a changé, c'est l'unité de travail. Quand un agent écrit la fonction, ce que vous produisez, c'est une description de la fonction : ce qu'elle doit faire, ce qu'elle ne doit pas casser, comment vous saurez qu'elle est terminée. C'est de la prose. Et la prose, c'est exactement ce que la dictée ordinaire a toujours bien géré.
Lisez les fils Hacker News sur le sujet, avec des titres comme « Ask HN: Anyone using dictation with coding agents? », et remarquez ce qui manque. On y parle de touches push-to-talk, de dictionnaires personnalisés et de l'outil système à brancher sur un agent en CLI. Presque personne ne demande comment prononcer un crochet.
Ce que les développeurs dictent vraiment (et ce qu'ils tapent encore)
Classez votre journée selon le destinataire des mots, et le partage devient évident. Tout ce qui s'adresse à une personne, ou à un modèle en langage courant, est candidat à la voix. Tout ce qu'un compilateur ou un shell doit analyser caractère par caractère ne l'est généralement pas.
| Tâche | Dicter ou taper ? | Pourquoi |
|---|---|---|
| Prompts pour Claude Code, Cursor, Codex ou ChatGPT | Dicter | Un long contexte ne coûte pas grand-chose à dire, et les modèles lisent sans broncher une formulation approximative |
| Specs, plans et descriptions d'issues | Dicter | C'est de l'explication ; remettez la structure en ordre après coup |
| Messages de commit et descriptions de PR | Dicter | Dites ce qui a changé et pourquoi tant que c'est frais, puis élaguez avant le push |
| Commentaires de revue de code | Dicter, puis relire | Le ton atterrit chez un collègue, vérifiez-le avant de publier |
| Docstrings et commentaires | Dicter | De la prose qui se trouve vivre dans un fichier de code |
| Noms de variables, regex, config, modifications d'une ligne | Taper | Casse, symboles et caractères exacts sont lents et sources d'erreurs à l'oral |
| Commandes shell | Taper, ou demander à l'agent | Une option mal entendue peut faire de vrais dégâts |
Sur cette dernière ligne : plutôt que de dicter une commande shell mot pour mot, décrivez l'objectif à l'agent et lisez la commande qu'il propose avant de l'approuver. Une erreur de transcription n'atteint jamais votre shell.
L'anatomie d'un prompt parlé qui fonctionne
Les prompts parlés échouent de façon prévisible : ils divaguent. Vous commencez par l'objectif, vous vous souvenez d'une contrainte à mi-chemin, vous revenez en arrière et vous finissez sur une digression à propos de la suite de tests. Un modèle arrive généralement à démêler tout ça, mais une trame souple que vous pouvez garder en tête donne de meilleurs premiers essais.
Le prompt vocal en quatre temps
Contexte : où l'on en est et ce qui existe déjà. Objectif : le changement voulu, en une phrase. Contraintes : ce qui ne doit pas changer, quels patterns suivre, ce qu'il faut éviter. Terminé quand : le test, le comportement ou le résultat qui prouve que ça a marché.
Dites-les dans cet ordre et vous aurez rarement besoin d'une relance pour un oubli.
Quelques habitudes séparent un prompt qui fait mouche d'un prompt qui demande trois corrections :
- Relisez avant d'envoyer. Le
/voicede Claude Code attend Entrée par défaut, et c'est le bon réglage à conserver. Un coup d'œil de deux secondes repère le nom de fichier mal compris avant que l'agent parte à sa recherche. Son mode maintien (hold) a aussi un bref temps de chauffe : si les premiers mots disparaissent, la documentation suggère de le réassigner à une combinaison avec une touche de modification, qui enregistre dès le premier appui. - Tenez compte des limites intégrées. D'après la documentation de Claude Code, son mode tap (un appui pour enregistrer) s'arrête après 15 secondes de silence ou deux minutes au total. Pour une longue spec, dictez d'abord dans un fichier brouillon ou une note, puis collez-la.
- Nommez les choses comme elles s'écrivent. Dites « le fichier user service dans le dossier auth » plutôt que d'espérer que le moteur produise le chemin exact, et donnez à l'agent le vrai chemin dès que c'est important.
- Parlez-lui comme à un nouveau coéquipier. « Ça a l'air redondant, mais ça ne l'est pas, parce que... » : c'est précisément le contexte que les prompts tapés omettent.
Une limite : si vous dictez ce qui a été décidé lors de la revue de conception d'hier, c'est un autre travail. Faire entrer le contexte d'une réunion dans Claude ou ChatGPT, c'est le rôle des serveurs MCP, sujet de notre article sur la façon dont les applications de conversation se branchent sur MCP.
La saisie vocale intégrée suffit souvent
Regardez d'abord ce qui existe déjà dans vos outils. Les principaux agents ont rattrapé leur retard, et pour beaucoup de développeurs, cela suffit.
- Claude Code dispose d'une commande
/voice. Maintenez la barre d'espace pour parler, ou passez en mode tap. Elle est réglée pour le vocabulaire du code, transmet les noms de votre projet et de votre branche git comme indices de reconnaissance, et envoie l'audio en streaming à Anthropic pour la transcription. Elle nécessite une connexion Claude.ai : elle n'est donc pas disponible si vous vous authentifiez avec une clé API ou via Bedrock, et elle ne fonctionne pas dans les sessions SSH. - Cursor a ajouté Voice Mode dans la version 2.0, en octobre 2025 : une reconnaissance vocale intégrée pour piloter Agent, plus des mots-clés d'envoi personnalisés pour qu'une phrase prononcée lance l'exécution.
- ChatGPT a un bouton de dictée dans la zone de message. La transcription arrive sous forme de texte modifiable, que vous pouvez corriger avant l'envoi.
- VS Code Speech, l'extension gratuite de Microsoft, ajoute le chat vocal pour Copilot et la dictée dans l'éditeur, et traite l'audio en local.
Si toute votre journée se passe dans l'une de ces fenêtres, commencez par là. Le manque apparaît quand vous en sortez : la description de PR vit dans un onglet du navigateur, le commentaire de revue sur GitHub, le point du stand-up dans Slack. Chaque micro intégré fonctionne dans sa propre boîte, alors soit vous jonglez avec plusieurs réflexes push-to-talk, soit vous revenez au clavier pour tout ce qui n'est pas un prompt. C'est l'argument en faveur d'un outil de dictée à l'échelle du système : un seul raccourci clavier qui tape là où se trouve le curseur, terminal compris.
Jargon, identifiants et terminal
La plainte qui revient le plus dans les fils de développeurs ne porte pas sur la vitesse, mais sur le vocabulaire. Les moteurs de reconnaissance généralistes ont appris sur de la parole généraliste, si bien que kubectl, useEffect, les noms de vos services internes et le nom de famille de votre collègue reviennent avec une orthographe créative. Les outils s'y attaquent de trois façons.
La première est un dictionnaire personnalisé : ajoutez les termes une fois et le moteur cesse de deviner. Dans Laxis, c'est le Personal Dictionary ; remplissez-le avec votre stack, vos services et les noms de votre équipe avant de juger la précision. La deuxième consiste à lire le contexte à l'écran. Wispr Flow sait reconnaître les noms de fonctions, de classes et de variables visibles dans VS Code, Cursor et Windsurf, et peut mentionner des fichiers à la voix dans les panneaux de chat de Cursor et de Windsurf ; si vos prompts regorgent de camelCase, c'est un vrai avantage. La troisième est un modèle vocal entraîné sur le langage technique, ce que met en avant Aqua Voice avec son modèle Avalon.
Le terminal est l'autre piège. Beaucoup d'applications de dictée insèrent le texte en le collant, et les terminaux sont plus capricieux avec le collage que les zones de texte ordinaires ; les pages d'aide de Wispr Flow elles-mêmes expliquent comment découper les longues dictées en plusieurs parties pour Claude Code et Codex sur Mac. Quel que soit votre outil, dictez un prompt de 150 mots dans votre vrai terminal et vérifiez que chaque mot arrive et que rien n'est envoyé trop tôt.
Pour la ponctuation et la mise en forme à la voix, notre guide des commandes de dictée liste ce que vous pouvez dire. Si c'est la reconnaissance qui pose vraiment problème, pourquoi la saisie vocale vous comprend de travers passe en revue les causes habituelles et leurs solutions.
Les hésitations ne gênent pas un modèle, un relecteur si
Un modèle de langage lit sans sourciller « euh, donc, attends, en fait ». Un collègue qui lit votre description de PR apprécie beaucoup moins. Un nettoyage qui supprime les mots parasites et fusionne les phrases répétées compte davantage pour le texte lu par des humains que pour les prompts ; jugez donc un outil sur vos messages de commit et vos commentaires de revue, pas sur un prompt.
Où va votre audio quand le code est propriétaire
Toutes les options ci-dessus, à part les options locales, envoient votre voix à un serveur. Le /voice de Claude Code transmet à Anthropic. La dictée de ChatGPT part chez OpenAI. Laxis traite aussi la dictée dans le cloud, et nous préférons le dire clairement ici plutôt que de vous le laisser découvrir dans une page de politique de confidentialité.
Pour la plupart des prompts, cela ajoute peu d'exposition nouvelle, puisque le texte du prompt part de toute façon chez le fournisseur du modèle. Ce qui change, c'est le nombre d'entreprises dans la chaîne : dictez via une application séparée et vos mots passent par le fournisseur de dictée avant celui de l'agent. Pour du code propriétaire, des noms de clients ou tout ce qui relève d'un NDA, faites valider ce maillon supplémentaire par la personne responsable de la sécurité dans votre entreprise.
Si l'audio ne doit pas du tout quitter la machine, il existe de vraies options : VS Code Speech tourne en local, et Superwhisper peut exécuter ses modèles sur votre propre matériel. Les compromis, et les questions à poser à tout fournisseur, sont détaillés dans notre comparatif entre transcription sur l'appareil et dans le cloud.
Trois questions pour votre équipe sécurité
L'audio parlé compte-t-il comme du code source ou des données clients selon notre politique ? L'outil de dictée figure-t-il sur la liste des fournisseurs approuvés, et pas seulement l'agent de code ? Certains dépôts exigent-ils un outil à traitement local alors que d'autres non ?
Quoi regarder dans un outil de dictée pour coder
Ce n'est pas l'endroit pour un classement ; notre comparatif des logiciels de dictée s'en charge. Pour coder, les questions sont plus ciblées :
- Le même raccourci partout ? Terminal, IDE, navigateur et chat, sinon vous revoilà avec quatre habitudes.
- Pouvez-vous lui apprendre votre vocabulaire, et la liste vous suit-elle d'une machine à l'autre ?
- Maintenir ou basculer ? Maintenir une touche convient aux prompts courts ; un mode bascule est plus confortable pour les longues specs et pour les mains qui n'ont pas envie de rester crispées sur une touche.
- À quel point réécrit-il ? Vous voulez que les mots parasites disparaissent et que la ponctuation soit ajoutée, pas que votre propos technique soit paraphrasé.
- Où l'audio est-il traité, et est-ce acceptable pour le code sur lequel vous travaillez ?
- Qu'est-ce qui est décompté ? Mots par semaine, minutes par mois ou illimité, et ce quota est-il partagé avec autre chose ?
Sur ce dernier point, voici le nôtre. Le forfait gratuit de Laxis donne 300 minutes par mois dans une réserve unique : réunions et dictée puisent dans les mêmes minutes. Les prompts sont courts, mais si vous enregistrez aussi vos réunions avec, vous sentirez le chevauchement. Premium porte la réserve à 2 000 minutes, et chaque nouveau compte bénéficie de quatorze jours de Premium gratuits, sans saisir de carte. Le Voice Keyboard de Laxis fonctionne sur Mac, Windows, iPhone et Android et tape dans n'importe quelle application, VS Code et le terminal compris.
En résumé
Pendant des années, l'argument contre le codage à la voix était que le code n'est pas du langage. C'est toujours vrai du code. Ça ne l'est plus du métier. La part de la programmation qui ne cesse de grandir, c'est celle où vous expliquez ce que vous voulez à quelque chose capable de le construire, et expliquer, c'est ce que les gens faisaient à voix haute bien avant que quiconque tape quoi que ce soit. Les développeurs qui tireront le plus des agents pourraient bien être ceux qui savent le mieux leur parler, pas les plus rapides au clavier.
Questions fréquentes
Peut-on coder à la voix ?
Oui, de deux manières différentes. La plupart des développeurs dictent désormais des prompts en langage naturel, des specs et des messages de commit à des agents IA comme Claude Code et Cursor, et laissent l'agent écrire la syntaxe. Coder entièrement sans les mains, en dictant et en modifiant le code lui-même, est aussi possible avec des outils comme Talon et Cursorless, mais cela demande quelques semaines d'entraînement.
Claude Code a-t-il une saisie vocale ?
Oui. Claude Code dispose d'une commande /voice : maintenez la barre d'espace pour enregistrer, ou passez en mode tap, et votre parole est transcrite dans le prompt. Elle est réglée pour les termes de programmation et utilise les noms de votre projet et de votre branche comme indices. Elle nécessite une connexion Claude.ai, envoie l'audio à Anthropic et ne fonctionne ni via SSH ni avec une authentification par clé API.
Comment utiliser la saisie vocale dans Cursor ?
Cursor dispose d'un Voice Mode intégré depuis la version 2.0, sortie en octobre 2025, qui permet de dicter des prompts à Agent et de définir des mots-clés d'envoi personnalisés. Il est conçu pour le champ de saisie d'Agent. Pour les messages de commit, les descriptions de PR ou le terminal, les développeurs ajoutent en général une application de dictée système qui tape là où se trouve le curseur.
Est-il sûr de dicter des prompts portant sur du code propriétaire ?
Cela dépend de l'endroit où va l'audio et de ce que votre employeur autorise. La plupart des dictées, y compris le /voice de Claude Code, la dictée de ChatGPT et Laxis, sont traitées dans le cloud, ce qui ajoute un fournisseur à la chaîne. Si l'audio doit rester sur votre machine, VS Code Speech et les outils à modèle local comme Superwhisper sont les options. Vérifiez d'abord votre politique de sécurité.
Comment faire pour que la dictée écrive correctement les termes techniques et les noms de variables ?
Ajoutez-les à un dictionnaire personnalisé avant de juger la précision. La plupart des outils de dictée, dont Laxis avec son Personal Dictionary, permettent d'enregistrer des noms de bibliothèques, de services internes et de collègues pour que le moteur cesse de deviner. Certains outils lisent aussi les noms visibles dans votre éditeur. Pour les identifiants à la casse inhabituelle, les taper ou laisser l'agent les compléter est souvent plus rapide.
Un logiciel de dictée peut-il taper dans le terminal ?
Oui, la plupart des applications de dictée système tapent dans les terminaux comme dans les éditeurs et les navigateurs, même si les terminaux gèrent le texte collé différemment des zones de texte normales. Testez avec un long prompt dans votre vrai terminal et vérifiez que chaque mot arrive. Évitez de dicter des commandes shell mot pour mot ; décrivez l'objectif à votre agent et relisez la commande qu'il propose.