Volver a insights
Mejores prácticas•2026-09-29•10 min lectura

Dictado para programar: habla con Claude Code, Cursor y ChatGPT

Dictado para programar: habla con Claude Code, Cursor y ChatGPT
TL
Team Laxis
Equipo Laxis @ Laxis

A los cuarenta minutos de una sesión de Claude Code, el agente refactoriza la capa equivocada. Tú sabes por qué: el módulo de facturación parece redundante, pero existe por una vieja rareza de un proveedor, y el arreglo va un nivel más arriba. Explicarlo lleva un párrafo. Escribir un párrafo en plena concentración se siente como un castigo, así que escribes once palabras, y el siguiente intento también falla. Esa brecha explica por qué el dictado para programar se ha convertido en uno de los usos más comentados de la entrada de voz, y por qué no se parece en nada a la programación por voz de hace una década.

Los desarrolladores que le sacan provecho de verdad no van leyendo corchetes y puntos y comas en voz alta. Dictan la intención: el prompt, la especificación, el mensaje de commit, el motivo por el que importa un comentario de revisión. La sintaxis ahora es trabajo del agente. Explicar sigue siendo cosa tuya, y la mayoría de la gente explica más rápido en voz alta que con los dedos.

Programar con la voz significaba otra cosa antes de que llegaran los agentes

Durante casi toda su historia, programar con la voz fue una disciplina más que una comodidad. Talon, a menudo combinado con la extensión Cursorless para VS Code, permite escribir y editar código sin usar las manos mediante un vocabulario compacto de comandos hablados. Gran parte de ese trabajo lo hicieron desarrolladores con lesiones por esfuerzo repetitivo pensando en otros como ellos, y si tus manos están fuera de combate, sigue siendo la opción seria, tras unas semanas de práctica.

Lo que cambió es la unidad de trabajo. Cuando un agente escribe la función, lo que tú produces es una descripción de la función: qué debe hacer, qué no debe romper, cómo sabrás que está terminada. Eso es prosa. Y la prosa es justo lo que el dictado corriente siempre ha manejado bien.

Lee los hilos de Hacker News sobre el tema, con títulos como “Ask HN: Anyone using dictation with coding agents?”, y fíjate en lo que falta. Se habla de teclas push-to-talk, diccionarios personalizados y de qué herramienta de todo el sistema conectar a un agente de CLI. Casi nadie pregunta cómo se dice un corchete.

Lo que los desarrolladores dictan de verdad (y lo que siguen escribiendo)

Ordena tu día según a quién van dirigidas las palabras y la división salta a la vista. Todo lo que va dirigido a una persona, o a un modelo en lenguaje llano, es candidato para la voz. Lo que un compilador o un shell tiene que analizar carácter por carácter, por lo general no.

Tarea¿Dictar o escribir?Por qué
Prompts para Claude Code, Cursor, Codex o ChatGPTDictarUn contexto largo cuesta poco decirlo, y los modelos entienden sin problema una redacción suelta
Especificaciones, planes y descripciones de issuesDictarEs explicación; ordena la estructura después
Mensajes de commit y descripciones de PRDictarDi qué cambió y por qué mientras lo tienes fresco, y recorta antes del push
Comentarios de code reviewDictar y releerEl tono le llega a un compañero, así que revísalo antes de publicar
Docstrings y comentariosDictarProsa que resulta vivir en un archivo de código
Nombres de variables, regex, config, ediciones de una líneaEscribirMayúsculas, símbolos y caracteres exactos son lentos y propensos a errores en voz alta
Comandos de shellEscribir, o pedírselo al agenteUn flag mal entendido puede hacer daño de verdad

Sobre esa última fila: en lugar de dictar un comando de shell al pie de la letra, describe el objetivo al agente y lee el comando que propone antes de aprobarlo. Así, un error de reconocimiento nunca llega a tu shell.

Anatomía de un prompt hablado que funciona

Los prompts hablados fallan de forma predecible: divagan. Empiezas por el objetivo, recuerdas una restricción a mitad de camino, das marcha atrás y terminas con una digresión sobre la batería de tests. Un modelo suele poder desenredarlo, pero una estructura flexible que puedas tener en la cabeza consigue mejores primeros intentos.

El prompt de voz en cuatro tiempos

Contexto: dónde estamos y qué existe ya. Objetivo: el cambio que quieres, en una frase. Restricciones: qué no debe cambiar, qué patrones seguir, qué evitar. Listo cuando: el test, el comportamiento o la salida que demuestra que funcionó.

Dilos en orden y rara vez necesitarás un mensaje de seguimiento por algo que olvidaste.

Unos cuantos hábitos separan un prompt que acierta de uno que necesita tres correcciones:

  • Lee antes de enviar. El /voice de Claude Code espera a que pulses Enter de forma predeterminada, y es el ajuste que conviene mantener. Un vistazo de dos segundos detecta el nombre de archivo mal entendido antes de que el agente salga a buscarlo. Su modo de mantener pulsado (hold) también tiene un breve calentamiento, así que si se pierden las primeras palabras, la documentación sugiere reasignarlo a una combinación con una tecla modificadora, que graba desde la primera pulsación.
  • Ten en cuenta los límites integrados. Según la documentación de Claude Code, su modo de tocar para grabar (tap) se detiene tras 15 segundos de silencio o dos minutos en total. Para una especificación larga, dicta primero en un archivo borrador o una nota y pégalo después.
  • Nombra las cosas como se escriben. Di “el archivo user service de la carpeta auth” en vez de esperar que el motor produzca la ruta exacta, y dale al agente la ruta real siempre que importe.
  • Háblale como a un compañero nuevo. “Esto parece redundante pero no lo es, porque...” es justo el contexto que los prompts escritos dejan fuera.

Un límite: si estás dictando lo que se decidió ayer en la revisión de diseño, eso es otro trabajo. Llevar el contexto de una reunión a Claude o ChatGPT es tarea de los servidores MCP, algo que tratamos en nuestro artículo sobre cómo las apps de conversación se están conectando a MCP.

La entrada de voz integrada suele bastar

Revisa primero lo que ya traen tus herramientas. Los principales agentes se han puesto al día, y a muchos desarrolladores con eso les basta.

  • Claude Code tiene un comando /voice. Mantén pulsada la barra espaciadora para hablar o cambia al modo tap. Está ajustado al vocabulario de programación, usa los nombres de tu proyecto y de tu rama de git como pistas de reconocimiento y envía el audio en streaming a Anthropic para transcribirlo. Requiere iniciar sesión con Claude.ai, así que no está disponible si te autenticas con una clave de API o a través de Bedrock, y no funciona en sesiones SSH.
  • Cursor añadió Voice Mode en la versión 2.0, en octubre de 2025: voz a texto integrada para manejar Agent, más palabras clave de envío personalizadas para que una frase hablada lance la ejecución.
  • ChatGPT tiene un botón de dictado en el cuadro de mensaje. La transcripción llega como texto editable, así que puedes corregirla antes de enviar.
  • VS Code Speech, la extensión gratuita de Microsoft, añade chat por voz para Copilot y dictado dentro del editor, y procesa el audio en local.

Si todo tu día transcurre dentro de una de esas ventanas, empieza por ahí. El hueco aparece cuando sales de ella: la descripción del PR vive en una pestaña del navegador, el comentario de revisión en GitHub, la actualización del standup en Slack. Cada micrófono integrado funciona en su propia caja, así que o haces malabares con varios hábitos de push-to-talk o vuelves a teclear todo lo que no sea un prompt. Ese es el argumento a favor de una herramienta de dictado para todo el sistema: un solo atajo de teclado que escribe dondequiera que esté el cursor, terminal incluida.

Jerga, identificadores y la terminal

La queja que más aparece en los hilos de desarrolladores no es la velocidad; es el vocabulario. Los motores de voz generalistas aprendieron del habla general, así que kubectl, useEffect, los nombres de tus servicios internos y el apellido de tu compañero vuelven con una ortografía creativa. Las herramientas lo abordan de tres maneras.

La primera es un diccionario personalizado: añades los términos una vez y el motor deja de adivinar. En Laxis es el Personal Dictionary; llénalo con tu stack, tus servicios y los nombres de tu equipo antes de juzgar la precisión. La segunda es leer el contexto de la pantalla. Wispr Flow puede reconocer nombres de funciones, clases y variables visibles en VS Code, Cursor y Windsurf, y puede etiquetar archivos por voz en los paneles de chat de Cursor y Windsurf; si tus prompts están llenos de camelCase, es una ventaja real. La tercera es un modelo de voz entrenado con lenguaje técnico, que es lo que promete Aqua Voice con su modelo Avalon.

La terminal es la otra trampa. Muchas apps de dictado insertan el texto pegándolo, y las terminales son más quisquillosas con el pegado que los cuadros de texto normales; las propias páginas de ayuda de Wispr Flow describen cómo dividir los dictados largos en partes para Claude Code y Codex en Mac. Uses lo que uses, dicta un prompt de 150 palabras en tu terminal real y confirma que llega cada palabra y que nada se envía antes de tiempo.

Para la puntuación y el formato por voz, nuestra guía de comandos de dictado recoge lo que puedes decir. Si el problema real es el reconocimiento, por qué la voz a texto no deja de entenderte mal repasa las causas habituales y sus soluciones.

Las muletillas no le molestan a un modelo, pero sí a quien revisa

Un modelo de lenguaje lee sin inmutarse “eh, bueno, espera, en realidad”. Un compañero que lee la descripción de tu PR lo disfruta bastante menos. Una limpieza que elimina muletillas y fusiona frases repetidas importa más en el texto que leen personas que en los prompts, así que juzga cualquier herramienta por tus mensajes de commit y tus comentarios de revisión, no por un prompt.

Adónde va tu audio cuando el código es propietario

Todas las opciones anteriores, salvo las locales, envían tu voz a un servidor. El /voice de Claude Code la transmite a Anthropic. El dictado de ChatGPT va a OpenAI. Laxis también procesa el dictado en la nube, y preferimos decirlo claramente aquí antes que dejar que lo descubras en una página de políticas.

Para la mayoría de los prompts esto añade poca exposición nueva, porque el texto del prompt va igualmente al proveedor del modelo. Lo que cambia es el número de empresas en la cadena: si dictas con una app aparte, tus palabras pasan por el proveedor de dictado antes que por el del agente. Para código propietario, nombres de clientes o cualquier cosa sujeta a un NDA, valida ese salto adicional con quien se encargue de la seguridad donde trabajas.

Si el audio no puede salir de la máquina en absoluto, hay opciones reales: VS Code Speech funciona en local, y Superwhisper puede ejecutar sus modelos en tu propio hardware. Las ventajas y desventajas, y las preguntas que vale la pena hacerle a cualquier proveedor, se exponen en nuestra comparativa de transcripción en el dispositivo y en la nube.

Tres preguntas para tu equipo de seguridad

¿El audio hablado cuenta como código fuente o datos de clientes según nuestra política? ¿La herramienta de dictado está en la lista de proveedores aprobados, y no solo el agente de programación? ¿Algunos repositorios necesitan una herramienta que procese en local y otros no?

Qué buscar en una herramienta de dictado para programar

Este no es el lugar para un ranking; nuestra comparativa de software de dictado se encarga de eso. Para programar, las preguntas son más concretas:

  1. ¿El mismo atajo en todas partes? Terminal, IDE, navegador y chat; si no, vuelves a tener cuatro hábitos.
  2. ¿Puedes enseñarle tu vocabulario, y la lista te acompaña de una máquina a otra?
  3. ¿Mantener o alternar? Mantener pulsada una tecla va bien para prompts cortos; un modo de alternar es más amable para especificaciones largas y para manos que no quieren aferrarse a una tecla.
  4. ¿Cuánto reescribe? Quieres que desaparezcan las muletillas y se añada la puntuación, no que se parafrasee tu significado técnico.
  5. ¿Dónde se procesa el audio, y es aceptable para el código con el que trabajas?
  6. ¿Qué se mide? Palabras por semana, minutos al mes o ilimitado, y si esa cuota se comparte con algo más.

Sobre ese último punto, esta es la nuestra. El plan gratuito de Laxis da 300 minutos al mes en una sola bolsa: reuniones y dictado consumen los mismos minutos. Los prompts son cortos, pero si también grabas reuniones con él, notarás que se solapan. Premium amplía la bolsa a 2000 minutos, y cada cuenta nueva recibe catorce días de Premium gratis, sin introducir una tarjeta. El Voice Keyboard de Laxis funciona en Mac, Windows, iPhone y Android y escribe en cualquier app, VS Code y la terminal incluidos.

En resumen

Durante años, el argumento contra programar con la voz fue que el código no es lenguaje. Eso sigue siendo cierto del código. Ya no lo es del trabajo. La parte de la programación que no deja de crecer es aquella en la que le explicas lo que quieres a algo capaz de construirlo, y explicar es lo que la gente hacía en voz alta mucho antes de que nadie escribiera nada. Puede que los desarrolladores que más partido les sacan a los agentes acaben siendo los que mejor saben hablarles, no los que teclean más rápido.

Preguntas frecuentes

¿Se puede programar con la voz?

Sí, de dos maneras distintas. La mayoría de los desarrolladores dictan hoy prompts en lenguaje natural, especificaciones y mensajes de commit a agentes de IA como Claude Code y Cursor, y dejan que el agente escriba la sintaxis. Programar totalmente sin manos, hablando y editando el propio código, también es posible con herramientas como Talon y Cursorless, pero requiere unas semanas de práctica.

¿Claude Code tiene entrada de voz?

Sí. Claude Code tiene un comando /voice: mantén pulsada la barra espaciadora para grabar o cambia al modo tap, y lo que dices se transcribe en el prompt. Está ajustado a términos de programación y usa los nombres de tu proyecto y de tu rama como pistas. Requiere iniciar sesión con Claude.ai, envía el audio a Anthropic y no funciona por SSH ni con autenticación por clave de API.

¿Cómo uso la entrada de voz en Cursor?

Cursor tiene un Voice Mode integrado desde la versión 2.0, publicada en octubre de 2025, que permite dictar prompts a Agent y configurar palabras clave de envío personalizadas. Está pensado para el campo de entrada de Agent. Para mensajes de commit, descripciones de PR o la terminal, los desarrolladores suelen añadir una app de dictado para todo el sistema que escribe dondequiera que esté el cursor.

¿Es seguro dictar prompts sobre código propietario?

Depende de adónde vaya el audio y de lo que permita tu empresa. La mayor parte del dictado, incluidos el /voice de Claude Code, el dictado de ChatGPT y Laxis, se procesa en la nube, lo que añade un proveedor a la cadena. Si el audio debe quedarse en tu máquina, VS Code Speech y las herramientas con modelos locales como Superwhisper son las opciones. Consulta primero tu política de seguridad.

¿Cómo consigo que el dictado escriba bien los términos técnicos y los nombres de variables?

Añádelos a un diccionario personalizado antes de juzgar la precisión. La mayoría de las herramientas de dictado, incluido Laxis con su Personal Dictionary, te permiten guardar nombres de bibliotecas, servicios internos y compañeros para que el motor deje de adivinar. Algunas herramientas también leen los nombres visibles en tu editor. Para identificadores con mayúsculas y minúsculas poco habituales, escribirlos o dejar que el agente los complete suele ser más rápido.

¿Puede el software de dictado escribir en la terminal?

Sí, la mayoría de las apps de dictado para todo el sistema escriben en terminales además de en editores y navegadores, aunque las terminales tratan el texto pegado de forma distinta a los cuadros de texto normales. Haz la prueba con un prompt largo en tu terminal real y comprueba que llega cada palabra. Evita dictar comandos de shell palabra por palabra; describe el objetivo a tu agente y revisa el comando que propone.