Dettatura per programmare: parla con Claude Code, Cursor e ChatGPT
Dopo quaranta minuti di sessione con Claude Code, l'agente rifattorizza il livello sbagliato. Tu sai perché: il modulo di fatturazione sembra ridondante, ma esiste per via di una vecchia stranezza di un fornitore, e la correzione va fatta un livello più su. Spiegarlo richiede un paragrafo. Scrivere un paragrafo nel pieno della concentrazione sembra una punizione, così scrivi undici parole, e anche il tentativo successivo va a vuoto. È questo scarto il motivo per cui la dettatura per programmare è diventata uno degli usi più discussi dell'input vocale, e il motivo per cui non somiglia per niente al voice coding di dieci anni fa.
Gli sviluppatori che ne traggono un vantaggio reale non leggono ad alta voce parentesi e punti e virgola. Dettano l'intento: il prompt, la specifica, il messaggio di commit, il motivo per cui un commento di review conta. La sintassi ormai è compito dell'agente. Spiegare resta compito tuo, e la maggior parte delle persone spiega più in fretta a voce che con le dita.
Prima degli agenti, programmare con la voce significava un'altra cosa
Per gran parte della sua storia, programmare con la voce è stato una disciplina più che una comodità. Talon, spesso abbinato all'estensione Cursorless per VS Code, permette di scrivere e modificare codice senza usare le mani, attraverso un vocabolario compatto di comandi vocali. Buona parte di questo lavoro è stata costruita da e per sviluppatori con lesioni da sforzo ripetitivo (RSI), e se le tue mani sono fuori uso resta l'opzione seria, dopo qualche settimana di pratica.
Quello che è cambiato è l'unità di lavoro. Quando la funzione la scrive un agente, ciò che produci tu è la descrizione della funzione: cosa deve fare, cosa non deve rompere, come capirai che è finita. È prosa. E la prosa è esattamente ciò che la dettatura comune ha sempre gestito bene.
Leggi i thread di Hacker News sull'argomento, con titoli come «Ask HN: Anyone using dictation with coding agents?», e nota cosa manca. Si parla di tasti push-to-talk, di dizionari personalizzati e di quale strumento a livello di sistema collegare a un agente da CLI. Quasi nessuno chiede come si pronuncia una parentesi.
Cosa dettano davvero gli sviluppatori (e cosa scrivono ancora a mano)
Dividi la giornata in base al destinatario delle parole e la separazione diventa evidente. Tutto ciò che è rivolto a una persona, o a un modello in linguaggio naturale, è un candidato per la voce. Tutto ciò che un compilatore o una shell deve analizzare carattere per carattere, di solito no.
| Attività | Dettare o digitare? | Perché |
|---|---|---|
| Prompt per Claude Code, Cursor, Codex o ChatGPT | Dettare | Un contesto lungo costa poco a dirlo, e i modelli leggono senza problemi una formulazione approssimativa |
| Specifiche, piani e descrizioni di issue | Dettare | È spiegazione; la struttura si sistema dopo |
| Messaggi di commit e descrizioni delle PR | Dettare | Di' cosa è cambiato e perché finché è fresco, poi taglia prima del push |
| Commenti di code review | Dettare, poi rileggere | Il tono arriva a un collega, quindi controllalo prima di pubblicare |
| Docstring e commenti | Dettare | Prosa che si trova per caso in un file di codice |
| Nomi di variabili, regex, configurazione, modifiche di una riga | Digitare | Maiuscole, simboli e caratteri esatti a voce sono lenti e soggetti a errori |
| Comandi di shell | Digitare, o chiedere all'agente | Un flag capito male può fare danni veri |
Sull'ultima riga: invece di dettare un comando di shell parola per parola, descrivi l'obiettivo all'agente e leggi il comando che propone prima di approvarlo. Così un errore di trascrizione non arriva mai alla tua shell.
Anatomia di un prompt vocale che funziona
I prompt parlati falliscono in modo prevedibile: divagano. Parti dall'obiettivo, a metà ti ricordi un vincolo, torni indietro e finisci con una digressione sulla suite di test. Un modello di solito riesce a districare il tutto, ma uno schema approssimativo che puoi tenere a mente ti dà primi tentativi migliori.
Il prompt vocale in quattro tempi
Contesto: dove siamo e cosa esiste già. Obiettivo: la modifica che vuoi, in una frase. Vincoli: cosa non deve cambiare, quali pattern seguire, cosa evitare. Fatto quando: il test, il comportamento o l'output che dimostra che ha funzionato.
Pronunciali in quest'ordine e raramente ti servirà un secondo messaggio per qualcosa che avevi dimenticato.
Alcune abitudini separano un prompt che va a segno da uno che richiede tre correzioni:
- Leggi prima di inviare. Il
/voicedi Claude Code per impostazione predefinita aspetta che tu prema Invio, ed è l'impostazione giusta da mantenere. Una scorsa di due secondi intercetta il nome di file trascritto male prima che l'agente vada a cercarlo. La modalità a pressione prolungata ha anche un breve riscaldamento, quindi se le prime parole si perdono, la documentazione suggerisce di riassegnarla a una combinazione con un tasto modificatore, che registra fin dalla prima pressione. - Tieni presenti i limiti integrati. Secondo la documentazione di Claude Code, la modalità tocca-per-registrare si ferma dopo 15 secondi di silenzio o due minuti in totale. Per una specifica lunga, detta prima in un file di appunti o in una nota e poi incollala.
- Chiama le cose come si scrivono. Di' «il file user service nella cartella auth» invece di sperare che il motore produca il percorso esatto, e quando conta dai all'agente il percorso reale.
- Parlagli come a un nuovo collega. «Sembra ridondante ma non lo è, perché...» è proprio il contesto che i prompt digitati lasciano fuori.
Un confine: se stai dettando ciò che è stato deciso nella design review di ieri, quello è un altro lavoro. Portare il contesto delle riunioni in Claude o ChatGPT è compito dei server MCP, di cui parliamo nell'articolo su come le app di conversazione si stanno collegando a MCP.
Spesso l'input vocale integrato basta
Controlla prima cosa c'è già nei tuoi strumenti. I principali agenti si sono messi al passo, e per molti sviluppatori è sufficiente.
- Claude Code ha un comando
/voice. Tieni premuto Spazio per parlare, oppure passa alla modalità a tocco. È ottimizzato per il vocabolario della programmazione, usa i nomi del progetto e dei branch git come suggerimenti per il riconoscimento e invia l'audio in streaming ad Anthropic per la trascrizione. Richiede l'accesso con un account Claude.ai, quindi non è disponibile se ti autentichi con una chiave API o tramite Bedrock, e non funziona nelle sessioni SSH. - Cursor ha aggiunto Voice Mode nella versione 2.0, a ottobre 2025: speech-to-text integrato per pilotare Agent, più parole chiave di invio personalizzate, così una frase pronunciata può avviare l'esecuzione.
- ChatGPT ha un pulsante di dettatura nella casella del messaggio. La trascrizione arriva come testo modificabile, quindi puoi correggerla prima di inviare.
- VS Code Speech, l'estensione gratuita di Microsoft, aggiunge la chat vocale per Copilot e la dettatura nell'editor, ed elabora l'audio in locale.
Se tutta la tua giornata si svolge in una di quelle finestre, comincia da lì. Il vuoto emerge quando ne esci: la descrizione della PR sta in una scheda del browser, il commento di review su GitHub, l'aggiornamento per lo standup su Slack. Ogni microfono integrato funziona nel proprio riquadro, quindi o ti destreggi tra diverse abitudini di push-to-talk o torni a digitare tutto ciò che non è un prompt. È questo l'argomento a favore di uno strumento di dettatura a livello di sistema: un'unica scorciatoia che scrive ovunque si trovi il cursore, terminale compreso.
Gergo, identificatori e il terminale
La lamentela più frequente nei thread degli sviluppatori non riguarda la velocità, ma il vocabolario. I motori vocali generici hanno imparato dal parlato generico, così kubectl, useEffect, i nomi dei tuoi servizi interni e il cognome del tuo collega tornano indietro con grafie creative. Gli strumenti affrontano il problema in tre modi.
Il primo è un dizionario personalizzato: aggiungi i termini una volta e il motore smette di tirare a indovinare. In Laxis è il Personal Dictionary; riempilo con il tuo stack, i tuoi servizi e i nomi del team prima di giudicare la precisione. Il secondo è leggere il contesto dallo schermo. Wispr Flow riconosce i nomi di funzioni, classi e variabili visibili in VS Code, Cursor e Windsurf, e può taggare i file a voce nei pannelli di chat di Cursor e Windsurf; se i tuoi prompt sono pieni di camelCase, è un vantaggio concreto. Il terzo è un modello vocale addestrato sul linguaggio tecnico, ed è proprio ciò che Aqua Voice promette con il suo modello Avalon.
Il terminale è l'altra trappola. Molte app di dettatura inseriscono il testo incollandolo, e i terminali sono più schizzinosi con l'incolla rispetto alle normali caselle di testo; le stesse pagine di supporto di Wispr Flow spiegano come dividere in parti le dettature lunghe per Claude Code e Codex su Mac. Qualunque cosa usi, detta un prompt di 150 parole nel tuo terminale reale e verifica che arrivi ogni parola e che nulla venga inviato in anticipo.
Per punteggiatura e formattazione a voce, la nostra guida ai comandi di dettatura elenca cosa puoi dire. Se il vero problema è il riconoscimento, perché la dettatura vocale continua a capire male passa in rassegna le cause più comuni e le soluzioni.
I riempitivi non danno fastidio a un modello, a un revisore sì
Un modello linguistico legge senza problemi «um, so, wait, actually». Un collega che legge la descrizione della tua PR non ne è altrettanto entusiasta. La pulizia che elimina i riempitivi e unisce le frasi ripetute conta di più per il testo letto da persone che per i prompt, quindi giudica qualsiasi strumento sui tuoi messaggi di commit e commenti di review, non su un prompt.
Dove finisce il tuo audio quando il codice è proprietario
Tutte le opzioni viste sopra, tranne quelle locali, inviano la tua voce a un server. Il /voice di Claude Code va in streaming ad Anthropic. La dettatura di ChatGPT va a OpenAI. Anche Laxis elabora la dettatura nel cloud, e preferiamo dirlo chiaramente qui piuttosto che fartelo scoprire in una pagina di policy.
Per la maggior parte dei prompt questo aggiunge poca esposizione nuova, perché il testo del prompt arriva comunque al fornitore del modello. Quello che cambia è il numero di aziende nella catena: se detti tramite un'app separata, le tue parole passano dal fornitore della dettatura prima di arrivare al fornitore dell'agente. Per codice proprietario, nomi di clienti o qualsiasi cosa coperta da NDA, fai approvare quel passaggio in più da chi si occupa di sicurezza dove lavori.
Se l'audio non può proprio lasciare la macchina, ci sono opzioni concrete: VS Code Speech funziona in locale e Superwhisper può eseguire i suoi modelli sul tuo hardware. I compromessi, e le domande da fare a qualsiasi fornitore, sono illustrati nel nostro confronto tra trascrizione on-device e nel cloud.
Tre domande per il tuo team di sicurezza
Secondo la nostra policy, l'audio parlato conta come codice sorgente o come dati dei clienti? Lo strumento di dettatura è nella lista dei fornitori approvati, e non solo l'agente di programmazione? Alcuni repository richiedono uno strumento che elabora in locale e altri no?
Cosa cercare in uno strumento di dettatura per programmare
Questo non è il posto per una classifica; se ne occupa il nostro confronto tra software di dettatura. Per programmare, le domande sono più mirate:
- La stessa scorciatoia ovunque? Terminale, IDE, browser e chat, altrimenti sei di nuovo a quattro abitudini diverse.
- Puoi insegnargli il tuo vocabolario, e l'elenco ti segue da una macchina all'altra?
- Tenere premuto o attivare/disattivare? Tenere premuto un tasto va bene per i prompt brevi; la modalità a interruttore è più comoda per le specifiche lunghe e per le mani che non vogliono restare aggrappate a un tasto.
- Quanto riscrive? Vuoi che tolga i riempitivi e aggiunga la punteggiatura, non che parafrasi il tuo significato tecnico.
- Dove viene elaborato l'audio, ed è accettabile per il codice su cui lavori?
- Cosa viene conteggiato? Parole a settimana, minuti al mese o illimitato, e se quella quota è condivisa con qualcos'altro.
Sull'ultimo punto, ecco il nostro caso. Il piano gratuito di Laxis offre 300 minuti al mese in un'unica quota: riunioni e dettatura attingono agli stessi minuti. I prompt sono brevi, ma se lo usi anche per registrare le riunioni sentirai la sovrapposizione. Premium porta la quota a 2.000 minuti, e ogni nuovo account riceve quattordici giorni di Premium gratis, senza inserire una carta. Laxis Voice Keyboard funziona su Mac, Windows, iPhone e Android e scrive in qualsiasi app, VS Code e terminale compresi.
In sintesi
Per anni l'argomento contro la programmazione a voce è stato che il codice non è linguaggio. Per il codice è ancora vero. Per il lavoro non lo è più. La parte della programmazione che continua a crescere è quella in cui spieghi cosa vuoi a qualcosa in grado di costruirlo, e spiegare è ciò che le persone facevano a voce molto prima che qualcuno scrivesse a macchina. Gli sviluppatori che otterranno di più dagli agenti potrebbero rivelarsi quelli più bravi a parlarci, non i dattilografi più veloci della stanza.
Domande frequenti
Si può programmare con la voce?
Sì, in due modi diversi. Oggi la maggior parte degli sviluppatori detta prompt in linguaggio naturale, specifiche e messaggi di commit ad agenti AI come Claude Code e Cursor, e lascia che sia l'agente a scrivere la sintassi. Anche la programmazione completamente a mani libere, in cui si parla e si modifica il codice stesso, è possibile con strumenti come Talon e Cursorless, ma richiede qualche settimana di pratica.
Claude Code ha l'input vocale?
Sì. Claude Code ha un comando /voice: tieni premuto Spazio per registrare, oppure passa alla modalità a tocco, e ciò che dici viene trascritto nel prompt. È ottimizzato per i termini di programmazione e usa i nomi del progetto e dei branch come suggerimenti. Richiede l'accesso con un account Claude.ai, invia l'audio in streaming ad Anthropic e non funziona via SSH né con l'autenticazione tramite chiave API.
Come si usa l'input vocale in Cursor?
Cursor ha una Voice Mode integrata dalla versione 2.0, rilasciata a ottobre 2025, che permette di dettare prompt ad Agent e di impostare parole chiave di invio personalizzate. È pensata per l'input di Agent. Per messaggi di commit, descrizioni delle PR o il terminale, gli sviluppatori di solito aggiungono un'app di dettatura a livello di sistema che scrive ovunque si trovi il cursore.
È sicuro dettare prompt che riguardano codice proprietario?
Dipende da dove va l'audio e da cosa consente il tuo datore di lavoro. La maggior parte della dettatura, compresi il /voice di Claude Code, la dettatura di ChatGPT e Laxis, viene elaborata nel cloud, il che aggiunge un fornitore alla catena. Se l'audio deve restare sulla tua macchina, le opzioni sono VS Code Speech e strumenti con modelli locali come Superwhisper. Controlla prima la tua policy di sicurezza.
Come faccio a far scrivere correttamente termini tecnici e nomi di variabili alla dettatura?
Aggiungili a un dizionario personalizzato prima di giudicare la precisione. La maggior parte degli strumenti di dettatura, incluso Laxis con il suo Personal Dictionary, permette di salvare nomi di librerie, servizi interni e nomi dei colleghi, così il motore smette di tirare a indovinare. Alcuni strumenti leggono anche i nomi visibili nel tuo editor. Per gli identificatori con maiuscole insolite, digitarli o lasciarli completare all'agente è spesso più rapido.
I software di dettatura possono scrivere nel terminale?
Sì, la maggior parte delle app di dettatura a livello di sistema scrive nei terminali oltre che negli editor e nei browser, anche se i terminali gestiscono il testo incollato in modo diverso dalle normali caselle di testo. Fai una prova con un prompt lungo nel terminale che usi davvero e verifica che arrivino tutte le parole. Evita di dettare i comandi di shell parola per parola; descrivi l'obiettivo all'agente e controlla il comando che propone.