Zurück zu den Einblicken
Best Practice•2026-09-29•10 min Lesezeit

Diktieren beim Programmieren: mit Claude Code, Cursor und ChatGPT sprechen

Diktieren beim Programmieren: mit Claude Code, Cursor und ChatGPT sprechen
TL
Team Laxis
Laxis-Team @ Laxis

Nach vierzig Minuten in einer Claude-Code-Session refaktoriert der Agent die falsche Schicht. Sie wissen, warum: Das Abrechnungsmodul wirkt überflüssig, existiert aber wegen einer alten Eigenheit eines Anbieters, und der Fix gehört eine Ebene höher. Das zu erklären, braucht einen Absatz. Mitten im Flow einen Absatz zu tippen, fühlt sich wie eine Strafe an, also tippen Sie elf Wörter, und der nächste Versuch geht ebenfalls daneben. Genau diese Lücke ist der Grund, warum Diktieren beim Programmieren zu einem der meistdiskutierten Einsatzzwecke der Spracheingabe geworden ist – und warum es nichts mit dem Voice Coding von vor zehn Jahren gemein hat.

Die Entwickler, die wirklich etwas davon haben, lesen keine Klammern und Semikolons vor. Sie diktieren die Absicht: den Prompt, die Spezifikation, die Commit-Message, den Grund, warum ein Review-Kommentar wichtig ist. Syntax ist jetzt Sache des Agenten. Das Erklären bleibt Ihre Aufgabe, und die meisten Menschen erklären laut schneller als mit den Fingern.

Voice Coding bedeutete etwas anderes, bevor die Agenten kamen

Die längste Zeit war Programmieren per Stimme eher eine Disziplin als eine Bequemlichkeit. Talon, oft kombiniert mit der Erweiterung Cursorless für VS Code, ermöglicht es, Code freihändig über ein kompaktes Vokabular gesprochener Befehle zu schreiben und zu bearbeiten. Vieles davon wurde von und für Entwickler mit RSI (Repetitive Strain Injury, umgangssprachlich „Mausarm“) entwickelt, und wenn Ihre Hände ausfallen, ist es nach ein paar Wochen Übung nach wie vor die ernsthafte Option.

Was sich geändert hat, ist die Arbeitseinheit. Wenn ein Agent die Funktion schreibt, produzieren Sie eine Beschreibung der Funktion: was sie tun soll, was sie nicht kaputt machen darf, woran Sie erkennen, dass sie fertig ist. Das ist Prosa. Und Prosa ist genau das, was gewöhnliches Diktieren schon immer gut beherrscht hat.

Lesen Sie die Hacker-News-Threads dazu, mit Titeln wie „Ask HN: Anyone using dictation with coding agents?“, und achten Sie darauf, was fehlt. Es geht um Push-to-Talk-Tasten, eigene Wörterbücher und darum, welches systemweite Tool man an einen CLI-Agenten anbindet. Fast niemand fragt, wie man eine Klammer ausspricht.

Was Entwickler tatsächlich diktieren (und was sie weiterhin tippen)

Sortieren Sie Ihren Tag danach, für wen die Wörter bestimmt sind, und die Aufteilung wird offensichtlich. Alles, was sich an einen Menschen richtet oder in normaler Sprache an ein Modell, kommt für die Stimme infrage. Alles, was ein Compiler oder eine Shell Zeichen für Zeichen parsen muss, meist nicht.

AufgabeDiktieren oder tippen?Warum
Prompts an Claude Code, Cursor, Codex oder ChatGPTDiktierenLanger Kontext ist schnell gesagt, und Modelle lesen über lockere Formulierungen einfach hinweg
Specs, Pläne und Issue-BeschreibungenDiktierenDas ist Erklärung; die Struktur räumen Sie hinterher auf
Commit-Messages und PR-BeschreibungenDiktierenSagen Sie, was sich geändert hat und warum, solange es frisch ist, und kürzen Sie vor dem Push
Code-Review-KommentareDiktieren, dann noch einmal lesenDer Ton kommt bei einem Kollegen an, also prüfen Sie ihn vor dem Posten
Docstrings und KommentareDiktierenProsa, die zufällig in einer Codedatei steht
Variablennamen, Regex, Config, einzeilige ÄnderungenTippenGroß- und Kleinschreibung, Symbole und exakte Zeichen sind gesprochen langsam und fehleranfällig
Shell-BefehleTippen oder den Agenten fragenEin falsch verstandenes Flag kann echten Schaden anrichten

Zur letzten Zeile: Statt einen Shell-Befehl wörtlich zu diktieren, beschreiben Sie dem Agenten das Ziel und lesen den vorgeschlagenen Befehl, bevor Sie ihn freigeben. So erreicht ein Hörfehler nie Ihre Shell.

Anatomie eines gesprochenen Prompts, der funktioniert

Gesprochene Prompts scheitern auf vorhersehbare Weise: Sie schweifen ab. Sie beginnen mit dem Ziel, erinnern sich auf halber Strecke an eine Einschränkung, springen zurück und enden bei einem Exkurs über die Testsuite. Ein Modell kann das meist entwirren, aber eine lockere Struktur, die Sie im Kopf behalten können, bringt bessere erste Versuche.

Der Sprach-Prompt in vier Schritten

Kontext: wo wir stehen und was schon existiert. Ziel: die gewünschte Änderung, in einem Satz. Einschränkungen: was sich nicht ändern darf, welchen Mustern zu folgen ist, was zu vermeiden ist. Fertig, wenn: der Test, das Verhalten oder die Ausgabe, die beweist, dass es funktioniert hat.

Sprechen Sie die vier Punkte in dieser Reihenfolge, und Sie brauchen selten eine Nachfrage für etwas Vergessenes.

Ein paar Gewohnheiten unterscheiden einen Prompt, der sitzt, von einem, der drei Korrekturen braucht:

  • Lesen, bevor Sie senden. Das /voice von Claude Code wartet standardmäßig auf Enter, und diese Einstellung sollten Sie beibehalten. Ein zweisekündiger Blick fängt den falsch verstandenen Dateinamen ab, bevor der Agent danach sucht. Der Haltemodus (hold) hat außerdem eine kurze Aufwärmphase; wenn also die ersten Wörter fehlen, empfiehlt die Dokumentation, ihn auf eine Kombination mit Modifier-Taste umzulegen, die ab dem ersten Tastendruck aufnimmt.
  • Die eingebauten Grenzen beachten. Laut der Dokumentation von Claude Code stoppt der Tap-Modus (Antippen zum Aufnehmen) nach 15 Sekunden Stille oder nach insgesamt zwei Minuten. Für eine lange Spec diktieren Sie zuerst in eine Scratch-Datei oder Notiz und fügen sie dann ein.
  • Dinge so benennen, wie sie geschrieben werden. Sagen Sie „die User-Service-Datei im Auth-Ordner“, statt zu hoffen, dass die Engine den exakten Pfad liefert, und geben Sie dem Agenten den echten Pfad, wann immer es darauf ankommt.
  • Mit ihm reden wie mit einem neuen Teammitglied. „Das sieht überflüssig aus, ist es aber nicht, weil ...“ ist genau der Kontext, den getippte Prompts weglassen.

Eine Abgrenzung: Wenn Sie diktieren, was im gestrigen Design-Review beschlossen wurde, ist das eine andere Aufgabe. Meeting-Kontext in Claude oder ChatGPT zu bringen, ist Sache von MCP-Servern; mehr dazu in unserem Artikel darüber, wie Konversations-Apps an MCP andocken.

Die eingebaute Spracheingabe reicht oft

Prüfen Sie zuerst, was Ihre Tools bereits mitbringen. Die großen Agenten haben aufgeholt, und vielen Entwicklern reicht das.

  • Claude Code hat einen /voice-Befehl. Halten Sie die Leertaste gedrückt, um zu sprechen, oder wechseln Sie in den Tap-Modus. Er ist auf Programmiervokabular abgestimmt, nutzt die Namen Ihres Projekts und Ihres Git-Branches als Erkennungshinweise und streamt das Audio zur Transkription an Anthropic. Er erfordert eine Claude.ai-Anmeldung, steht also nicht zur Verfügung, wenn Sie sich per API-Key oder über Bedrock authentifizieren, und funktioniert nicht in SSH-Sitzungen.
  • Cursor hat in Version 2.0 im Oktober 2025 Voice Mode eingeführt: eingebaute Spracherkennung, um Agent zu steuern, plus eigene Submit-Schlüsselwörter, damit eine gesprochene Phrase den Lauf startet.
  • ChatGPT hat einen Diktier-Button im Nachrichtenfeld. Das Transkript kommt als bearbeitbarer Text an, sodass Sie es vor dem Senden korrigieren können.
  • VS Code Speech, die kostenlose Erweiterung von Microsoft, ergänzt Sprach-Chat für Copilot und Diktieren im Editor und verarbeitet das Audio lokal.

Wenn Ihr ganzer Tag in einem dieser Fenster stattfindet, fangen Sie dort an. Die Lücke tut sich auf, sobald Sie es verlassen: Die PR-Beschreibung lebt in einem Browser-Tab, der Review-Kommentar auf GitHub, das Standup-Update in Slack. Jedes eingebaute Mikrofon arbeitet in seiner eigenen Box, also jonglieren Sie entweder mit mehreren Push-to-Talk-Gewohnheiten oder tippen wieder alles, was kein Prompt ist. Das ist das Argument für ein systemweites Diktier-Tool: ein Hotkey, der dort schreibt, wo der Cursor steht, das Terminal eingeschlossen.

Fachjargon, Bezeichner und das Terminal

Die Beschwerde, die in Entwickler-Threads am häufigsten auftaucht, betrifft nicht die Geschwindigkeit, sondern das Vokabular. Allgemeine Spracherkennungs-Engines haben mit allgemeiner Sprache gelernt, also kommen kubectl, useEffect, die Namen Ihrer internen Services und der Nachname Ihrer Kollegin in kreativer Schreibweise zurück. Tools gehen das auf drei Arten an.

Die erste ist ein eigenes Wörterbuch: Begriffe einmal hinzufügen, und die Engine hört auf zu raten. In Laxis ist das das Personal Dictionary; füllen Sie es mit Ihrem Stack, Ihren Services und den Namen Ihres Teams, bevor Sie die Genauigkeit beurteilen. Die zweite ist, Kontext vom Bildschirm zu lesen. Wispr Flow kann Funktions-, Klassen- und Variablennamen erkennen, die in VS Code, Cursor und Windsurf sichtbar sind, und in den Chat-Panels von Cursor und Windsurf Dateien per Stimme taggen; wenn Ihre Prompts voller camelCase stecken, ist das ein echter Vorteil. Die dritte ist ein Sprachmodell, das auf Fachsprache trainiert ist – damit wirbt Aqua Voice für sein Modell Avalon.

Das Terminal ist die andere Falle. Viele Diktier-Apps fügen Text über die Zwischenablage ein, und Terminals sind beim Einfügen wählerischer als gewöhnliche Textfelder; die Hilfeseiten von Wispr Flow selbst beschreiben, wie man lange Diktate für Claude Code und Codex auf dem Mac in Teile aufteilt. Was Sie auch verwenden: Diktieren Sie einen Prompt mit 150 Wörtern in Ihr echtes Terminal und prüfen Sie, dass jedes Wort ankommt und nichts vorzeitig abgeschickt wird.

Für Satzzeichen und Formatierung per Stimme listet unser Leitfaden zu Diktierbefehlen auf, was Sie sagen können. Wenn die Erkennung das eigentliche Problem ist, geht warum Spracheingabe Sie ständig falsch versteht die üblichen Ursachen und Lösungen durch.

Füllwörter stören ein Modell nicht, einen Reviewer schon

Ein Sprachmodell liest über „äh, also, warte, eigentlich“ einfach hinweg. Eine Kollegin, die Ihre PR-Beschreibung liest, hat daran deutlich weniger Freude. Eine Bereinigung, die Füllwörter entfernt und wiederholte Phrasen zusammenführt, ist für Text, den Menschen lesen, wichtiger als für Prompts; beurteilen Sie ein Tool also anhand Ihrer Commit-Messages und Review-Kommentare, nicht anhand eines Prompts.

Wohin Ihr Audio geht, wenn der Code proprietär ist

Alle oben genannten Optionen, abgesehen von den lokalen, schicken Ihre Stimme an einen Server. Das /voice von Claude Code streamt an Anthropic. Das Diktieren in ChatGPT geht an OpenAI. Auch Laxis verarbeitet Diktate in der Cloud, und wir sagen das lieber hier offen, als dass Sie es auf einer Richtlinienseite entdecken.

Bei den meisten Prompts kommt dadurch kaum zusätzliches Risiko hinzu, weil der Prompt-Text ohnehin beim Modellanbieter landet. Was sich ändert, ist die Zahl der Unternehmen in der Kette: Diktieren Sie über eine separate App, laufen Ihre Worte erst über den Diktier-Anbieter und dann über den Agenten-Anbieter. Bei proprietärem Code, Kundennamen oder allem, was unter ein NDA fällt, klären Sie diese zusätzliche Station mit der Person, die bei Ihnen für Sicherheit zuständig ist.

Wenn Audio den Rechner überhaupt nicht verlassen darf, gibt es echte Optionen: VS Code Speech läuft lokal, und Superwhisper kann seine Modelle auf Ihrer eigenen Hardware ausführen. Die Abwägungen und die Fragen, die man jedem Anbieter stellen sollte, finden Sie in unserem Vergleich von On-Device- und Cloud-Transkription.

Drei Fragen an Ihr Security-Team

Zählt gesprochenes Audio laut unserer Richtlinie als Quellcode oder Kundendaten? Steht das Diktier-Tool auf der Liste der freigegebenen Anbieter, und nicht nur der Coding-Agent? Brauchen manche Repositorys ein Tool mit lokaler Verarbeitung, andere dagegen nicht?

Worauf es bei einem Diktier-Tool fürs Programmieren ankommt

Hier ist nicht der Ort für eine Rangliste; das übernimmt unser Vergleich von Diktiersoftware. Fürs Programmieren sind die Fragen enger gefasst:

  1. Überall derselbe Hotkey? Terminal, IDE, Browser und Chat – sonst sind Sie wieder bei vier Gewohnheiten.
  2. Können Sie ihm Ihr Vokabular beibringen, und wandert die Liste mit Ihnen von Rechner zu Rechner?
  3. Halten oder umschalten? Eine Taste zu halten, passt zu kurzen Prompts; ein Umschaltmodus ist schonender bei langen Specs und für Hände, die keine Taste festhalten wollen.
  4. Wie viel schreibt es um? Sie wollen, dass Füllwörter verschwinden und Satzzeichen ergänzt werden, nicht, dass Ihre technische Aussage umformuliert wird.
  5. Wo wird das Audio verarbeitet, und ist das für den Code, an dem Sie arbeiten, akzeptabel?
  6. Was wird abgerechnet? Wörter pro Woche, Minuten pro Monat oder unbegrenzt – und ob dieses Kontingent mit etwas anderem geteilt wird.

Zum letzten Punkt hier unser eigenes Modell. Der kostenlose Laxis-Plan bietet 300 Minuten pro Monat in einem einzigen Pool: Meetings und Diktieren zehren von denselben Minuten. Prompts sind kurz, aber wenn Sie damit auch Meetings aufzeichnen, werden Sie die Überschneidung merken. Premium erhöht den Pool auf 2.000 Minuten, und jedes neue Konto erhält vierzehn Tage Premium gratis, ohne Eingabe einer Karte. Das Laxis Voice Keyboard läuft auf Mac, Windows, iPhone und Android und schreibt in jede App, VS Code und das Terminal eingeschlossen.

Das Fazit

Jahrelang lautete das Argument gegen Programmieren per Stimme, dass Code keine Sprache ist. Für den Code stimmt das immer noch. Für den Job nicht mehr. Der Teil des Programmierens, der immer weiter wächst, ist der, in dem Sie einem System, das es bauen kann, erklären, was Sie wollen – und Erklären haben Menschen laut getan, lange bevor irgendjemand tippte. Die Entwickler, die am meisten aus Agenten herausholen, könnten sich als diejenigen erweisen, die am besten mit ihnen reden können, nicht als die schnellsten Tipper im Raum.

Häufig gestellte Fragen

Kann man per Stimme programmieren?

Ja, auf zwei verschiedene Arten. Die meisten Entwickler diktieren heute Prompts in natürlicher Sprache, Specs und Commit-Messages an KI-Agenten wie Claude Code und Cursor und lassen den Agenten die Syntax schreiben. Vollständig freihändiges Programmieren, bei dem Sie den Code selbst sprechen und bearbeiten, ist mit Tools wie Talon und Cursorless ebenfalls möglich, erfordert aber ein paar Wochen Übung.

Hat Claude Code eine Spracheingabe?

Ja. Claude Code hat einen /voice-Befehl: Halten Sie die Leertaste gedrückt, um aufzunehmen, oder wechseln Sie in den Tap-Modus, und Ihre Sprache wird in den Prompt transkribiert. Er ist auf Programmierbegriffe abgestimmt und nutzt die Namen Ihres Projekts und Branches als Hinweise. Er erfordert eine Claude.ai-Anmeldung, streamt das Audio an Anthropic und funktioniert weder über SSH noch mit API-Key-Authentifizierung.

Wie nutze ich die Spracheingabe in Cursor?

Cursor hat seit Version 2.0, erschienen im Oktober 2025, einen eingebauten Voice Mode, mit dem Sie Prompts an Agent sprechen und eigene Submit-Schlüsselwörter festlegen können. Er ist für das Eingabefeld von Agent gedacht. Für Commit-Messages, PR-Beschreibungen oder das Terminal ergänzen Entwickler meist eine systemweite Diktier-App, die dort schreibt, wo der Cursor steht.

Ist es sicher, Prompts zu proprietärem Code zu diktieren?

Das hängt davon ab, wohin das Audio geht und was Ihr Arbeitgeber erlaubt. Die meisten Diktierlösungen, darunter das /voice von Claude Code, das Diktieren in ChatGPT und Laxis, verarbeiten in der Cloud, was einen weiteren Anbieter in die Kette bringt. Wenn das Audio auf Ihrem Rechner bleiben muss, sind VS Code Speech und Tools mit lokalen Modellen wie Superwhisper die Optionen. Prüfen Sie zuerst Ihre Sicherheitsrichtlinie.

Wie bringe ich die Diktierfunktion dazu, Fachbegriffe und Variablennamen richtig zu schreiben?

Fügen Sie sie einem eigenen Wörterbuch hinzu, bevor Sie die Genauigkeit beurteilen. Die meisten Diktier-Tools, darunter Laxis mit seinem Personal Dictionary, lassen Sie Namen von Bibliotheken, internen Services und Teammitgliedern speichern, damit die Engine aufhört zu raten. Manche Tools lesen außerdem sichtbare Namen aus Ihrem Editor. Bei Bezeichnern mit ungewöhnlicher Groß- und Kleinschreibung ist es oft schneller, sie zu tippen oder vom Agenten ergänzen zu lassen.

Kann Diktiersoftware ins Terminal schreiben?

Ja, die meisten systemweiten Diktier-Apps schreiben in Terminals ebenso wie in Editoren und Browser, auch wenn Terminals eingefügten Text anders behandeln als normale Textfelder. Testen Sie mit einem langen Prompt in Ihrem tatsächlichen Terminal und prüfen Sie, dass jedes Wort ankommt. Diktieren Sie Shell-Befehle nicht Wort für Wort; beschreiben Sie Ihrem Agenten das Ziel und prüfen Sie den vorgeschlagenen Befehl.