コーディングを音声入力で:Claude Code、Cursor、ChatGPT に話しかける
Claude Code のセッションが40分を過ぎたころ、エージェントが違うレイヤーをリファクタリングしてしまいます。理由はわかっています。課金モジュールは冗長に見えますが、古いベンダーの癖に対応するために存在していて、修正は一つ上の層で行うべきなのです。それを説明するには一段落が必要です。けれども集中している最中に一段落をタイプするのは罰ゲームのように感じられるので、11語だけ打ち込み、次の試みもまた外れます。このギャップこそ、コーディングでの音声入力が音声入力の使い道として最も話題になっているものの一つになった理由であり、10年前の「音声コーディング」とはまるで違って見える理由でもあります。
実際に効果を得ている開発者は、括弧やセミコロンを読み上げているわけではありません。口述しているのは意図です。プロンプト、仕様、コミットメッセージ、そしてあるレビューコメントがなぜ重要なのかという理由。構文はいまやエージェントの仕事です。説明するのは今もあなたの仕事で、たいていの人は指よりも声のほうが速く説明できます。
エージェント登場以前、音声コーディングは別物だった
その歴史の大半において、声でコードを書くことは便利さではなく、修練を要する技術でした。Talon は VS Code 向けの Cursorless 拡張機能と組み合わせて使われることが多く、コンパクトな音声コマンドの語彙で、手を使わずにコードを書いたり編集したりできます。こうした取り組みの多くは、反復性ストレス障害(RSI)を抱える開発者が、同じ境遇の開発者のために作ってきたものです。手が使えない状態なら、数週間の練習は必要ですが、今でも本格的な選択肢です。
変わったのは仕事の単位です。エージェントが関数を書くなら、あなたが生み出すのは関数の説明です。何をすべきか、何を壊してはいけないか、完成したとどうやって判断するか。それは文章です。そして文章こそ、ごく普通の音声入力が昔から得意としてきたものです。
Hacker News でこの話題を扱ったスレッド、たとえば「Ask HN: Anyone using dictation with coding agents?」といったタイトルのものを読んでみると、何が欠けているかに気づくはずです。話題になっているのは、プッシュ・トゥ・トーク(押している間だけ話す)のキー、カスタム辞書、そして CLI エージェントにどのシステム全体で使えるツールをつなぐか。括弧をどう言えばいいかを尋ねる人はほとんどいません。
開発者が実際に口述しているもの(そして今もタイプしているもの)
一日の作業を「その言葉は誰に向けたものか」で分けてみると、境界ははっきりします。人に向けたもの、あるいは平易な言葉でモデルに向けたものは、音声の候補です。コンパイラやシェルが1文字ずつ解析しなければならないものは、たいてい向いていません。
| タスク | 口述かタイプか? | 理由 |
|---|---|---|
| Claude Code、Cursor、Codex、ChatGPT へのプロンプト | 口述 | 長いコンテキストも話せば手間がかからず、モデルは緩い言い回しでもそのまま読み取れる |
| 仕様、計画、issue の説明 | 口述 | 中身は説明なので、構成は後から整える |
| コミットメッセージと PR の説明 | 口述 | 記憶が新しいうちに何をなぜ変えたかを話し、push 前に削る |
| コードレビューのコメント | 口述してから読み返す | トーンは同僚に届くので、投稿前に確認する |
| docstring とコメント | 口述 | たまたまコードファイルの中にある文章 |
| 変数名、正規表現、設定、1行の修正 | タイプ | 大文字小文字、記号、正確な文字は声だと遅く、間違えやすい |
| シェルコマンド | タイプ、またはエージェントに任せる | フラグ一つの聞き違いが実害につながりうる |
最後の行について。シェルコマンドを一字一句口述するのではなく、目的をエージェントに説明し、提案されたコマンドを承認する前に読みましょう。そうすれば聞き違いがシェルに届くことはありません。
うまくいく音声プロンプトの構造
音声プロンプトの失敗パターンは予測できます。脱線するのです。ゴールから話し始め、途中で制約を思い出して話を戻し、最後はテストスイートについての余談で終わる。モデルはたいてい解きほぐしてくれますが、頭の中に保てるゆるい型があれば、最初の試みの精度が上がります。
4拍の音声プロンプト
コンテキスト:今どこにいて、何がすでにあるか。ゴール:望む変更を一文で。制約:変えてはいけないもの、従うべきパターン、避けるべきこと。完了条件:うまくいったことを証明するテスト、振る舞い、出力。
この順番で話せば、言い忘れのために追加の指示を出すことはめったにありません。
一発で通るプロンプトと、3回の修正が必要なプロンプトを分けるのは、いくつかの習慣です。
- 送信前に読む。 Claude Code の
/voiceはデフォルトで Enter を待ちます。この設定はそのままにしておくのが正解です。2秒ざっと見るだけで、エージェントが聞き違えたファイル名を探しに行く前に気づけます。ホールドモードには短いウォームアップもあるため、最初の数語が抜ける場合は、修飾キーの組み合わせに割り当て直すようドキュメントが勧めています。そうすれば最初のキー押下から録音されます。 - 組み込みの制限に注意する。 Claude Code のドキュメントによると、タップ録音モードは15秒間の無音か、合計2分で停止します。長い仕様は、まずスクラッチファイルかメモに口述してから貼り付けましょう。
- 綴りどおりの名前で呼ぶ。 エンジンが正確なパスを出してくれることを期待するより、「auth フォルダの user service ファイル」のように言い、パスが重要な場面では実際のパスをエージェントに渡しましょう。
- 新しいチームメイトに話すように話す。 「これは冗長に見えるけど、そうじゃない。なぜなら……」こそ、タイプしたプロンプトが省いてしまうコンテキストです。
一つ線引きをしておきます。昨日の設計レビューで決まったことを口述しようとしているなら、それは別の仕事です。会議のコンテキストを Claude や ChatGPT に取り込むのは MCP サーバーの役割で、会話アプリが MCP につながり始めている話の記事で取り上げています。
組み込みの音声入力で足りることも多い
まずは手元のツールにすでに何があるか確認しましょう。主要なエージェントは追いついてきており、多くの開発者にはそれで十分です。
- Claude Code には
/voiceコマンドがあります。Space を押し続けて話すか、タップモードに切り替えます。コーディングの語彙に合わせて調整されており、プロジェクト名や git ブランチ名を認識のヒントとして使い、音声は Anthropic にストリーミングされて文字起こしされます。Claude.ai へのログインが必要なため、API キーや Bedrock 経由で認証している場合は使えず、SSH セッションでも動作しません。 - Cursor は2025年10月のバージョン2.0で Voice Mode を追加しました。Agent を操作するための音声テキスト変換を内蔵し、カスタムの送信キーワードを設定すれば、話したフレーズで実行を開始できます。
- ChatGPT にはメッセージボックスに音声入力ボタンがあります。文字起こしは編集可能なテキストとして入るので、送信前に修正できます。
- VS Code Speech は Microsoft の無料拡張機能で、Copilot との音声チャットとエディター内での音声入力を追加し、音声をローカルで処理します。
一日の仕事がすべてそのどれかのウィンドウの中で完結するなら、そこから始めましょう。ギャップが生まれるのは、そこから出たときです。PR の説明はブラウザのタブに、レビューコメントは GitHub に、スタンドアップの報告は Slack にあります。組み込みのマイクはそれぞれ自分の枠の中でしか動かないので、プッシュ・トゥ・トークの習慣をいくつも使い分けるか、プロンプト以外はすべてタイプに戻るかのどちらかになります。そこにシステム全体で使える音声入力ツールの意義があります。ホットキー一つで、ターミナルも含め、カーソルのある場所に入力できるのです。
専門用語、識別子、そしてターミナル
開発者のスレッドで最も多い不満は、速度ではなく語彙です。汎用の音声エンジンは一般的な話し言葉から学習しているので、kubectl や useEffect、社内のサービス名、同僚の名字は、独創的なスペルになって返ってきます。ツールの対策は3通りあります。
1つ目はカスタム辞書です。用語を一度登録すれば、エンジンは推測をやめます。Laxis ではそれが Personal Dictionary(個人辞書)です。精度を判断する前に、使っている技術スタック、サービス名、チームメンバーの名前を登録しておきましょう。2つ目は画面上のコンテキストを読み取ることです。Wispr Flow は VS Code、Cursor、Windsurf に表示されている関数名、クラス名、変数名を認識でき、Cursor と Windsurf のチャットパネルでは音声でファイルをタグ付けできます。プロンプトに camelCase が多いなら、これは確かな強みです。3つ目は技術的な言葉で学習した音声モデルで、Aqua Voice が自社の Avalon モデルで打ち出しているのがまさにこれです。
ターミナルはもう一つの落とし穴です。多くの音声入力アプリはテキストを貼り付けで挿入しますが、ターミナルは通常のテキストボックスより貼り付けの扱いにうるさいのです。Wispr Flow 自身のヘルプページにも、Mac で Claude Code や Codex に入力する際は長い口述を分割するよう書かれています。何を使うにせよ、実際に使っているターミナルに150語のプロンプトを口述して、すべての単語が届き、途中で送信されないことを確かめてください。
音声での句読点や書式については、音声入力コマンドのガイドで話せる内容を一覧にしています。認識そのものが問題なら、音声入力がなぜ聞き間違えるのかでよくある原因と対処法を説明しています。
フィラーはモデルには無害でも、レビュアーにはそうではない
言語モデルは「um, so, wait, actually」をそのまま読み流します。PR の説明を読む同僚は、そうはいきません。フィラーを取り除き、繰り返しをまとめるクリーンアップ機能は、プロンプトよりも人が読むテキストでこそ重要です。どのツールも、プロンプトではなくコミットメッセージとレビューコメントで評価しましょう。
コードが社外秘のとき、音声はどこへ行くのか
上に挙げた選択肢は、ローカルのものを除いて、すべてあなたの声をサーバーに送ります。Claude Code の /voice は Anthropic へストリーミングされます。ChatGPT の音声入力は OpenAI へ送られます。Laxis もクラウドで音声入力を処理しています。ポリシーのページで知ることになるより、ここではっきりお伝えしておきたいと思います。
ほとんどのプロンプトについては、新たなリスクはあまり増えません。プロンプトのテキストはいずれにせよモデルのベンダーに送られるからです。変わるのは経由する会社の数です。別のアプリで口述すると、言葉はエージェントのベンダーに届く前に音声入力のベンダーを通ります。社外秘のコード、顧客名、NDA の対象になるものについては、この追加の経由先について、社内でセキュリティを担当する人の了承を得てください。
音声をマシンの外に一切出せないなら、現実的な選択肢があります。VS Code Speech はローカルで動作し、Superwhisper は自分のハードウェア上でモデルを実行できます。そのトレードオフと、どのベンダーにも聞いておくべき質問は、オンデバイスとクラウドの文字起こしの比較記事にまとめています。
セキュリティチームへの3つの質問
当社のポリシーでは、話した音声はソースコードや顧客データに該当しますか? コーディングエージェントだけでなく、音声入力ツールも承認済みベンダーのリストに入っていますか? ローカル処理のツールが必要なリポジトリと、そうでないリポジトリがありますか?
コーディング用の音声入力ツールで見るべき点
ここはランキングを載せる場所ではありません。それは音声入力ソフトの比較の役目です。コーディングに関しては、問うべきことはもっと絞られます。
- どこでも同じホットキーか? ターミナル、IDE、ブラウザ、チャットのすべてで使えなければ、4つの習慣に逆戻りです。
- 自分の語彙を覚えさせられるか、そしてそのリストはマシン間で引き継がれるか?
- ホールドかトグルか? キーを押し続ける方式は短いプロンプト向きです。トグルは長い仕様や、キーを押さえ続けたくない手に優しい方式です。
- どれだけ書き換えるか? 欲しいのはフィラーの除去と句読点の追加であって、技術的な意味の言い換えではありません。
- 音声はどこで処理されるか、そしてそれは扱うコードにとって許容できるか?
- 何が従量制か? 週あたりの語数、月あたりの分数、あるいは無制限か。そしてその枠が他の機能と共有されているか。
最後の点について、Laxis の場合をお伝えします。Laxis の無料プランは月300分で、1つのプールにまとまっています。会議と音声入力が同じ分数から消費されるということです。プロンプトは短いものですが、会議の録音にも使うなら、この重なりを感じるでしょう。Premium ではプールが2,000分に増え、新規アカウントはすべて、カード登録なしで Premium を14日間無料で使えます。Laxis Voice Keyboard は Mac、Windows、iPhone、Android で動作し、VS Code やターミナルを含むあらゆるアプリに入力できます。
まとめ
長年、声でコーディングすることへの反論は「コードは言語ではない」というものでした。コードについては今もそのとおりです。しかし仕事については、もはやそうではありません。プログラミングの中で広がり続けているのは、それを作れる相手に、自分が何を求めているかを説明する部分です。そして説明することは、誰かがタイプを始めるずっと前から、人が声でやってきたことです。エージェントを最も使いこなす開発者は、その場で一番速くタイプする人ではなく、エージェントに話しかけるのが一番うまい人なのかもしれません。
よくある質問
声でコーディングはできますか?
はい、2つの異なる方法があります。現在、多くの開発者は Claude Code や Cursor などの AI エージェントに自然言語のプロンプト、仕様、コミットメッセージを口述し、構文はエージェントに書かせています。コードそのものを声で書いて編集する完全ハンズフリーのコーディングも、Talon や Cursorless といったツールで可能ですが、数週間の練習が必要です。
Claude Code に音声入力はありますか?
あります。Claude Code には /voice コマンドがあり、Space を押し続けて録音するか、タップモードに切り替えると、話した内容がプロンプトに文字起こしされます。コーディング用語に合わせて調整されており、プロジェクト名やブランチ名をヒントとして使います。Claude.ai へのログインが必要で、音声は Anthropic にストリーミングされ、SSH 経由や API キー認証では動作しません。
Cursor で音声入力を使うにはどうすればいいですか?
Cursor には、2025年10月にリリースされたバージョン2.0から Voice Mode が組み込まれており、Agent にプロンプトを話しかけたり、カスタムの送信キーワードを設定したりできます。Agent の入力欄向けに設計されたものです。コミットメッセージ、PR の説明、ターミナルについては、カーソルのある場所に入力できるシステム全体の音声入力アプリを追加するのが一般的です。
社外秘のコードに関するプロンプトを口述しても安全ですか?
音声がどこへ送られるか、そして勤務先が何を許可しているかによります。Claude Code の /voice、ChatGPT の音声入力、Laxis を含むほとんどの音声入力はクラウドで処理され、経由するベンダーが1社増えます。音声をマシン内にとどめる必要があるなら、VS Code Speech や Superwhisper のようなローカルモデルのツールが選択肢です。まずはセキュリティポリシーを確認してください。
専門用語や変数名を音声入力で正しく綴らせるにはどうすればいいですか?
精度を判断する前に、カスタム辞書に登録しましょう。Personal Dictionary を備えた Laxis を含め、ほとんどの音声入力ツールではライブラリ名、社内サービス名、チームメイトの名前を保存でき、エンジンが推測しなくなります。エディターに表示されている名前を読み取るツールもあります。大文字小文字の使い方が特殊な識別子は、タイプするかエージェントに補完させるほうが速いことが多いです。
音声入力ソフトはターミナルに入力できますか?
はい。システム全体で使える音声入力アプリの多くは、エディターやブラウザだけでなくターミナルにも入力できますが、ターミナルは貼り付けられたテキストを通常のテキストボックスとは違う方法で扱います。実際に使っているターミナルで長いプロンプトを試し、すべての単語が届くか確認してください。シェルコマンドを一字一句口述するのは避け、目的をエージェントに説明して、提案されたコマンドを確認しましょう。