音声入力の精度はなぜこんなに悪いのか?原因と対策
音声入力の精度は、なぜこんなに悪いのでしょうか。(音声での文字入力と呼んでも、音声タイピングと呼んでも同じです。エンジンも問いも同じです。)主な理由は、音声認識が一本の鎖(マイク、部屋、声、語彙、モデル)になっていて、書き起こしの質はその中で最も弱い環で決まってしまうことにあります。「their」と言ったのに「there」と出る(英語では発音が同じで意味の違う二語です)。上司の名字を言ったら野菜の名前になった。考えるために黙ったら、言ってもいない文が現れた。
それぞれ原因も対策も違います。以下では症状、原因、対策の順に見ていき、最後に音声入力はAIに当たるのかという問いに率直に答えます。ツール選びが目的なら、まずは音声入力ソフトの比較記事からどうぞ。
音声入力が失敗する理由は、数えるほどしかなく予測もつく
音声入力が単語を間違えるのは、音声が不明瞭なとき、モデルが学習でほとんど出会わなかった単語のとき、そして似た発音の単語から選ぶための文脈が足りないときです。不満の大半はこの三つのどれかにさかのぼり、たいていは症状を見ればどれなのかが分かります。
| 起きていること | 考えられる原因 | まず試すこと |
|---|---|---|
| ランダムに単語を間違え、部屋によってはさらに悪い | マイクが遠すぎる、または部屋の反響や騒音 | マイクを口から手のひら一枚分の距離に近づける。どのマイクが選ばれているか確認する |
| 机では問題ないのに、屋外ではまるで駄目 | 風や車の音がスマホのマイクに直接当たっている | スマホを手で覆うか、マイク付きのイヤホンを使う |
| 人名、ブランド名、略語がいつも間違う | モデルがほとんど見たことのない単語 | カスタム辞書を使うか、音声で訂正する |
| 「their」が「there」に、「to」が「two」になる | 同じ発音の語は文脈で決まる | フレーズ単位でまとめて話す。こうした語を意識して校正する |
| 最初の一、二語が抜ける | 聞き取りが始まる前に話し始めている | 聞き取り開始の合図を待つ |
| 長い間のあとに、言っていないフレーズが出る | モデルが沈黙を埋めている | 考えている間はマイクを止める |
| 意味不明な文字列になる、または別の言語になる | 音声入力の言語や地域の設定違い | 言語と、最も近い地域のバリエーションを設定する |
| 急に悪くなった | 鎖のどこかが変わった | さかのぼって確認:新しいイヤホン、アップデート、新しいキーボード、オフライン言語パック |
モデルよりもマイクが大事
音声入力の精度が悪いとき、最初に疑うべきは音声の質です。口から離れたマイクは、あなたの声とほぼ同じ大きさで部屋の音を録ってしまいます。はっきり届かなかった単語は、どんなモデルにも復元できません。ノートパソコンのマイクはファンやキーボードのすぐ隣にあります。人通りの多い通りで腕を伸ばしてスマホを持てば、録れているのはほとんど通りの音です。
ヘッドセットなら自動的に良くなるわけでもありません。多くの Bluetooth イヤホンはマイクが有効な間、音質の低い通話モードに切り替わるため、安い有線イヤホンが高価なワイヤレスに勝つこともあります。それから、パソコンが何を聞いているかも確認してください。Mac の音声入力、Windows の音声入力、Word の Dictate(ディクテーション)はいずれもマイクを選べますし、部屋の反対側にあるウェブカメラのマイクがいつの間にか既定になっていることもあります。
ベンダー各社も同じ意見です。Microsoft は Word の Dictate のトラブルシューティングで、ヘッドセットか外付けマイクの使用と、背景ノイズを減らすことを勧めています。Google の音声入力ヘルプも、静かな場所に移動して外付けマイクを接続するよう案内しています。
ソフトに聞こえている音を聞く: いつも音声入力をしているまさにその場所で、スマホのボイスメモアプリを使って二十秒録音し、ヘッドホンで再生してみてください。食洗機や換気扇、自分のキーボードの音が聞こえるなら、認識エンジンにも聞こえています。アプリを変えるより、マイクを動かすほうがずっと効果があります。
話し方で、聞こえ方が変わる
話し方が精度に影響するのは、認識エンジンが主に自然で流暢な話し言葉から学んでいるからです。語尾が消えていったり、文末を飲み込んだり、一語ずつゆっくり区切って話したりすると、モデルが手がかりにできる情報が減ります。Microsoft は「より丁寧に話す」よう助言していますが、それは丁寧さが「ゆっくり」ではなく「文を最後まで言い切る」ことを指す場合に当てはまります。文を頭の中で組み立ててから、ひと息で言いましょう。
長い間には、もっと奇妙なリスクもあります。2024年の「Careless Whisper」と題する研究で、Allison Koenecke 氏らは、OpenAI の Whisper による書き起こしのおよそ1%に、音声に含まれていないフレーズや文がまるごと入っていたこと、そしてこうしたハルシネーションが、沈黙の長い話者で不釣り合いに多く起きていたことを明らかにしました。ほとんどの音声入力ツールはまさにこのモデルで作られているわけではありませんが、教訓は同じように当てはまります。
考えるときはマイクを切る: 次の文を思いつくのに数秒以上かかりそうなら、音声入力をいったん止めて考え、文全体が固まってから再開しましょう。中途半端なフレーズが減り、エンジンが長い沈黙を埋める場面もなくなります。
人名、専門用語、同音異義語には、エンジンにない文脈が要る
音声入力が人名や専門用語に弱いのは、認識エンジンが学習でよく出会った単語に寄っていくからです。また「their」と「there」のような同じ発音の英単語を選び分けるには文脈が必要なのに、それが欠けていることがよくあります。スマホのキーボードが聞いているのは、切り離された一文だけです。あなたが Aoife さんに Q3 の契約更新について返信していることなど知らないので、その音に合う最もありふれた単語に手を伸ばします。
珍しい単語については、自分の語彙をツールに渡しましょう。専用の AI 音声入力アプリにはカスタム辞書があり、Laxis Voice Keyboard ではそれを Personal Dictionary と呼んで、人名、略語、専門用語を登録できます。OS 標準の音声入力にはたいていこの機能がないので、その場で直します。Mac では青い下線の付いた単語をクリックすると候補が表示され、iPhone では「change」と言ってから正しい綴りを一文字ずつ言えば直せます。Pixel では聞き間違えた単語をタップします。Google によれば、Pixel の高度な音声入力は、あなたが訂正した単語から精度が上がっていくそうです。
同音異義語には別の習慣が必要です。フレーズが長いほど、モデルの言語側が使える手がかりが増えるので、「their」だけを単独で言うより「send it to their office」と言うほうがうまく認識されます。そのうえで、同音異義語、数字、否定語を狙って校正しましょう。単語を一つ間違えるだけで意味がひっくり返る三つの急所です。
アクセントや方言への対応にはばらつきがある
一部のアクセントや方言では、音声入力の精度が測定できるほど低くなります。多くのエンジンの学習データが、特定の話し方に偏っているためです。最もよく知られた証拠は、Allison Koenecke 氏が率いた2020年のスタンフォード大学の研究(PNAS 掲載)です。2019年にテストされた Amazon、Apple、Google、IBM、Microsoft のシステムは、黒人話者の単語の平均35%を誤認識したのに対し、白人話者では19%でした。その後エンジンは改善されていますが、この差が解消されたことを示した人はいません。
自分の話し方に最も近い地域のバリエーションを選ぶと効果があり、費用もかかりません。詳しくは訛りがある場合や二か国語で音声入力する場合のガイドで掘り下げています。
スマホのキーボードは小さなモデル、クラウドは大きなモデル
スマホの音声入力はたいてい端末上で動いており、音声モデルはスマホのメモリとバッテリーの制約に収まらなければなりません。一方、クラウドサービスははるかに大きなモデルを動かせます。Apple によれば、iPhone の音声入力は多くの言語で端末上で処理され、インターネット接続は不要です。Google によれば、Pixel の高度な音声入力は、Fix it のような機能を使わない限り、話した内容をスマホの中にとどめます。対照的に、Windows の音声入力は Microsoft の Azure Speech サービスによるオンライン認識を使っています。
オンデバイスだから劣るというわけではありません。プライバシーが守られ、飛行機の中でも使え、スマホメーカーは結果を整えるためのローカル言語モデルを加え始めています。iOS 27 では、Apple が iPhone 17 Pro、iPhone Air 以降のモデルでそうした言語モデルを使い、英語の綴り、句読点、大文字の使い方を改善しています。とはいえトレードオフであることに変わりはなく、同じ文がスマホとノートパソコンで違う結果になる理由の一つでもあります。プライバシーの面は、オンデバイスとクラウドの文字起こしの解説記事で扱っています。
音声入力がだんだん悪くなっている気がするなら、技術そのものが後退したわけではないでしょう。新しいイヤホン、既定のキーボードの変更、OS のアップデート、オフライン言語パックなど、あなたの鎖のどこかが変わったのです。静かな部屋でマイクに近づいて試し直し、問題が音声についてくるのか、ソフトについてくるのかを確かめてください。
音声入力はAIなのか?
機械学習という意味では、音声入力はAIです。現代の音声認識エンジンは、大量の録音音声とその書き起こしを組にして訓練されたニューラルネットワークであり、人が手で書いたルールの集まりではありません。ですから、答えはイエスです。Alec Radford 氏らによる2022年の論文で説明された OpenAI の Whisper は、ウェブから集めた680,000時間の音声で訓練されました。今日の主流の音声入力エンジンは、どれもこの方法で作られています。
ここまで見てきた挙動の多くは、これで説明がつきます。モデルは学習した内容をもとに、聞こえた音に対して最もありそうな単語を予測します。だからありふれた話し方には強く、珍しい名前や学習データに少ない声には弱いのです。自信満々に間違えることもあれば、ときには誰も言っていない言葉を生み出すこともあります。認識エンジンの仕組みについては、音声テキスト変換の解説でさらに詳しく説明しています。
ただし、音声入力があなたの代わりに文章を書いてくれるという意味ではありません。基本的な音声入力は書き起こすだけで、チャットボットという意味での生成AIではありません。とはいえ、この境界線はあいまいになりつつあります。多くのツールが、言語モデルであなたの言葉を編集する第二のステップを加えているからです。Windows の Fluid dictation、Pixel の Fix it、Apple の iOS 27 のモデル、Laxis の Verbal Cleanup は、どれもその一種です。学校や勤務先のポリシーが「AI」を制限しているなら、それが書き起こしを指すのか書き換えを指すのかを確認し、どの追加機能がオンになっているかをチェックしましょう。
OS 標準の音声入力で十分なとき
静かな部屋での短いメッセージ、検索、ちょっとしたメモなら、OS 標準の音声入力で十分ですし、無料です。まずはマイク、言語設定、間の取り方を直しましょう。それでも残る問題が主に人名、フィラー(「えー」「あの」のような言葉)、まとまりのない長文なら、AI 音声入力アプリを使う価値があります。
Laxis Voice Keyboard はパソコンとスマホのアプリをまたいで使え、フィラーや繰り返しを取り除き、句読点を付け、人名には Personal Dictionary を使います。制約もあります。クラウド専用なので接続が必要で、音声は端末の外に出ます。また無料プランでは、音声入力と会議が月300分の共通枠を分け合います。14日間の Premium トライアルはクレジットカード不要なので、自分がいちばん困っている誤りで試してみてください。
よくある質問
iPhone の音声入力はなぜこんなに精度が悪いのですか?
iPhone の音声入力が間違えるのは、たいていマイクとの距離、背景ノイズ、あるいは学習したことのない人名や専門用語のせいで、iPhone 固有の欠陥ではありません。スマホを口に近づけ、まとまったフレーズで話し、難しい名前は一文字ずつ綴りを言いましょう。iPhone 12 以降で米国英語を使っている場合は、「change」と言って、聞き間違えた単語を音声で直すこともできます。
音声入力の精度がだんだん悪くなるのはなぜですか?
音声入力が悪くなったように感じるのは、たいてい技術が後退したからではなく、環境のどこかが変わったからです。よくある原因は、新しい Bluetooth イヤホン、既定のマイクの変更、OS のアップデート、新しいキーボードアプリ、オフライン言語パックです。静かな部屋でマイクを近づけて試し直し、問題が音声についてくるのか、ソフトについてくるのかを確かめてください。
音声入力はAIですか?
はい。現代の音声入力は機械学習を使っています。大量の録音音声とそれに対応する書き起こしで訓練されたニューラルネットワークが、聞こえた音に対して最もありそうな単語を予測するのです。たとえば OpenAI の Whisper は680,000時間の音声で訓練されました。素の音声入力は文章を書くのではなく書き起こすだけですが、今では多くのツールが、テキストを整えたり書き換えたりする AI のステップを加えています。
音声認識は生成AIですか?
基本的な音声認識は、チャットボットという意味での生成AIではありません。新しいコンテンツを作るのではなく、話した内容を書き起こすからです。ただ、境界はあいまいになりつつあります。認識エンジンはテキストを一語ずつ出力し、誰も言っていないフレーズをときどき挿入することがありますし、多くの音声入力ツールはあなたの言葉を書き換える言語モデルを加えています。ポリシーで生成AIが制限されている場合は、どの機能がオンになっているか確認しましょう。
音声入力の精度を上げるにはどうすればいいですか?
マイクを口に近づけ、背景ノイズを減らし、普通の速さでまとまったフレーズを話し、正しい言語と地域のバリエーションを選びます。次に、ツールに自分の語彙を覚えさせましょう。カスタム辞書があれば活用します。これでほとんどの誤りは直ります。それでも人名やフィラーが問題なら、専用の AI 音声入力アプリを試してみてください。
音声入力が人名を間違えるのはなぜですか?
音声入力が人名を間違えるのは、認識エンジンが学習でよく見た単語を好む一方で、名字やブランド名、略語の多くはめったに出てこないからです。文脈がなければ、エンジンは最も近いありふれた単語で置き換えます。カスタム辞書のあるツールなら名前を登録すれば直ります。OS 標準の音声入力にはたいていこの機能がありませんが、iPhone と新しめの Pixel なら、名前を一文字ずつ綴れば通じます。