音声の文字起こし:会議の録音をテキストにする方法
音声の文字起こしとは
音声の文字起こしとは、録音された話し言葉を書き言葉のテキストに変換することです。音声ファイルに音声認識モデルをかける方法と、人が聞きながら打ち込む方法があります。この記事を読んでいるなら、おそらくファイルはもう手元にあるはずです。昨日の顧客との通話、ボイスメモ、インタビュー、ダウンロードフォルダに眠っているウェビナーの録画。必要なのは、その中の言葉です。
これは「会議をうまく録音する」こととは別の問題です。録音はもう終わっていて、良くも悪くも結果は決まっています。今からマイクの位置を直すことはできません。まだコントロールできるのは、ツールに渡すファイル、複数の話者の扱い方、必要な精度、そしてどこまで手直しをするかです。この4つの判断で、同僚が読んでくれる文書になるか、誰も開かない文字の壁になるかが決まります。
文字起こしは議事メモでも要約でもありません。発言を一つずつ順に記録した、話された内容の完全な記録です。その中身については文字起こしに実際に何が含まれるかで詳しく説明しています。
うまく文字起こしできる音声ファイル、静かに失敗するファイル
ここでは2つのものが混同されがちです。目に見えるファイルの拡張子である「コンテナ」と、中の音声がどう符号化されているかを示す「コーデック」です。ほとんどのツールは両方を気にしますが、教えてくれるのは前者だけです。
| ファイル形式 | 通常使えるか | 注意点 |
|---|---|---|
.wav | 使える | 非圧縮で最も安全な入力。ファイルが大きく、長い会議はアップロード上限を超えることがある。 |
.mp3 | 使える | 中程度以上のビットレートなら問題なし。極端に低いビットレートでは子音がつぶれる。 |
.m4a / .aac | 使える | iPhoneのボイスメモや多くのAndroid録音アプリの標準形式。音質は良好。 |
.flac | たいてい使える | ロスレスでコンパクトだが、古いツールではデコードできないことがある。 |
.ogg / .opus | たいてい使える | WhatsAppやDiscordの書き出し形式。Opusは低ビットレートでもよく持ちこたえる。 |
.mp4 / .mov | たいてい使える | 動画のコンテナ。多くのツールは音声トラックを抽出するが、数GBをアップロードする前に確認を。 |
| DRM保護された音声 | 使えない | 権利管理されたファイルはデコードできない。保護のないコピーを入手するか、録り直す。 |
| 8 kHzの電話・留守番電話の音声 | 使えるが注意 | 文字起こしはできるが、精度は目に見えて落ちる。下記参照。 |
サンプリングレートは、思っている以上に効いてきます。音声モデルは16 kHzの音声を前提に作られていて、OpenAIのWhisperのドキュメントでも入力を16 kHzのモノラルにリサンプリングするよう定めています。44.1 kHzの録音をダウンサンプリングするのは問題ありません。しかし8 kHzの録音をアップサンプリングしても、最初から記録されていなかった情報は戻りません。電話音声の本当の問題はここにあります。電話の規格であるITU-T G.711は通過帯域をおよそ300〜3,400 Hzに制限しており、「s」と「f」と「th」を聞き分けるための高域の成分が切り落とされます。人間の耳は文脈でその穴を埋めますが、モデルは推測するしかなく、真っ先に外すのは名前と数字です。
もう一つのレバーはビットレートです。強く圧縮されたmp3は、認識モデルが必要とする細部を捨ててしまいます。元の音源が出せる最高品質で書き出し、再圧縮はしないこと。モノラルで問題ありませんし、片方のチャンネルがほぼ無音のステレオファイルより良いことも多いです。
ファイルの出どころも重要です。クラウド録画は通常、mp4と音声だけの別ファイルのセットで届き、アップロードするなら音声だけのほうが適しています。参加者ごとに音声トラックを分けて出せるプラットフォームもあり、話者の割り当てを良くするにはこれが一番の手です。プラットフォームの文字起こしにも独自のクセがあり、Zoomから文字起こしを取り出す方法は、生のファイルをアップロードする場合とは勝手が違います。
複数話者の音声と、話者ラベルに本当にできること
話者分離(スピーカーダイアライゼーション)は、1本の音声を「誰がいつ話したか」に切り分け、Speaker 1、Speaker 2のようにラベルを付ける工程です。言葉を生成する認識処理とは別に動くため、テキストは正確なのにラベルは大きく間違っている、ということが同時に起こりえます。
声がはっきり異なり、順番に話し、全員がマイクの近くにいるときはうまくいきます。最もうまくいくのは話者ごとにチャンネルが分かれている場合で、そのとき割り当ては推測ですらなくなります。崩れやすいのは次のような場面です。
- 発言のかぶり。 2人が同時に話しても、モデルは重なった部分をどちらか一方のラベルに割り当てなければなりません。声の小さいほうを丸ごと落とすツールもあります。
- 広い部屋に無指向性マイクが1本だけ。 硬い壁の反響で、同じ声がわずかな遅れを伴って何度もマイクに届きます。話者分離が頼りにする声の特徴がにじみ、マイクから遠い人ほどまとめられてしまいます。
- 短い相づち。 「うん」「そうですね」「なるほど」は短すぎて特徴をつかめず、前後で話していた人に吸収されます。
- 似た声。 声の高さが近く、同じなまりの2人は、しばしば1つのラベルにまとめられます。
- 人数推定のずれ。 多くのツールはその場の人数を推定します。少なく見積もれば同僚2人が1つのラベルを共有し、多く見積もれば席を移動した1人がSpeaker 3とSpeaker 5に分かれます。
期待値はそれに合わせて調整しましょう。3〜4人のクリアな録音なら、発言の区切りはおおむね正しい位置に落ち、Speaker 1を実名に対応させるのに数分かかる程度です。8人のスピーカーフォン録音なら、ラベルはヒント程度に考え、大事な場面(誰が日付を約束したか、誰が異議を唱えたか)は音声で確認してください。
精度:その数字が本当に意味するもの
標準的な指標は単語誤り率(WER)で、これを理解するとベンダーの精度の宣伝の読み方が変わります。WERは参照用の文字起こしと比べて、置換・削除・挿入の3種類の誤りを数え、その合計を参照側の単語数で割ったものです。NISTが音声認識のベンチマーク評価で使ってきた指標でもあり、「95%の精度」と言えば通常はWERが5%という意味です。
落とし穴は、WERがすべての誤りを同じ重さで扱うことです。「um」が抜けるのも「not」が抜けるのも同じ1回の削除ですが、文の意味を逆にするのは後者だけです。手間がかかる誤りは、まさに一番大事な言葉に集中します。名前、数字、製品用語、否定語です。
さらに、その数字がどこから来たかも問題です。公表されている精度はベンチマーク用のコーパスで測られたもので、あなたの会議室とはまるで違います。LibriSpeechはオーディオブックの朗読音声です。話し手は1人、台本があり、静かな部屋で、マイクは近い。Switchboardは見知らぬ人同士の電話での会話です。宣伝される精度はほぼ例外なくきれいな朗読音声での結果で、火曜日の朝会がオーディオブックのように聞こえる人はいません。
実際に精度を下げる要因を、ダメージの大きい順におおよそ並べるとこうなります。
- 発言の重なり。この分野で最も難しいケースです。
- 反響とマイクからの距離。多くの人が思っているより影響が大きい要因です。
- 低ビットレートや狭帯域の音声。理由は上のサンプリングレートの項のとおりです。
- モデルの学習データで手薄ななまりや方言。これは音声システムのよく知られた限界で、誤差の範囲ではありません。
- 業界用語、製品名、略語、名字。学習データにほとんど出てこない、価値の高い言葉です。
- 背景の雑音と文の途中での言語の切り替え。専用に作られたモデルでない限り、うまく扱えません。
2時間のファイルをかける前に、最初の3分だけを切り出して文字起こしし、読んでみてください。3分で大幅な手直しが必要なら、残りの117分にはそれに比例した手直しが必要になります。機械にかけて自分で直すのか、最初から人にお金を払うのかを決めるのは、そのタイミングです。
どんな文字起こしにも必要な仕上げ作業
どのツールから出てきたものでも、生の出力はデータの山であって文書ではありません。同僚が読める状態にするには意図的な仕上げが必要で、次の順番で進めると速く終わります。
- 最初に話者ラベルを実名に対応させる。 誰が話しているかが見えれば後の作業はすべて楽になり、「Speaker 2」の一括置換にはほとんど手間がかかりません。
- 固有名詞を直す。 文字起こしで最も予測しやすい誤りです。社名、製品名、チームが1日に40回口にする略語、通話相手の名字。エンジンは毎回同じ言葉を同じように間違えるので、たいていは1語につき1回の検索置換ですべて片づきます。さらに良いのは予防することです。カスタム語彙を使えば文字起こしの前に用語を登録でき、Laxisのミーティングアシスタントにある個人辞書(Personal Dictionary)はまさにそのための機能です。
- 逐語かクリーンかを決め、統一する。 逐語はフィラー、言い直し、繰り返しをすべて残す形式で、研究や争いになりうる記録に向いています。クリーンはそれらを取り除く形式で、読ませる文書にはこちらが必要です。ただし削りすぎは禁物です。ためらいも内容のうちです。「たぶん金曜までにはできると思います」と「金曜までにやります」は同じ約束ではありません。
- 段落を分け、句読点を整える。 話者が替わるたびではなく、話題が変わるところで区切ること。そうしないと、テンポの速いやり取りが40個の1行段落になってしまいます。
- セクションの区切りにタイムスタンプを入れる。 誰でも音声の該当箇所にすぐ戻れるようにします。
- 決定事項とアクションアイテムを、担当者付きで抜き出す。 実際に使われるのはこの部分です。
理屈ではなく手順を知りたい場合は、音声をテキストに変換する手順を一つずつ書き出してあります。
複数の言語が入った音声
録音が英語ではない、あるいは英語だけではない場合、すべてを決めるのは2つの問いです。ツールは言語を自動で判別できるか、そしてその言語をきちんとカバーしているか。対応状況はツールによって大きく違い、対応言語の一覧に載っていても英語と同じ精度で文字起こしできるとは限りません。学習データの分布が偏っているからです。
Laxisは100以上の言語に対応し、言語を自動で判別します。ライブの会議では話している最中に訳文を原文と並べて表示し、Businessプランでは1つの会議の中で最大5つの言語を自動で切り替えます。手元にあるファイルについては、正しい順番で進めてください。まず文字起こしを正確にし、翻訳はその後です。認識の誤りだらけの文字起こしを翻訳すると、どの誤りが原文のどこから来たのか誰にもたどれない訳文ができあがります。
かかる時間と費用
機械による文字起こしは録音時間のごく一部で終わります。1時間の音声ならたいてい数分で、ほかの処理の順番待ちがあればもう少しかかります。人による文字起こしは逆で、担当者は止めては巻き戻し、つづりを確かめながら実時間より遅いペースで作業します。だから納期は時間単位や日単位で見積もられ、料金は音声の分単位で決まります。特急はさらに高くなります。料金は一般的な相場ではなく、依頼先のベンダーから直接料金表をもらってください。納期、音質、話者の数で価格は大きく変わります。
ソフトウェアで引っかかるのは、たいてい料金ではなく1回あたりの録音時間の上限で、これは月間の分数とは別枠です。Laxisの場合は次のとおりです。Laxisはライブの会議を録音できるほか、音声ファイルのアップロードにも対応しています。
| プラン | 料金 | 内容 |
|---|---|---|
| Free | $0 | 月300分の文字起こし、1回の録音は45分まで |
| Premium | 1ユーザーあたり月$15.99、年払いなら$9.99 | 月2,000分の文字起こし、1回の録音は最長2時間 |
| Business | 1ユーザーあたり月$29.99、年払いなら$19.99 | 文字起こし時間は無制限、1回の録音は最長4時間、HubSpotとSalesforceとの同期付き |
つまずきやすいのは1回あたりの上限です。3時間の全社会議はFreeにもPremiumにも収まらないので、ファイルを分割するか上のプランに移るかになります。また、CRM同期はPremiumではなくBusinessにあります。通話を文字起こししてパイプラインに載せたいなら、ここは重要です。Laxisはデスクトップとモバイルで動き、Zoom、Google Meet、Microsoft Teamsに接続でき、参加者として目に見える形で加わらせたくない場合はボットなしで記録する方法も選べます。
特定のファイルの問題を解決するのではなく、ツールを比較しているなら、2026年のAI議事録ツール比較でこのカテゴリを並べて比べています。
人に頼むべきとき
ほとんどの音声には、ソフトウェアが適切な第一選択です。そうでない場合もあり、それを率直に知っておくほうが、痛い目にあってから気づくより安くつきます。
法的・公式な記録。 証言録取、裁判手続き、規制当局への提出書類など、証拠として提出される可能性のあるものは、一般に、正確性を証明できる有資格の文字起こし担当者による認証済みの記録が必要です。機械の出力は、どれだけ正確でも認証済みの記録にはなりません。
音質が悪く、しかも重要度が高い。 反響の強い部屋に遠いマイクが1本、しかも発言のかぶりが多い録音で、内容が本当に重要なら、あなたが手直しにかける時間のほうが文字起こし担当者に払う費用より高くつきます。選ぶ前に、手直しの量を正直に見積もってください。
なまりが強く、結果が重要な場合。 認識の品質はなまりや方言によってばらつきがあります。モデルが話者のなまりを苦手としていて、その文字起こしが引用されたり、頼りにされたり、本人に見せられたりするなら、人に頼んでください。
逐語の研究用文字起こし。 質的研究、言語学、一部の臨床の仕事では、ためらいや重なりや言い直しそのものがデータであり、ノイズではありません。逐語の表記規則は細かく決まっていて、機械はそれを適用しません。
規制対象の音声。 コンプライアンスの確認は、アップロードの後ではなく前に。LaxisはHIPAAに準拠しておらず、BAAも締結しないため、保護対象の医療情報を通すべきではありません。ほかのツールの約束はそれぞれ異なり、確実に知る唯一の方法はベンダーに書面で尋ねることです。
見落とされがちな中間の選択肢もあります。まず機械で文字起こしし、ゼロから起こすのではなく、その下書きの編集を人に依頼する方法です。多くのサービスが提供しており、すべて人手で起こすより安く済みます。
手元のファイルから始めよう
録音が今まさにデスクトップにあるなら、アップロードして最初の数分を読んでみてください。残りにどれだけ手間をかける価値があるかを決める前に、自分が何を相手にしているのかがわかります。Laxisの無料プランでは月300分の文字起こしができ、1回の録音は45分までです。整えられたデモファイルではなく、あなた自身の一番ひどい録音で試すには十分で、試している間に試用期間のカウントダウンが進むこともありません。Laxisのミーティングアシスタントで試して、私たちの音声ではなく、あなたの音声で判断してください。
よくある質問
音声の文字起こしとは何ですか?
音声の文字起こしとは、録音された話し言葉を書き言葉のテキストに変換することで、音声認識ソフトウェアか人間の文字起こし担当者が行います。入力はmp3、m4a、wavなどの音声ファイルで、出力はテキストです。通常は話者ラベルとタイムスタンプが付きます。要約ではありません。
どの音声ファイル形式を文字起こしできますか?
mp3、m4a、aac、wavは、ほぼすべての文字起こしツールで確実に使えます。flac、ogg、opusもたいてい使えます。mp4やmovなどの動画コンテナも、ツールが音声トラックを抽出するので通常は使えますが、非常に大きなファイルをアップロードする前には確認してください。DRMで保護された音声は文字起こしできません。
自動の文字起こしはどのくらい正確ですか?
精度は、どのツールを選ぶかよりも録音そのものに大きく左右されます。「99%の精度」といった数字は、1人がはっきり朗読した音声のベンチマークで測られたもので、会議室で測られたものではありません。発言の重なり、遠いマイク、反響の強い部屋、なじみのないなまり、専門用語の多さがあると結果は悪くなります。まず自分の音声の3分間で試してください。
文字起こしソフトは話者を区別できますか?
はい。話者分離によって、誰が話しているかで音声を区切り、発言にSpeaker 1、Speaker 2などのラベルを付けます。声がはっきり異なり、順番に話している場合は信頼できますが、発言のかぶり、似た声、広い部屋に無指向性マイクが1本だけという状況では当てになりません。ラベルを実名に対応させる作業は自分で行う必要があります。
すでに録音した音声ファイルを文字起こしできますか?
はい。Laxisは音声ファイルのアップロードに対応しているので、スマートフォンや会議プラットフォーム、専用の録音機で録った音声を、ライブの会議なしで文字起こしできます。無料プランは月300分の文字起こしで、1回の録音は45分までです。Premiumでは上限が2時間、Businessでは4時間になります。
ソフトウェアではなく人による文字起こしを使うべきなのはどんなときですか?
認証が必要な法的・公式な記録、ためらいや発言の重なりそのものがデータになる逐語の研究用文字起こし、そして音質が悪いうえに重要度が高く、手直しの時間が文字起こし担当者への費用を上回る場合は、人に頼んでください。実用的な中間策は、機械で文字起こしした下書きを人に編集してもらう方法です。