インサイトに戻る
ベストプラクティス•2026-10-07•約9分 読了

通話の文字起こし:電話の会話をテキスト化する方法

通話の文字起こし:電話の会話をテキスト化する方法
TL
Team Laxis
Laxisチーム @ Laxis

ウェビナーの録画を最新の文字起こしツールにかければ、結果はほぼ完璧です。ところが先週火曜日の営業電話を同じツールにかけると、名字の半分は間違い、金額はずれ、途中のどこかで二人の話者がどうやら一人になっています。同じソフト、同じ話し手なのに、結果はまるで違う。そしてその理由は、モデルとはほとんど関係がありません。

通話の文字起こしは、普通の文字起こしの一分野として扱われがちです。実際には、別の専門分野に近いものです。会話がマイクに直接入るのではなく電話回線を通った瞬間に、音質、話者分離、ファイルの置き場所について当たり前だと思っていたことが、すべて変わります。音声をテキストに変える一般的な仕組みについては、文字起こしが実際にどう機能するかを別の記事で解説しました。この記事で扱うのは、電話が壊してしまう部分です。

なぜ電話は会議より難しいのか

まず、ネットワークが何を捨てているかから見ていきましょう。従来の電話は狭帯域です。音声は 8 kHz でサンプリングされ、つまりおよそ 3.4 kHz を超える成分は、録音機に届く前にすべて捨てられます。この帯域は飾りではありません。英語でいえば s と f の違いが宿り、th と v を分け、歯擦音が fifteen と fifty を聞き分けるだけの情報を運ぶのが、この帯域です。16 kHz でサンプリングされた広帯域音声はそれを保持します。電話回線は保持しません。

現代の音声認識システムは圧倒的に広帯域音声で学習されており、8 kHz の入力を与えると、ほとんどはまずアップサンプリングします。アップサンプリングはファイルの形式を合わせてくれます。しかし、取り除かれたものを元に戻すことはしません。再構成された周波数には何の情報もありません。もともと存在しなかったからです。

その影響は数字に表れ、だからこそ公開ベンチマークは一貫して誤解を招きます。サンプリングレート以外は何も変えない対照研究では、狭帯域音声というだけで精度が落ちることが分かっています。実際の通話ではさらに、コーデックによる圧縮、モバイルネットワーク、クロストーク、背景ノイズが上乗せされ、本番運用のコールセンター音声のエラー率は、リーダーボードの数字の数倍になるとよく報告されています。ベンダーのベンチマークはほぼ例外なくクリーンな広帯域の録音で測られているので、電話音声にとって公称の精度は「上限」であって「予測」ではないと考えてください。

圧縮はさらに別の層を加えます。今も電話網の主力コーデックである G.711 は、設計からして狭帯域です。G.722、Opus、EVS は広帯域かそれ以上の音声を運び、音もはっきり良くなりますが、効果があるのは通話のすべての区間が対応している場合だけです。参加者が一人でも携帯電話からかけてくれば、会話全体がいちばん低い水準まで引き下げられます。ネットワークが、両端が理解できる形式へトランスコードしなければならないからです。

30秒でできる診断法。録音した通話を任意の音声編集ソフトで開き、周波数表示(スペクトラム表示)に切り替えます。エネルギーが 3.4 kHz あたりでぷつりと途切れて平らな線になっているなら、扱っているのは狭帯域の音声で、文字起こしベンダーをいくら乗り換えても直りません。直るのは、通話の運び方を変えたときです。携帯の回線の代わりに VoIP の回線を、スピーカーフォンの代わりにヘッドセットを使うことです。

1チャンネルか2チャンネルか、そしてそれがすべてを決める理由

通話音声と会議音声を分ける二つ目の要素は、最終的に何本のトラックが手元に残るかです。これは多くの購入者が思っている以上に重要です。

通話には二つの区間(レッグ)があります。録音がそれを別々に捉えていれば――発信者が左チャンネル、オペレーターが右チャンネル――話者分離はもはや機械学習の問題ではありません。ファイルについての事実です。チャンネル1の単語はすべて一人のもの、チャンネル2の単語はすべてもう一人のもので、二人が同時に話していても、文字起こしには正しくラベルが付きます。

その二つの区間を1本のモノラルトラックにミックスすれば、その確実性を捨てたことになります。そうなるとソフトウェアは、声の高さ、音色、タイミングを頼りに、声だけで話者を見分けなければなりません。クリーンな広帯域音声なら、それなりにうまくいきます。声と声を区別するまさにその周波数が取り除かれた狭帯域の電話回線では、かなり精度が落ちます。しかも電話の会話には、それを破綻させる状況がまさに満ちています。視覚的な手がかりがないため、人は対面のときよりはるかに頻繁に相手の話に割り込むからです。

コンタクトセンターのプラットフォームが何年も前からデフォルトでデュアルチャンネル録音をしているのは、まさにこの理由からです。一方で、多くのビジネスフォンシステムや、ほとんどの一般向け録音アプリは、いまだにミックスされた1本のファイルを渡してきます。文字起こしツールが自社の通話に弱いと結論づける前に、どちらを渡しているのかを確認してください。

PSTN、VoIP、そしてチェーンの中で最も弱いリンク

ビジネス通話を運ぶ経路は三つあり、それぞれ録音の品質が異なります。

PSTNと携帯電話は旧来の経路です。狭帯域で、それは例外なくそうであり、携帯はさらに独自の圧縮を上乗せします。これが最低ラインです。VoIP はずっと良くなり得ます。Opus や G.722 を使ったソフトフォン同士の通話は本物の広帯域だからです。ただしそれが成り立つのは、両方の端末と、その間のすべての中継点が広帯域コーデックでネゴシエーションした場合だけです。混在した通話は品質が落ちます。Zoom、Google Meet、Microsoft Teams のような会議プラットフォームは、全員がアプリから参加していればエンドツーエンドで広帯域です。会議の文字起こしが通話の文字起こしよりはるかに読みやすい本当の理由は、ここにあります。

最後の点には実務上の意味があります。6人がノートPCで、1人がダイヤルイン番号で参加する Teams 会議は、単に聞き取りにくい話者が一人いるだけの会議にはなりません。多くの場合、ダイヤルインの参加者だけが他の全員より明らかに不正確に文字起こしされ、その人が誰かと話がかぶったときの発言はおそらく失われる、という会議になります。ある関係者がいつも電話で参加するなら、その記録に頼る前に知っておく価値があります。

通話を文字起こしする5つの方法

ここに唯一の正解はなく、あるのはトレードオフだけです。どれが適切かは、今四半期どのエンジンがわずかに正確かよりも、文字起こしが最終的にどこにたどり着く必要があるかに大きく左右されます。

方法電話音声での精度コスト構造文字起こしの行き先向いているケース
電話システムや CRM 内蔵の通話機能まずまず。たいていモノラルで、自社の語彙に合わせた調整はほぼないシートに含まれるが、条件付き。HubSpot が文字起こしするのは Sales Hub または Service Hub の Professional か Enterprise のシートでかけた通話のみ。Starter はアカウントあたり月500分の通話時間を含み、無料アカウントはほとんど、あるいはまったく使えない連絡先や取引のレコードに自動で記録営業担当がすでに CRM の中から発信している
電話・CPaaS の API上限は最も高い。エンジンを自分で選べ、デュアルチャンネルも指定できる従量課金で積み上がる。たとえば Twilio は文字起こしを分単位で課金し、録音と通話そのものは別項目で請求されるコードを書いて置いた場所エンジニアがいて、要件が特殊
会議アシスタントアプリ経由の通話には強く、ダイヤルイン区間には弱いユーザーあたり月額、無料枠つきのことが多い自前のワークスペース、対応していれば CRM 同期も通話の大半が Zoom、Meet、Teams 上
コンタクトセンタースイート電話音声ではトップクラス。デフォルトでデュアルチャンネル、狭帯域向けに調整済み重い。Five9 の音声ティアは同時接続ユーザーあたり月約$159、最低50シート。Genesys Cloud CX 4 の定価は$240プラットフォーム内。通話中はライブのエージェントアシストつき会議ではなく、通話の量をさばいている
人手またはハイブリッドのサービス本当に音質の悪い音声では最も高い1通話あたり最も高く、納品も最も遅い納品されたファイルを自分で振り分ける裁判所や規制当局がその通話を読むことになる

価格は2026年時点で公開されている定価です。特にコンタクトセンターの契約は、ボリュームがあれば定価を大きく下回る価格で交渉されるのが普通です。

ほとんどのチームは「精度」の列について考えすぎ、「文字起こしの行き先」の列について考えなさすぎています。コンタクトセンタースイートは電話音声に対する技術的に正しい答えですが、週に4回の初回ヒアリング商談を Google Meet で行う12人の会社にとっては間違った買い物です。そうした形のチームでは、会議アシスタントという経路が、コストの面でも、本当に重要な点、つまり成果物が CRM に届くかどうかという点でも、たいてい勝ちます。Laxis の AI 会議アシスタントのようなツールはこの領域にあり、Zoom、Google Meet、Microsoft Teams をまたいで記録し、他の場所で録音した通話の MP3、WAV、M4A ファイルのアップロードを受け付け、Business プランでは要約とアクションアイテムを HubSpot や Salesforce に送ります。正直な注意点は、この種類のすべてのツールに当てはまるものと同じです。会議と会話を中心に作られていて、コンタクトセンターの通話量を前提にはしていないので、1日に4,000件の通話を文字起こしするなら、そのために設計されたプラットフォームを買ってください。探しているのがこの種類なら、議事録ツールのより詳しいまとめもあります。

リアルタイムか、全員が電話を切った後か

リアルタイムの文字起こしと通話後の文字起こしは、同じ機能に見えて、振る舞いはまるで違います。

ストリーミング文字起こしは、言葉が話されてから1〜2秒以内にテキストを返します。これがあるからこそ、ライブのエージェントアシスト、コンプライアンスアラート、画面上の翻訳が可能になります。代償は精度です。ストリーミングのシステムは、文の終わりを聞く前に推測を確定させなければなりません。音声が届くにつれて前の単語を修正はしますが、完全な文脈という贅沢は決して得られません。通話後の処理はそれを得られます。録音全体を手にしていて、前後どちらも見渡せるので、一般に精度が高く、1分あたりのコストも安くなります。

役に立つ考え方は、これを二者択一として扱うのをやめることです。ライブの出力は、通話中に起こらなければならないことのためのもの。通話後の出力は、記録、要約、CRM への入力、そして後で誰かが読むあらゆるもののためのものです。両方に対応するプラットフォームは多く、同じ通話から粗いライブフィードとクリーンな最終版の文字起こしの両方を作れない理由はありません。

ベンダーを乗り換えるより効く、安上がりな改善が二つ。自社の製品名、競合の名前、SKU の形式、そして営業担当がよく言い間違える名字をカスタム語彙に登録しましょう。固有名詞は電話の文字起こしが最も目に見えて失敗する部分で、手助けなしにそれを当てられるモデルはありません。次に、全員にヘッドセットを使ってもらいましょう。壁の硬い部屋でのスピーカーフォンはエコーを加え、エコーはどんな訛りよりも速く話者分離を混乱させます。

結局それだけの価値があったかを決める部分

通話文字起こしソフトについては、居心地の悪い真実があります。誰もが評価するのは精度ですが、購入が元を取れるかどうかを決めるのはワークフローです。

誰も開かないツールの中に置かれた文字起こしには、何の価値もありません。正しい連絡先、正しい商談に紐づき、そのアカウントの他の履歴と並んで検索できる文字起こしは、案件の進め方を変えます。この二つの結果の差は配管の問題で、エンジンを比べる前に答えを出しておく価値があります。

違いを生むのは三つです。文字起こしは、ただ保存されるのではなくレコードに紐づいていなければなりません。連絡先、会社、進行中の取引が、電話番号やカレンダーの招待から自動的に特定される形で、です。また、読める形にまで凝縮されていなければなりません。反論を探すために40分の逐語記録をスクロールする人はいないからです。実際に使われるのは、要約と、担当者名の付いた約束事のリストです。そして、人の手を介さずに届く必要があります。営業担当が何かを貼り付けるのを覚えていることに依存するワークフローは、3週目には静かに機能しなくなるからです。

最後の要件こそ、ほとんどの構成がつまずく点であり、CRM 内蔵の通話機能や CRM と同期するアシスタントが精度スコア以上の働きをする理由でもあります。たとえば Laxis は担当者付きのアクションアイテムを抽出し、Business プランでは、誰も文字起こしを開かなくても結果を HubSpot や Salesforce に同期します。処理はお使いのデバイス上ではなくクラウドで行われるので、導入を決める前に自社のポリシーと照らし合わせて確認しておく価値があります。

何を期待すべきか、そして安く確かめる方法

公表された精度の数字で買わないでください。実際の録音を5本用意しましょう。回線の悪いもの、訛りの強いもの、先方の購買担当があなたの AE(アカウントエグゼクティブ)の話にかぶせてくるもの。それを候補のツールすべてにかけます。数えるのは、実際に損失につながる誤りです。数字の間違い、名前の間違い、誰が何に同意したかの取り違え。フィラー語の誤字はノイズにすぎません。

それに応じて期待値を設定しましょう。二人ともヘッドセットを使ったクリーンな VoIP 通話なら、良いシステムは会議音声と同じ水準に達します。道路の騒音が入り、モデルがあまり聞いたことのない訛りのある携帯通話では、文字起こしは内容を思い出すのには使えても、引用には信頼できません。同じベンダーの同じ日に両方が起こり得ます。だからこそベンダーは、一つの数字を本気で約束することができないのです。

一つ、省略できないことがあります。これを動かす前に、同意をきちんと取ることです。ルールは法域によって異なり、罰則は机上の話ではありません。通話を録音する方法のガイドでは、実際の手順と同意のルールを、全当事者の同意を求める米国の州も含めて解説しています。

ここから言えること

通話の文字起こしにおける興味深い変化は、モデルが良くなったことではありません。実際に良くなりはしましたが。ボトルネックが移動したことです。過去10年の大半、難しいのは言葉を正しく拾うことでした。今難しいのは、電話網が何十年も捨て続けてきた周波数帯と、録音をどう捉えるかについての一連の判断です。1チャンネルか2チャンネルか、アプリかダイヤルインか、広帯域か、それともネットワークがネゴシエーションできた何かか。こうした選択は電話システムを設定する人が行い、たいていは誰も文字起こしのことに触れません。

つまりこれは、手に入る最も安い改善策が購入ではないという、めずらしい状況です。それは、自社の電話システムを管理している人との会話です。聞くべき質問は二つ。両方の区間を別々に録音できるか。より多くの通話を広帯域の経路に乗せられるか。この二つに答えが出れば、まともなエンジンならほぼどれでも十分に機能します。

よくある質問

通話の文字起こしとは何ですか?

通話の文字起こしとは、電話や VoIP の会話を検索可能なテキストに変換することで、通常は話者ごとにラベルを付け、各行にタイムスタンプを付けます。普通の音声ファイルの文字起こしとは、重要な一点で異なります。音声が圧縮された電話チャネルを通ってきており、1本のミックス録音として届くことも、2つの別々の区間として届くこともある、という点です。

電話音声での通話の文字起こしの精度はどのくらいですか?

ベンダーが公表する数字よりも、目に見えて低い精度を想定してください。それらの数字はクリーンな広帯域の録音から得られたものだからです。狭帯域音声はそれだけで精度を落とし、実際の通話ではさらに圧縮、クロストーク、ノイズが加わるため、電話音声のエラー率は公称値の数倍に達することがあります。2チャンネル録音とカスタム語彙で、その多くを取り戻せます。

電話を自動で文字起こしできますか?

できます。ほとんどのビジネスフォンシステム、通話機能を内蔵した CRM、コンタクトセンタープラットフォームは、録音をオンにすれば自動で文字起こしします。電話 API を使って開発すれば、テキストをリアルタイムでストリーミングして返すこともできます。実際の制約はたいてい技術ではなくライセンスです。多くのプランが、文字起こしを有料のシート階層や月間の分数枠の向こう側に置いているからです。

営業電話を文字起こしする最善の方法は何ですか?

誰も何もコピーすることなく、文字起こしを正しい CRM レコードに届ける経路を選んでください。実際には、CRM へのログ記録を内蔵したダイヤラーか、Zoom、Google Meet、Teams で行う通話であれば HubSpot や Salesforce と同期する会議アシスタントのどちらかになります。生の精度は、営業担当がそれを実際に開くかどうかほど重要ではありません。

通話の文字起こしはリアルタイムでできますか?

できます。ただし、リアルタイムの文字起こしと通話後の文字起こしは、事実上別の製品です。ストリーミングのシステムは1〜2秒以内にテキストを返し、音声が届くにつれて前の単語を修正しますが、次に何が来るかが見えないため、精度に上限があります。通話後の処理は録音全体を使えるので、通常は精度が高く、コストも安く済みます。

通話の文字起こしはどこに保存すべきですか?

それを必要とする人がすでに仕事をしている場所です。営業などの収益部門にとっては CRM であり、別のツールに置いておくのではなく、連絡先と進行中の商談に紐づけておくことです。規制の厳しい業界のチームは、その上に保存期間とアクセス制御を重ねます。フォローアップを書いているときに誰も見つけられない文字起こしは、お金を節約したのではなく、お金を使っただけです。