返回洞察
最佳实践•2026-01-28•约 11 分钟 阅读

音频转写:把会议录音变成文字

音频转写:把会议录音变成文字
LY
Laura Yang
联合创始人 @ Laxis

什么是音频转写

音频转写是把录下来的语音转换成文字的过程:要么用语音识别模型处理音频文件,要么由人边听边打出来。你读到这里,多半手里已经有了文件:昨天的客户电话、一段语音备忘录、一次访谈,或者躺在下载文件夹里的网络研讨会录像。现在你需要的是其中的文字。

这和“把会议录好”是两回事。录音已经发生了,好坏都已定型,你没法回去挪麦克风。你还能掌控的是:喂给工具的是什么文件、多人说话怎么处理、需要多高的准确率,以及打算花多少功夫清理。这四个决定,决定了你最后拿到的是同事愿意读的文字,还是一堵没人会打开的文字墙。

转写稿既不是会议纪要,也不是摘要:它是逐轮完整记录下来的原话。想了解一份转写稿由哪些部分构成,可以看看转写稿到底包含什么。

哪些音频文件转写效果好,哪些会悄悄出问题

这里有两样东西常被混为一谈:一是容器,也就是你看到的文件扩展名;二是编码,也就是里面的音频是怎么编码的。大多数工具两者都在意,却只告诉你第一样。

文件类型通常能否使用需要注意什么
.wav可以未压缩,最稳妥的输入。文件大,长会议可能超出上传上限。
.mp3可以中等及以上码率没问题。码率很低时辅音会糊在一起。
.m4a / .aac可以iPhone 语音备忘录和大多数安卓录音应用的默认格式,音质不错。
.flac通常可以无损且体积小,但一些老工具解不了码。
.ogg / .opus通常可以WhatsApp 和 Discord 的导出格式。Opus 在低码率下依然表现稳定。
.mp4 / .mov通常可以视频容器。大多数工具会提取音轨;上传几个 GB 之前先确认一下。
受 DRM 保护的音频不行有版权保护的文件无法解码。换一份未加保护的副本,或者重新录。
8 kHz 电话或语音信箱音频可以,但能转写,但准确率明显更差。见下文。

采样率的影响比人们想的更大。语音模型是围绕 16 kHz 音频构建的;OpenAI 的 Whisper 文档明确规定,输入要重采样为 16 kHz 单声道。44.1 kHz 的录音降采样没有问题;而 8 kHz 的录音无法通过升采样找回当初就没录下来的细节。这才是电话音频的真正问题:ITU-T G.711 电话标准把通带限制在大约 300 到 3,400 Hz,切掉了区分 "s"、"f" 和 "th" 的高频能量。人耳会根据上下文补上这个缺口;模型只能猜,而最先猜错的就是人名和数字。

码率是另一个杠杆。压缩得很厉害的 mp3 会丢掉识别模型需要的细节。按音源能提供的最高质量导出,不要二次压缩。单声道没问题,往往比一个声道几乎静音的立体声文件还好。

文件的来源同样重要。云端录制通常会给你一个 mp4 外加一个单独的纯音频文件,上传纯音频的那个更好。有些平台还提供按参会者分开的音轨,这是改善说话人归属最有效的一招。平台自带的转写稿也有各自的怪癖,从 Zoom 获取转写稿和上传原始文件的做法并不一样。

多人音频,以及说话人标签到底能做到什么

说话人分离(speaker diarization)是把一条音频流切分成“谁在什么时候说话”的步骤,然后给各段话打上 Speaker 1、Speaker 2 这样的标签。它和生成文字的识别步骤是分开运行的,所以一份转写稿可能文字准确,标签却错得离谱。

当声音区分明显、大家轮流发言、每个人都离麦克风很近时,它表现不错。每个说话人各占一个声道时效果最好,因为那时归属根本不需要推断。它会在这些地方出问题:

  • 抢话。 两个人同时说话时,模型仍然得把重叠的那一段归给某一个标签。有些工具会直接丢掉声音较小的那个人。
  • 大房间里只有一个全向麦克风。 硬墙面的混响会让同一个声音稍有延迟地多次到达麦克风,模糊了说话人分离所依赖的声学特征,离麦克风最远的几个人会被合并成一个。
  • 简短插话。 “嗯”“对”“是的”太短,无法刻画,会被并入前后正在说话的人。
  • 声音相近。 两个音高接近、口音相同的人经常被合并成同一个标签。
  • 人数估计漂移。 大多数工具会估算在场人数。估少了,两位同事共用一个标签;估多了,一个走动过的人会变成 Speaker 3 和 Speaker 5。

据此调整预期。三四个人的干净录音,发言边界大致会落在该落的位置,你只需花几分钟把 Speaker 1 对应到真实姓名。八个人的免提电话录音,就把标签当作提示,关键时刻(谁承诺了日期、谁提出了异议)要回到音频里核对。

准确率:这些数字到底意味着什么

词错误率(WER)是标准衡量方法,理解它会改变你看待所有厂商准确率宣传的方式。WER 对照参考转写稿统计三类错误:替换、删除和插入,再把总数除以参考稿的词数。NIST 在其语音识别基准评测中用的就是这个指标,而“95% 准确”通常指的就是 5% 的词错误率。

问题在于,WER 把每个错误都看作一样。漏掉一个 "um" 和漏掉一个 "not" 都算一次删除,但只有后者会让句子意思反转。真正耗费你时间的错误,恰恰集中在你最在意的词上:人名、数字、产品术语、否定词。

还要看这个数字从哪儿来。公开的准确率是在基准语料上测出来的,而这些语料和你的会议室毫无相似之处。LibriSpeech 是朗读有声书的语音:一个人、有稿子、房间安静、麦克风很近。Switchboard 是陌生人之间的电话对话。宣传里的准确率几乎总是干净朗读语音的结果,而没有谁的周二站会听起来像有声书。

真正拉低准确率的因素,大致按伤害程度排序:

  • 重叠语音,这是业内最难的情况。
  • 混响和离麦克风的距离,伤害比大多数人以为的更大。
  • 低码率或窄带音频,原因见上文的采样率部分。
  • 模型训练数据中覆盖不足的口音和方言。这是语音系统有充分记录的局限,不是可以忽略的误差。
  • 行业术语、产品名、缩写和姓氏:这些高价值的词在训练数据中很少出现。
  • 背景噪音和句中切换语言,除非模型专门为此构建,否则都处理得不好。

在投入一个两小时的文件之前,先剪出开头三分钟,只转写这一段,然后读一遍。如果三分钟就需要大改,剩下的 117 分钟需要的编辑只会按比例更多。这时就该在“机器转写加上你自己的编辑时间”和“直接付钱请人”之间做选择了。

每份原始转写稿都需要的清理

任何转写工具的原始输出都是一堆数据,而不是一份文档。要让同事愿意读,需要专门清理一遍,按下面的顺序会更快。

  1. 先把说话人标签对应到真实姓名。 一旦能看出谁在说话,之后每一步都更容易;对 "Speaker 2" 做一次全局查找替换几乎零成本。
  2. 修正专有名词。 这是转写中最可预测的错误:你的公司名、产品名、团队一天说四十遍的缩写、通话对方的姓氏。引擎总是以同样的方式错,每次都把同一个词弄成同一个样子,所以每个词做一次查找替换通常就能清掉全部。更好的办法是预防:自定义词汇可以让你在转写之前先登记这些词,这正是Laxis 会议助手里个人词典(Personal Dictionary)的用途。
  3. 选定逐字稿还是整理稿,然后保持一致。 逐字稿保留每个口头禅、说错的开头和重复,适合研究或有争议的记录。整理稿会去掉这些,任何需要好读的内容都该用它。但不要过度清理:含糊其辞本身就是内容。“我觉得周五之前大概能做完”和“我们周五做完”不是同一种承诺。
  4. 分段并加标点。 在话题转换处分段,而不是每换一个说话人就分段,否则一段快速的来回对话会变成四十个单行段落。
  5. 在各部分的边界加上时间戳,方便任何人跳回音频对应位置。
  6. 提取决策和行动项,并附上负责人。 这才是大家真正会用的部分。

如果你想看具体操作而不是原理,我们一步步写出了把音频转成文字的完整流程。

不止一种语言的音频

如果你的录音不是英语,或者不只是英语,有两个问题决定一切:工具能不能自动识别语言,以及它对这种语言的支持是否真正到位?各家的覆盖差别很大,一种语言出现在支持列表上,并不代表它的转写效果和英语一样好,因为训练数据的分布并不均衡。

Laxis 支持 100 多种语言并能自动识别语言;在实时会议中,它会在有人说话时同步并排显示翻译,Business 方案还能在同一场会议中在最多五种语言之间自动切换。对于你已经有的文件,要按正确的顺序来:先把转写稿弄准确,再翻译。翻译一份满是识别错误的转写稿,得到的译文里的错误,没人能追溯回原文。

需要多长时间,要花多少钱

机器转写所需的时间只是录音时长的零头,一小时的音频通常几分钟就好,如果排在其他任务后面可能更久。人工转写正好相反:转写员比实时更慢,要停下、倒回、核对拼写,所以周转时间按小时或天报价,费用按音频分钟计。加急更贵。请向具体服务商索取价目表,不要依赖笼统的数字,因为价格会随周转时间、音质和说话人数大幅波动。

使用软件时,人们碰到的限制通常不是价格,而是单次录音的时长上限,它独立于每月的分钟额度。下面是 Laxis 的情况,它既能上传音频文件,也能录制实时会议:

方案价格包含内容
Free$0每月 300 分钟转写,每次录音 45 分钟
Premium每用户每月 $15.99,年付 $9.99每月 2,000 分钟转写,单次录音最长 2 小时
Business每用户每月 $29.99,年付 $19.99转写分钟数不限,单次录音最长 4 小时,外加 HubSpot 和 Salesforce 同步

最容易让人栽跟头的是单次录音上限。一场三小时的全员大会放不进 Free 或 Premium,你要么把文件拆开,要么升级方案。另外,CRM 同步在 Business 上,而不是 Premium;如果你转写通话是为了把它们录入销售管道,这一点很关键。Laxis 支持桌面端和移动端,可接入 Zoom、Google Meet 和 Microsoft Teams,当你不希望有一个可见的参会者加入时,还可以选择无机器人(bot-free)的采集方式。

如果你是在比较工具,而不是解决某个具体文件的问题,我们的2026 年 AI 笔记工具评测把这一品类放在一起做了对比。

什么时候该花钱请人

对大多数音频来说,软件是正确的默认选择。但有些情况下不是,坦白说清楚,比事后吃亏要便宜。

法律和官方记录。 证词、庭审、监管申报,以及任何可能作为证据提交的材料,通常都需要由具备资质、能为准确性作证的转写员出具经认证的转写稿。机器输出再准确,也不是经认证的记录。

音质差加上利害关系大。 如果录音是混响严重的房间里一个远处的麦克风,还夹杂大量抢话,而内容又确实重要,你花在编辑上的时间会比请转写员更贵。做选择之前,诚实地估算一下清理工作量。

口音很重且结果很重要。 识别质量在不同口音和方言之间并不均衡。如果模型对说话人的口音处理得不好,而这份转写稿会被引用、被依赖,或者要拿给说话人本人看,就请人来做。

逐字的研究转写。 在定性研究、语言学和某些临床工作中,迟疑、重叠和自我纠正本身就是数据,而不是噪音。逐字转写有专门的规范,机器不会套用。

受监管的音频。 上传之前先确认合规,而不是事后。Laxis 不符合 HIPAA,也不签署 BAA,所以受保护的健康信息不应该经过它。其他工具的承诺各不相同,唯一可靠的办法是书面询问服务商。

还有一个常被忽略的折中方案:先让机器转写一遍,再付钱请人编辑这份初稿,而不是从头转写。很多服务都提供这种方式,费用比完全人工转写低。

从你手上已有的文件开始

如果录音此刻就在你的桌面上,把它上传,读一读开头几分钟,先弄清楚你面对的是什么,再决定剩下的部分值得投入多少精力。Laxis 免费版每月提供 300 分钟转写,每次录音上限 45 分钟,足够拿你自己最糟糕的录音来测试,而不是一段精心打磨的演示文件,而且测试期间不会有试用倒计时。用 Laxis 会议助手试试,用你的音频来评判,而不是我们的。

常见问题

什么是音频转写?

音频转写是把录下来的语音转换成书面文字,可以由语音识别软件完成,也可以由人工转写员完成。输入是 mp3、m4a 或 wav 之类的音频文件;输出是文字,通常带有说话人标签和时间戳。它不是摘要。

哪些音频文件格式可以转写?

mp3、m4a、aac 和 wav 在几乎所有转写工具里都能稳定使用,flac、ogg 和 opus 通常也可以。mp4、mov 这类视频容器一般也能用,因为工具会提取音轨,不过上传很大的文件之前最好先确认。受 DRM 保护的音频完全无法转写。

自动音频转写有多准确?

准确率更多取决于你的录音,而不是你选了哪个工具。“99% 准确”这类宣传数字是在干净的单人朗读语料上测出来的,而不是在会议室里。如果有人抢话、麦克风离得远、房间有回声、口音不熟悉或术语很多,结果都会更差。先用你自己的三分钟音频测试一下。

转写软件能区分不同的说话人吗?

能,靠的是说话人分离:它按说话人切分音频,并把各段标记为 Speaker 1、Speaker 2 等。在声音区分明显、大家轮流发言时它很可靠;遇到抢话、声音相近,或者大房间里只有一个全向麦克风时就不可靠了。你仍然需要自己把标签对应到真实姓名。

我能转写一段已经录好的音频文件吗?

可以。Laxis 支持上传音频文件,所以用手机、会议平台或专用录音设备录下的内容,不需要任何实时会议也能转写。免费版每月包含 300 分钟转写,每次录音上限 45 分钟;Premium 把上限提高到两小时,Business 提高到四小时。

什么时候应该用人工转写而不是软件?

需要认证的法律和官方记录、迟疑和重叠本身就是数据的逐字研究转写,以及音质差又事关重大、编辑时间会比请转写员更贵的情况,都应该用人工。一个实用的折中办法是先让机器转写,再请人编辑这份初稿。