什么是转录?它如何运作,又要花多少钱
随便找一段三个人抢着说话的录音,试着一字不差地把内容写下来。十分钟的音频会耗掉你将近一个小时,而且到最后你多半还在跟自己较劲:第二个人说的到底是"不能"还是"能"。听见语音,和把语音钉在纸面上——这中间的落差,就是转录这门手艺的全部。
先做一次消歧,因为这个词身兼两职。在生物学里,转录指的是细胞把一段 DNA 复制成 RNA 的步骤——那是另一个话题,不是这个页面要讲的。下面所有内容说的都是另一层含义:把录下来的人类语音转换成书面文字。
转录是一件事,不是一份文件
转录是这样一份工作:听语音,然后用同一种语言把它写成文字——一个输入,一种方法(人、模型,或者两者兼有),一个输出。混淆之所以产生,是因为语言里往往用同一个词根既指这份活儿、又指这份活儿的产物。最终成型的那份文件叫转录稿,它的排版、样式,以及它和字幕的差别,是另一个话题——我们在专门的指南里讲过一份成型的转录稿长什么样。这个页面讲的是"做"这件事。
有两个近邻值得先排除掉。翻译改变语言、保留媒介;转录改变媒介、保留语言。给外语电影配字幕两件事都要做,而且顺序不能反。而口述是有意识地用说话来写字——你是作者,是对着设备说。转录面对的则是从一开始就没打算变成文件的语音:会议上的一次争执、证人回答提问、三个人挤在一条信号糟糕的电话会议线上。如果你真正想要的其实是口述,那么最好用的 AI 语音输入应用这份清单会更有用。
正是这种意图上的差异,让转录难在口述不会难的地方。没有人会为了留下记录而字正腔圆地讲话。人们互相打断、说到一半就断掉、挑错了词又在三个词之后改回来,还会冒出模型从没见过的专有名词。
两种做法,以及悄悄胜出的第三种
人工转录就是一个人戴着耳机、开着文本编辑器,通常脚下还踩着一个踏板,好让倒带时双手不必离开键盘。放几秒、打字、退回去、核对。难懂的段落放慢速度,把药名查清楚,听不清的地方打上标记,最后再对着音频通读校对一遍。这是不体面却很讲功夫的工作,价格反映的是实打实的劳动而不是加价——一小时音频,绝对不等于一小时工作量。
自动转录把同样的活儿交给自动语音识别(ASR)系统。上传文件,或者直接推麦克风的音频流,几秒钟文字就回来了。它不会累,不会因为口音难懂就加价,成本要低一个数量级。它同样也完全不知道自己什么时候错了——这正是下文一切讨论的关键。
混合模式——机器先跑一遍,人再修正——才是 2026 年大多数专业服务实际在做的事,包括那些把自己宣传成纯人工转录的。经济账很直白:模型处理机械的 95%,人把时间花在需要判断力的那 5% 上。业内把这叫作后编辑;我们那篇如何把音频转录成文字的指南完整走了一遍这套流程。
ASR 系统内部究竟发生了什么
你不需要懂里面的数学,但对这条流水线有个粗略的概念,几乎能解释你会遇到的每一种奇怪错误。
1. 采集并清理信号
音频会被重采样、转成单声道,通常还要过一遍噪声抑制和语音活动检测,找出真正有人说话的位置。这一步进去的是垃圾,后面就无法挽回——一个从来没有干净地进入文件的声音,任何模型都解码不出来。
2. 把声音变成一张图
原始波形对神经网络来说是个糟糕的输入。系统会把音频切成互相重叠的 20–30 毫秒帧,计算每个频段上的能量,得到一张声谱图——频率随时间变化的热力图。到这一步,语音识别更接近图像识别,而不是任何跟语言学有关的东西。
3. 把它解码成词
声谱图被送进一个大型神经网络,如今几乎清一色基于 Transformer,训练数据是海量的音频与文本配对。更早的系统是一串模块接力:声学模型猜音素,发音词典把音素映射成词,语言模型给可能的词序列打分。端到端系统把这些全都收进一个模型,直接输出文本 token——这既是它泛化能力更强的原因,也是它偶尔会流畅地"幻觉"出一句没人说过的话的原因。
4. 把它变得可读
原始输出是一串没有标点、全小写的文字。后处理会补回大小写和标点,把"一四九二"变成"1492"(逆文本规范化),按需要删掉口头语和结巴,并套用你的自定义词表——这是所有转录工具里最被低估的一个设置。
5. 判断是谁在说话
说话人标注——也就是说话人分离(diarization)——是一套独立的系统,并不属于词的解码。它把短片段转成声纹向量,做聚类,再给每个簇分配一个身份。这就是为什么经常出现文字对了、标签错了的情况:两个相近的嗓音落进了同一个簇,或者某人靠近麦克风之后标签就翻了。
提示:给说话人分离一点胜算。 如果你的会议平台能把每位参会者录成独立音轨,就打开它——分轨录音直接把聚类这个问题整个消掉了。做不到的话,就让每个人在通话开头报一次名字。八秒钟,之后标签会好改太多。
准确率的真实数字,以及悄悄毁掉它们的因素
行业用词错误率(WER)来衡量准确率:替换、删除、插入三类错误之和,除以参考文本中的词数。5% 的词错误率意味着 95% 的词准确率——每二十个词里就有一个是错的、漏的,或者是凭空多出来的。
老老实实说说现状:在干净、录制良好的音频上,最好的系统落在 95–98% 的词准确率区间,Whisper 的基准测试成绩在 97.9% 上下。在标准朗读语音测试集上,前沿云端引擎能做到 2–5% 的词错误率,低于 2% 的结果在受控条件下已经接近人类水平。开放模型这一条赛道挤压得很厉害:2026 年三月,Cohere 的 Transcribe 以 5.42% 的平均词错误率登顶 Hugging Face Open ASR Leaderboard;五周之后,IBM 的 Granite Speech 4.1 2B 又以 5.33% 略微反超。
那些都是实验室条件。下面这些因素会把数字往下拽,大致按破坏力排序:
- 重叠说话。 遥遥领先的头号杀手。两个人同时开口时,大多数系统要么揉出一段面目全非的混合体,要么悄无声息地丢掉其中一个。会议里到处都是重叠说话,基准测试集里却没有。
- 距离与房间声学。 会议桌另一头的笔记本麦克风,收进来的是混响和空调的嗡嗡声。混响会把声谱图抹花,模型解码的就是那团花。
- 口音与方言。 准确率因人而异,差距的大小取决于训练数据里出现过多少这种口音。这是整个行业的问题,而不是某一家厂商的问题——市面上每一款工具,包括我们自己的,在口音很重和串音严重的语音上都会掉链子。
- 专业词汇与专有名词。 药品名、股票代码、法律引注、你们 CEO 的姓氏。模型没见过的词就输不出来,只能拿它认识的最接近的东西顶上。
- 语码转换与电话音频。 说话人在一句话中间切换语言,会击穿那些一开始就锁定单一语言的系统;而窄带电话线路扔掉了区分相似辅音所需的高频——在 8 kHz 下,"S"和"F"很难分清。
关于这个指标还有一点要提醒:词错误率把所有错误一视同仁。漏掉一个"的"和漏掉一个"不",扣的分一模一样,这正是研究者不断推动语义层面错误度量的原因。一份 96% 准确、却把报价那段的数字弄错了的转录稿,比一份 92% 准确、数字全对的更糟。
提示:麦克风比软件更重要。 从笔记本内置麦克风换成一支 $60 的 USB 麦克风或者一副像样的耳麦,对准确率的提升超过你换任何一家厂商。近距离拾音去掉了房间混响,抬高了信噪比,也保住了辅音——这一切都发生在模型开始工作之前。
价格与交付时间:把权衡换算成真实数字
用数字说话,不用形容词。专业的人工转录大约在每音频分钟 $1.00 到 $3.00——也就是每小时录音 $60 到 $180 左右——法律领域的专业稿件会爬到接近每分钟 $5.00。难搞的音频不是免费的:背景噪声、多人说话或者浓重口音,通常要再加 25–50% 的附加费。标准交付时间是 12 小时到三个工作日。
自动化服务按量计费,报价通常在每分钟 $0.10 到 $0.50 之间,交付基本上是即时的。订阅制产品则改为打包分钟数,量一大,账就完全不是那么算了。以 Laxis 为例,每月免费包含 300 分钟转录时长,之后是按席位的固定价格:Premium $15.99,Business $29.99——如果每月有 20 小时通话,按席位算出来的结果和按分钟算差得很远。
| 方案 | 典型价格 | 交付时间 | 干净音频上的准确率 | 困难音频上的准确率 | 最适合 |
|---|---|---|---|---|---|
| 人工转录 | 每音频分钟 $1.00–$3.00(法律稿件约 $5.00) | 12 小时 – 3 个工作日;加急另计 | 可做到 99% 以上,且对着音频核验过 | 优雅降级——人会标出哪里听不清 | 法庭记录、受监管的正式文档 |
| AI 转录 | 每分钟 $0.10–$0.50,或打包在订阅里 | 实时到几分钟 | 词准确率约 95–98% | 断崖式下滑且悄无声息——不会提示自己错了 | 会议、销售通话、检索与回顾 |
| 混合(AI 初稿 + 人工编辑) | 低于纯人工价格;随编辑深度浮动 | 几小时到一两天 | 接近人工水平 | 好——人会抓住模型漏掉的地方 | 研究访谈、对外发布的内容、需要引用的材料 |
什么时候仍然需要人来把关
真正诚实的检验标准不是"这个 AI 有多强",而是"如果有一个词错了,会发生什么"。如果答案是"没什么大不了,我自己会发现",那自动化完胜。如果牵涉到法官、监管机构、患者,或者一段要公开发表的引语,就派个人上。
具体来说:法庭程序,转录稿本身就是证据,而且往往需要认证;受监管的医疗文档,一个错误会进入永久档案;任何署了消息源姓名、准备付印的内容;以及确实很糟糕的音频,因为人会告诉你某一段听不清,而模型会自信满满地生成一段胡话。
上面这些场景里,大多数的聪明做法并不是全程人工转录,而是混合模式:先跑机器这一遍,再花钱请人对着音频核验。
在这一切当中,转录作为一份职业
仍然有人靠这个谋生,而这份工作本身的变化,比从业人数的变化大得多。经典路径是先做面向媒体和商业的通用转录,法律和医疗则是需要额外培训与认证的专业方向。2026 年美国的时薪大致在每小时 $20 到 $29,具体取决于数据来源和专业方向——Indeed 给出的平均值接近 $26.49,PayScale 报告的转录员薪酬约为 $21.75,Glassdoor 上法律转录员则接近 $29。
变化的是时间花在哪儿。如今这份工作里,从空白页开始打字的部分已经很少了;大部分时间是在修正机器初稿,这听上去像降级,但大体上不是。价值集中到了模型最不擅长的那些环节:专有名词、说话人归属、领域词汇、格式规范,以及那份让文件具备法律效力的准确性认证声明。只会打字快的人,要跟打字更快的软件竞争。
如何选择方案
五个问题:
- 出错的代价有多大? 法律、医疗或对外发表——人工或混合。内部会议和研究访谈——自动化。
- 音频质量到底怎么样,说实话? 一个人戴着耳麦,和六个人围着一台笔记本,是两个完全不同的问题。悲观一点估计;它对结果的预测力胜过任何其他因素。
- 量有多大? 一年只有几个文件,适合按分钟付费;一周十小时会议,适合打包分钟数,而且盈亏平衡点来得比大家以为的早。
- 你什么时候要? 如果答案是"在跟进邮件发出去之前",那么两天的交付周期就出局了,不管它多准。
- 音频可以送到哪里? 云端处理能力更强,但这意味着你的录音离开了本地设备。值得用的工具大多是云端的,Laxis 也是,所以请读一读留存策略,确认厂商会不会拿你的数据去训练。
对于经常发生的商务会议,这笔账通常会算到:自动采集,配一支好麦克风,再加上一个能对输出做点什么的工具,而不是甩给你一堵文字墙——摘要、待办事项、CRM 同步。这正是我们那篇2026 年最好的 AI 会议记录工具对比所覆盖的品类,它和挑一家转录服务是两个不同的决定。
把每一通通话都变成真正用得上的文字
Laxis 可以录制、转录并总结 Zoom、Google Meet 和 Microsoft Teams 会议,支持 100 多种语言,自动提取待办事项,并同步到 HubSpot 和 Salesforce。免费方案每月包含 300 分钟转录时长。
结论
真正有意思的变化,并不是机器把这件事做好了,而是廉价的转录改变了"到底要录什么"这个决定本身。当一小时音频要花 $120 才能转成文字时,你只会转录取证笔录和董事会会议,别的一概不转。当价格降到每分钟几美分,约束就从成本转移到了注意力。现在什么都被转录了,于是难题不再是把文字生产出来,而是判断其中哪一小部分真的会有人读。在九千句话里知道哪十二句要紧——工作量都跑到那里去了。
常见问题
什么是转录?
转录是把录下来的语音转换成书面文字的过程。可以由受过训练的人一边听一边打字完成,也可以由自动语音识别模型把音频信号解码成词。2026 年大多数专业工作是两者结合:机器出初稿,人来修正。
自动转录是怎么工作的?
自动转录把音频波形转换成声谱图,送进一个用海量语音—文本配对数据训练出来的神经网络,再解码出最可能的词序列。之后由独立的环节补回标点和大小写、格式化数字与日期,并尝试标注每一段是谁在说。
AI 转录的准确率有多高?
在干净的单人音频上,领先的系统能达到大约 95% 到 98% 的词准确率,OpenAI 的 Whisper 在基准测试中约为 97.9%。真实条件要严苛得多。浓重的口音、重叠说话、离麦克风太远、背景噪声以及专业词汇,都会把准确率往下压,有时候压得很厉害。
转录要花多少钱?
专业的人工转录一般在每音频分钟 $1.00 到 $3.00 左右,也就是每音频小时大约 $60 到 $180,法律领域的专业稿件可达每分钟 $5.00 上下。自动化服务通常报价在每分钟 $0.10 到 $0.50,而订阅制工具往往改为每月打包一定的分钟额度,而不是按量计费。
转录和翻译是一回事吗?
不是。转录保留语言、改变媒介,把说出来的话变成写下来的字。翻译保留媒介、改变语言。视频配字幕常常需要按顺序走完这两步:先把原始音频转录出来,再把得到的文字翻译成目标语言。
转录需要多长时间?
自动转录基本上是即时的,实时返回文字,或者在上传后几分钟内完成。人工服务标准交付通常报 12 小时到 3 个工作日,当天加急则要另付溢价。人修改机器初稿的混合流程,一般落在两者之间。
转录员现在还算一份真正的职业吗?
算,只是工作重心已经从从头打字转向审校和修正机器初稿。2026 年美国转录员的收入大致在每小时 $20 到 $29 之间,取决于专业方向,法律和医疗处在顶端。如今认证和领域词汇的重要性,已经超过了单纯的打字速度。