返回洞察
行业洞察•2026-09-29•约 8 分钟 阅读

语音转文字为什么这么不准?原因与解决办法

语音转文字为什么这么不准?原因与解决办法
TL
Team Laxis
Laxis 团队 @ Laxis

语音转文字为什么这么不准?(叫它语音输入也好,说话打字也好,都是同样的引擎、同样的问题。)主要是因为语音识别是一条链——麦克风、房间、嗓音、词汇、模型——而转写结果只能和其中最弱的那一环一样好。你说的是 “their”,出来的却是 “there”(这两个英文词发音相同,意思不同)。你说了经理的姓,出来的却是一种蔬菜。你停下来想了想,屏幕上冒出一句你根本没说过的话。

每一种情况的原因和解法都不一样。下面依次讲症状、原因和解决办法,最后直接回答语音转文字算不算 AI。如果你其实是在挑工具,先看我们的听写软件横评。

语音转文字出错,原因就那么几种,而且都能预判

语音转文字把词弄错,无非三种情况:音频不清楚;这个词是模型在训练中很少见到的;或者它缺少上下文,没法在发音相近的词之间做出选择。大多数抱怨都能追溯到其中之一,而症状通常就告诉你是哪一种。

你看到的现象可能的原因先试这个
随机有词出错,在某些房间里更糟麦克风离得太远,或者房间有回声、太吵把麦克风放到离嘴一掌宽以内;检查当前选中的是哪个麦克风
在办公桌前没问题,一到户外就没法用风声和车流声直接打在手机麦克风上用手拢住手机,或者用带线控麦克风的耳机
人名、品牌名和缩写总是错模型很少见过的词用自定义词典,或者用语音纠正
“their” 变成 “there”,“to” 变成 “two”同音词要靠上下文来判断整句整句地说;校对时专门查这类词
开头一两个词没了它还没开始听,你就开口了等出现开始收听的提示再说
长时间停顿之后,冒出你没说过的话模型在填补沉默思考时先暂停麦克风
一堆不知所云的字,或者识别成了别的语言听写语言或地区设错了设置正确的语言和最接近的地区变体
突然变差了链条里有东西变了倒推一遍:新耳机、系统更新、新键盘、离线语言包

麦克风比模型更重要

语音转文字不准时,首先要排除的是音频质量差:麦克风离嘴远,录进去的房间声音几乎和你的声音一样大,而任何模型都无法还原那些根本没有清楚传过来的词。笔记本的麦克风就挨着风扇和键盘。在熙熙攘攘的街上伸直胳膊举着手机,录下来的主要是街道。

耳麦也不一定更好。很多蓝牙耳机在麦克风开启时会切换到音质更低的通话模式,所以一副便宜的有线耳机反而可能胜过昂贵的无线耳机。还要查一下电脑到底在听哪个麦克风:Mac 的听写、Windows 的语音输入和 Word 的听写(Dictate)都可以选择麦克风,而房间另一头的摄像头麦克风可能不声不响就成了默认设备。

厂商们也这么说。微软针对 Word 听写功能的故障排除建议使用耳麦或外接麦克风,并减少背景噪音;Google 的语音输入帮助页面则建议换个安静的地方,并插上外接麦克风。

听听软件听到了什么: 就在你平时听写的位置,用手机的语音备忘录录二十秒,然后戴上耳机回放。如果你能听到洗碗机、抽油烟机或者你自己的键盘声,识别引擎也听得到;这时挪一挪麦克风,比换个应用管用得多。

你怎么说,决定了它听到什么

说话方式会影响准确率,因为识别引擎主要是从自然、流畅的语音里学出来的;话说到一半声音就低下去、吞掉句尾,或者一个词一个词慢慢往外蹦,都会让模型可用的信息变少。微软建议“说得更从容一些”,这话没错,前提是“从容”指的是完整,而不是慢:先把句子想清楚,再一口气说出来。

长时间停顿还有一个更奇怪的风险。在 2024 年一项题为 “Careless Whisper” 的研究中,Allison Koenecke 及其同事发现,OpenAI 的 Whisper 生成的转写中约有 1% 包含音频里根本没有的整段短语或句子,而且这类幻觉在沉默时间较长的说话者身上出现得格外多。大多数听写工具用的并不是这个模型本身,但这个教训同样适用。

关掉麦克风再想: 如果你需要超过几秒钟才能想出下一句,就先停止听写,想好之后,把整句话准备好再重新开始。说到一半的残句会少很多,引擎也永远不会遇到需要它去填补的长时间沉默。

人名、行话和同音词,需要它没有的上下文

语音转文字搞不定人名和行话,是因为识别引擎偏向训练中经常见到的词;而在 “their” 和 “there” 这类发音相同的英文词之间做选择,要靠上下文,它却常常没有。手机键盘听到的只是孤零零的一句话。它不知道你是在回复 Aoife 关于 Q3 续约的事,于是就挑最常见、又和这串读音对得上的词。

罕见的词,就把你的词汇交给工具。专门的 AI 听写应用都有自定义词典;Laxis Voice Keyboard 把它的版本叫做 Personal Dictionary(个人词典),用来收录人名、缩写和技术术语。系统自带的听写大多没有这个功能,那就原地纠正:在 Mac 上点一下带蓝色下划线的词查看备选项,在 iPhone 上说 “change” 再把正确写法拼出来,在 Pixel 上点一下听错的词。Google 表示,Pixel 的高级语音输入会根据你纠正过的词不断改进。

同音词需要另一种习惯。短语越长,模型的语言部分就有越多线索可用,所以说 “send it to their office” 的效果比单独说一个 “their” 好。然后专门校对同音词、数字和否定词——这三个地方只要错一个词,意思就会反过来。

口音和方言得到的照顾并不均衡

对某些口音和方言,语音转文字的准确率明显更低,因为大多数引擎背后的训练数据过多地代表了某些说话方式。最有名的证据是 2020 年由 Allison Koenecke 牵头、发表在 PNAS 上的一项斯坦福研究:Amazon、Apple、Google、IBM 和 Microsoft 的系统在 2019 年接受测试,对黑人说话者平均有 35% 的词识别错误,对白人说话者则是 19%。此后各家引擎都有改进,但还没有人证明这一差距已经消除。

选择和你的说话方式最接近的地区变体会有帮助,而且不花一分钱。我们在关于带口音或用两种语言听写的指南里讲得更深入。

手机键盘跑的是小模型,云服务可以跑大模型

手机听写通常在设备本地运行,语音模型必须塞进手机的内存和电量预算之内,而云服务可以运行大得多的模型。Apple 表示,iPhone 的听写在许多语言下都在设备上处理,无需联网。Google 表示,Pixel 的高级语音输入会把你说的内容留在手机上,除非你使用 Fix it 之类的功能。相比之下,Windows 的语音输入使用的是由微软 Azure 语音服务驱动的在线识别。

本地运行并不天生就差。它更私密,在飞机上也能用,而且手机厂商正在加入本地语言模型来整理结果;在 iOS 27 中,Apple 就在 iPhone 17 Pro、iPhone Air 及更新机型上用这样一个模型来改进英文的拼写、标点和大小写。但这终究是一种取舍,也是同一句话在手机和笔记本上可能出来不一样的原因之一;我们关于本地转写与云端转写的解读文章讲了隐私这一面。

如果你觉得语音转文字越来越差,技术本身多半并没有倒退;是你那条链上有东西变了,比如新耳机、新的默认键盘、一次系统更新或者一个离线语言包。在安静的房间里、离麦克风近一点重新测试,看看问题是跟着音频走,还是跟着软件走。

语音转文字算 AI 吗?

从机器学习的意义上说,语音转文字就是 AI:现代语音识别引擎是用大量录音及其配套文字稿训练出来的神经网络,而不是一套人工编写的规则。所以,是的,它算。OpenAI 的 Whisper 在 Alec Radford 及其同事 2022 年的论文中有详细描述,它是用从网上收集的 680,000 小时音频训练出来的。如今每一个主流听写引擎都是这样造出来的。

上面的大部分现象都能由此解释。模型根据学到的东西,为它听到的声音预测最可能的词,所以它擅长常见的说法,碰到罕见的名字和代表性不足的嗓音就弱一些。它可能错得理直气壮,偶尔还会写出谁都没说过的话。我们的语音转文字解读更深入地讲了识别引擎的工作原理。

但这并不意味着听写会替你写东西。基础的语音转文字只做转写;它不是聊天机器人意义上的生成式 AI。这条界线正在变得模糊,因为很多工具加了第二步,用语言模型来编辑你的话:Windows 的 Fluid dictation、Pixel 的 Fix it、Apple 在 iOS 27 里的模型以及 Laxis 的 Verbal Cleanup,都是这类做法的不同版本。如果学校或雇主的政策限制使用“AI”,先问清楚指的是转写还是改写,再看看你开着哪些附加功能。

什么时候系统自带的听写就够用了

在安静的房间里发短消息、搜索、随手记点东西,系统自带的听写就够用,而且免费。先把麦克风、语言设置和停顿这几件事解决。如果剩下的问题主要是人名、口头禅和啰里啰嗦的长句,那一款 AI 听写应用就值回票价了。

Laxis Voice Keyboard 可以在电脑和手机上的各种应用里使用,会去掉口头禅和重复、自动加标点,并用你的 Personal Dictionary 识别人名。它的局限在于:它只能在云端运行,所以需要联网,你的音频也会离开设备;而在免费版中,听写和会议共用每月 300 分钟的额度。14 天的 Premium 试用不需要信用卡,你可以拿自己最头疼的错误去测试它。

常见问题

为什么 iPhone 上的语音转文字这么不准?

iPhone 上的语音转文字出错,通常是因为麦克风距离、背景噪音,或者它从没学过的人名和行话,而不是 iPhone 独有的缺陷。把手机拿近一点,用完整的短语来听写,难拼的名字一个字母一个字母地拼出来。在 iPhone 12 及更新机型上,如果使用美式英语,你还可以说 “change”,通过语音纠正听错的词。

为什么语音转文字越来越差?

语音转文字看起来越来越差,通常是因为你的设置里有东西变了,而不是技术倒退了。常见的罪魁祸首是新的蓝牙耳机、换了默认麦克风、一次操作系统更新、新的键盘应用或者一个离线语言包。在安静的房间里把麦克风放近重新测试,看看问题是跟着音频走,还是跟着软件走。

语音转文字算 AI 吗?

算。现代语音转文字用的是机器学习:一个用大量录音及对应文字稿训练出来的神经网络,会为它听到的声音预测最可能的词。比如 OpenAI 的 Whisper,就是用 680,000 小时的音频训练的。单纯的听写只做转写而不做写作,但现在很多工具会加一步 AI,把文字整理或改写一遍。

语音识别算生成式 AI 吗?

基础的语音识别不是聊天机器人意义上的生成式 AI,因为它转写的是你说的话,而不是创造新内容。不过界线正在变模糊:识别引擎是一个词一个词地生成文字的,偶尔会插入没人说过的短语;很多听写工具还加了语言模型来改写你的话。如果有政策限制生成式 AI,就检查一下开了哪些功能。

怎样让语音转文字更准确?

把麦克风移近嘴边,减少背景噪音,用正常语速说完整的短语,并选对语言和地区变体。然后把你的词汇教给工具,有自定义词典就用上。这几步能解决大多数错误;如果人名和口头禅仍然是问题,就试试专门的 AI 听写应用。

为什么语音转文字总把名字弄错?

语音转文字会把名字弄错,是因为识别引擎偏爱训练中经常见到的词,而大多数姓氏、品牌名和缩写都很少见。没有上下文,引擎就会用发音最接近的常见词来替代。在有自定义词典的工具里,把名字加进去就能解决;系统自带的听写大多没有这个功能,但在 iPhone 和较新的 Pixel 上,一个字母一个字母地拼出名字是管用的。