如何免费将音频转录为文字(快速又准确)
你的手机里存着一段 40 分钟的录音。可能是一场采访、一堂讲座,或是散步时随口念叨录下的一段语音备忘。现在你需要把这些话变成文字,而且最好不花一分钱、也别搭上整个下午。
好消息是:你完全可以免费把音频转录为文字,而且如今的工具已经相当出色。但有一点很少有人事先提醒你——所谓的"出色",取决于你的录音质量远多于取决于你用的软件。本指南将带你了解真正实用的免费方法、各自最适合的场景,以及大多数文章完全略过的关键:究竟是什么决定了你的转录稿是干净利落,还是变成一堆得逐行修改的乱码。
你的设备上已经自带的免费工具
在注册任何服务之前,先看看你手头已经有什么。大多数手机和办公套件都内置了转录功能,而对很多任务来说,这就足够了。
在 iPhone 上,Voice Memos 应用可以在设备本地完成录音转录。如果你用的是 iPhone 12 或更新机型、运行 iOS 18 或更高版本,打开一段录音,点击播放控件上方的对话气泡图标,文字就会随着播放逐词高亮显示。它完全离线运行,支持大约十种语言,因此不会有任何内容被上传。对于涉及隐私的内容来说,这是实打实的隐私优势。
在 Google Pixel 上,Recorder 应用做到了 Apple 至今仍未实现的事:在录音的同时实时转录,完全在设备本地离线完成。无需联网、无需账号、无需付费。代价是它仅限 Pixel 使用,所以如果你用的是其他 Android 手机,就得另寻他路。
Google Docs Voice Typing(语音输入)是许多人的免费主力工具。打开一个文档,进入"工具 > 语音输入"(或在 Windows 上按 Ctrl+Shift+S、在 Mac 上按 Cmd+Shift+S),然后开口说话即可。它免费、不限时长,对于清晰平稳的口述效果好得出人意料。老实说它也有局限:它几乎不会自动加标点,而且是为实时语音设计的,而非文件。要转录一段你已有的录音,人们往往会在一台设备上把音频外放,让另一台设备上的 Docs 去听,这样虽然行得通,但会牺牲质量。
Microsoft Word 的 Transcribe(转录)工具功能更强,但它并不免费。它需要付费的 Microsoft 365 订阅和网络连接。你为此得到的是:上传一个文件(.mp3、.wav、.m4a 或 .mp4),Word 会区分说话人、添加时间戳,并支持 80 多种语言,每月最多可上传 300 分钟音频。如果你本来就在为 Microsoft 365 付费,这是一个藏在明处的更优选择之一。如果你没订阅,那就跳过它。相比之下,Word 内置的 Dictate(听写)功能是免费的,可处理实时语音转文字。
提示:让工具与音频来源相匹配。设备本地的录音应用(iPhone Voice Memos、Pixel Recorder)最适合你正要现场采集的音频。基于上传的工具最适合你已有的文件。硬要让一款实时口述工具去转录一个已保存的文件,正是大多数人白白浪费一小时的地方。
免费的网页转录工具与 AI 工具
当内置选项不合用时,基于浏览器的转录工具通常就派上用场了。你上传一个文件,等上几分钟,然后下载文字。正是这类工具让免费转录在近几年真正变得好用,因为它们大多已经改用现代语音识别模型,而不再是十年前那些笨重的引擎。
各家的免费额度各不相同,所以在挑选之前,值得先了解它们大致的样子:
- Notta — 每月免费 120 分钟,适合偶尔处理较长的录音。
- Otter.ai — 每月免费 300 分钟,在会议和实时采集方面表现出色。
- TurboScribe — 每天三个文件,每个最长 30 分钟,无月度总量上限。
- OpenAI's Whisper — 免费且开源,若你愿意自行运行,则不限时长——而这对非技术用户来说正是难点所在。
这些工具大多支持你能想到的常见格式(MP3、WAV、M4A、FLAC),文件大小上限通常在 500 MB 左右。少数支持最大 1 GB 的上传。真正让人栽跟头的一个数字,是单个文件的时长上限——它和每月总量是两回事。某款工具或许每月给你 120 分钟,却可能卡在一个 90 分钟的单个文件上。在上传长录音之前就查清单文件上限,别等它失败之后才发现。
最省事的免费路径,一步步来
如果你只是想以最小的麻烦得到一段干净的录音转录稿,下面这条路几乎是我会推荐给任何人的。像 Laxis 这样的 AI 会议助手在某种特定场景下能真正体现价值,稍后我会讲到;但对于一次性的单个音频文件,用免费的网页转录工具才是正解。
- 准备好你的文件。确保它是常见格式(MP3、WAV 或 M4A)。如果你的录音设备保存的是某种冷门格式,大多数工具会在上传时自动转换,但 MP3 是最稳妥的选择。
- 挑一款符合你文件时长的免费转录工具。对于 30 分钟以内的内容,TurboScribe 的免费方案很快捷。对于较长的单个文件,Notta 每月 120 分钟的免费额度会给你更多空间。
- 上传并设置语言。这一步比人们以为的更重要。事先告诉工具正确的口语语言,能实实在在地提升准确率,对于非英语音频尤其如此。
- 等待,然后校对。转录耗时通常只是音频时长的一小部分。完成后,对照音频读一遍开头一分钟,以便发现系统性错误——听错的人名、专业术语,或反复出现的错词。
- 整理并导出。修正那少数几处错误,如果免费工具没有添加说话人标签,就手动补上,然后导出为文本、Word 或 SRT。
就这么简单。对于清晰的单人音频,你读这份清单花的时间,会比实际操作还多。
真正决定准确率的因素
接下来这部分,正是区分"能用的转录稿"和"一团糟"的关键,而它几乎和你选了哪款工具无关。每一款现代转录工具的底层用的都是大致相似的语音识别技术。真正天差地别的,是你喂给它的音频。
对于用像样的麦克风录制的清晰单人音频,准确率大约在 85% 到 95% 之间。顶尖引擎在录音室级别的录音上能达到 95% 到 98%。但换成现实世界中的音频,这个数字就会断崖式下跌,常常降到 80% 以下。20% 的错误率,用在个人语音笔记上或许无妨,但用在任何你要引用或发布的内容上就是一场灾难。
以下四点造成了大部分的破坏:
背景噪音
准确率的头号杀手。空调暖通设备的嗡嗡声、车流声、咖啡馆的嘈杂、吹到手机麦克风上的风声。一旦噪音相对于人声变得过响,引擎就只能开始靠猜了。
麦克风的距离与质量
距离说话人 6 到 12 英寸的麦克风能捕捉到完整的声音。而房间另一头的笔记本电脑麦克风,捕捉到的是单薄、带回声的版本,引擎处理起来会很吃力。
交叉说话与声音重叠
当两个人同时开口,模型实际上只能跟住其中一个。多人说话的音频,比单人声音要难上太多。
口音与行话
浓重的口音、专业术语和专有名词,正是连好工具也会出错的地方。设置正确的语言和方言会有帮助,但人名之类还是得做好手动修正的准备。
注意,这四点中有三点,都是你在按下录音键之前就能掌控的。这就引出了你能做的最划算的一次升级。
胜过任何软件的一招:一支 30 美元的 USB 麦克风,对转录准确率的提升,会超过你换用任何高端转录工具。引擎只能处理它拿到的音频,而一支贴近、像样的麦克风所提供的干净信号,胜过在一段浑浊的笔记本录音上施加再多的 AI 巧思。
次优之选,还免费:把麦克风凑近,并消除噪音。挪到距说话人一英尺以内,关上窗户,关掉风扇。十秒钟的准备,能为你省下二十分钟的修改。
说话人标签、长文件,以及免费工具的天花板
免费转录中,有两个局限反复出现,在你决定采用某套工作流之前,两者都值得了解。
第一个是说话人标签,专业上称为"说话人分离"(diarization),也就是分辨谁说了哪句话。这往往是免费方案最先砍掉的功能。不少免费转录工具丢给你的是一整块不加分段的文字,完全看不出说话人是谁。即便包含了说话人分离,其准确率也大约在 80% 到 95% 之间,遇到重叠说话和相似音色的声音时更会出错。如果你要转录一段两人访谈,需要把"采访者"和"嘉宾"清楚区分开,那就在依赖它之前,先确认该工具在免费方案里确实能做到这一点。
第二个是时长。免费方案特别喜欢限制单个文件的时长。一段三小时的录音,可能需要拆成若干段,也可能干脆超出了免费方案一个月所允许的额度。把长文件拆开处理并不丢人,但要提前做好安排。
正是这些天花板,让会议和销售通话与一次性的音频文件截然不同,成了另一回事。如果你要转录的是定期发生的对话,事后再上传的工作流很快就会让人厌烦。这正是一款专门打造的 AI 会议助手 Laxis 改变问题形态的地方:它会加入你的 Zoom、Google Meet 或 Teams 通话,实时转录,在每个人说话时为其标注说话人,并在通话结束时递给你一份带有行动项和决策的摘要。你面对的不再是一整块需要清理的文字,而是真正能用的笔记,而且它们会直接同步到 HubSpot 或 Salesforce。对于随手的一个音频文件,免费转录工具就够了。而对于你每周都要进行的通话,内置说话人标签的实时采集,是另一个层级的实用。
结语
有意思的转变在于,转录本身已经不再是难点了。如今的引擎已经足够好,以至于瓶颈上移到了录音前那十秒钟的思考上。把麦克风凑近,让房间安静下来,指明语言——然后任何免费工具都能给你一份干净的成稿。跳过这些步骤,再高端的软件也救不回那段录音。在采集环节多用一点心,你就几乎不必再为转录操心了。
常见问题
将音频转录为文字的最佳免费方式是什么?
对于你已有的录音,把它上传到像 Notta(每月免费 120 分钟)或 TurboScribe(每天三个文件,每个最长 30 分钟)这样的免费 AI 转录工具,通常是最快的路径,而且能处理大多数音频格式。如果你本来就在 Google 生态里,Google Docs Voice Typing 是真正免费、不限时长的。在运行 iOS 18 或更高版本的 iPhone 12 或更新机型上,Voice Memos 应用可在设备本地免费转录,无需任何上传。
Microsoft Word 的 Transcribe 功能免费吗?
不免费。Word 的 Transcribe 工具需要付费的 Microsoft 365 订阅和网络连接。它将上传音频限制在每月 300 分钟,支持 .mp3、.wav、.m4a 和 .mp4 文件,并覆盖 80 多种语言。如果你本来就在为 Microsoft 365 付费,它是个不错的选择,但在免费的网页版或仅限桌面的 Word 版本中并不提供。
免费音频转录的准确率如何?
对于用像样麦克风录制的清晰单人音频,准确率大约在 85% 到 95% 之间,顶尖引擎在录音室级别的录音上可达到 95% 到 98%。而在带有背景噪音、交叉说话或浓重口音的杂乱现实音频上,准确率往往会跌破 80%。音频质量比你选哪款工具更重要。
免费转录工具能标注谁说了哪句话吗?
有时能,但这是最先被收费的功能。说话人标注(称为 diarization,即说话人分离)的准确率大约在 80% 到 95% 之间,遇到重叠说话和相似音色的声音时会力不从心。许多免费方案返回的是一整块不加分段的文字,完全没有说话人标签,所以如果分清谁说了什么很重要,那就在依赖它之前先确认该工具支持说话人分离。
免费转录工具支持哪些音频格式和文件时长?
大多数免费转录工具支持 MP3、WAV、M4A 和 FLAC,文件大小上限通常在 500 MB 左右。时长限制则差异很大:有些免费方案单个文件最多 15 分钟,TurboScribe 允许每天三次、每次单个文件 30 分钟,还有少数工具允许你上传最大 1 GB 的文件。对于较长的录音,请在开始之前就查清单文件上限,而不是之后。