语音转文字
语音转文字,是用麦克风把说的话实时识别成文字的在线工具,支持中文、粤语、英语等 12 种语言,边说边出字、可随时改错字并下载 TXT,免费无需登录。识别由浏览器内置引擎完成:小鹿tools 没有服务器,不接收也不保存你的音频与文字;但 Chrome / Edge / Safari 可能把音频发到自家云端处理,机密内容请慎用。准确率受录音环境影响,Firefox 默认不支持,不能上传录音文件转写。
正在检测浏览器的语音识别能力…
⏹ 未在听写 00:00:00 · 已识别 0 字
🔒 文稿只在你的浏览器里,刷新或关闭页面即消失,我们不接收也不保存;识别由浏览器内置引擎完成。 时间戳为会话相对时钟的近似值,不适合直接当字幕成品用。
如何使用语音转文字
1
选择识别语言:中文(普通话)、粤语、中文(台湾/香港)、英语、日语、韩语等 12 种,下拉即可切换,说到一半换语言也接得上。
2
点「🎤 开始听写」,并在浏览器弹窗里允许使用麦克风(需用 https 打开本页,Chrome / Edge / Safari 可用)。
3
对着麦克风正常说话,文字实时出现在文本框里;嘴离麦克风近一点、语速平稳、一次只让一个人说,识别最稳,说错的字可随时手动改。
4
点「复制全文」或「下载 TXT」保存结果,需要时间标记就下载「带时间戳 TXT」;长会议建议每 20~30 分钟存一次。
关于语音转文字的常见问题
- 语音转文字会上传我的录音吗,安全吗
- 如实说明:小鹿tools 没有服务器,不接收也不保存你的音频与文字,文稿只在你的浏览器里,刷新即消失。但语音识别这一步是浏览器内置引擎做的,Chrome、Edge、Safari 在多数情况下会把音频发送到浏览器厂商自家的云端语音服务处理,这一步由浏览器厂商控制,我们无法代替它承诺「音频不出设备」。如果你的浏览器已经具备本机识别能力(例如新版 Chrome 已下载该语言的离线语音包),本页会自动优先启用并在顶部显示「已启用本机识别」;语音包动辄上百 MB,需要你在浏览器里自行下载,本页不会替你下载。涉及机密内容请谨慎使用。
- 手机上怎么用语音转文字,需要装 App 吗
- 不用装 App。手机浏览器打开本页就能用:安卓用 Chrome、iPhone 用 Safari,点「开始听写」并允许麦克风即可。iOS 有两个系统限制要知道:必须由你手动点击按钮触发,不能自动开始;锁屏或切到别的应用会中断听写,回到页面需要重新点一次。部分安卓机型的连续听写也不太稳定,长时间录建议分段保存。
- 语音转文字能上传录音文件转成文字吗
- 一期只支持麦克风实时听写,不能上传录音文件。原因是浏览器的语音识别标准接口(Web Speech API)只接受实时麦克风输入,无法喂入音频或视频文件;而用 WASM 本地模型(如 whisper)要下载几十上百 MB 的模型,远超本站轻量工具的基线,我们不打算为此拖慢所有用户。变通办法是用另一台设备外放录音、让本页麦克风收音,但隔空录音效果一般,仅适合应急。文件转写方案仍在评估中。
- 语音转文字免费吗,需要注册登录吗
- 完全免费,不需要注册、不需要登录,也不限次数、不加水印。本页没有任何付费档位或试用限制,打开就能用。
- 语音转文字能连续说多久,有字数上限吗
- 时长本身没有额外限制,只要一直有人说话,工具就会一直续听;真正的上限是文稿长度——单次会话约 100 万字,写满后会提示先下载保存再继续,已识别的内容不会被截断或丢弃。另外有两条会自动暂停的护栏:连续几轮都没听到任何声音会主动停下,页面切到后台超过 1 分钟也会自动暂停,避免你忘了关麦克风。所以长会议、长口播建议分段听写,每段随手下载一次 TXT,既不怕意外刷新,整理起来也更省事。
- 语音转文字一小时会议能出多少字
- 按中文口语常见语速算:日常讲话每分钟 180~260 字,一小时不停地讲大约是 1.1 万~1.6 万字,照稿念的口播还会更多。本页单次会话的文稿上限是 100 万字符,按这个速度要连着讲 60 小时以上才写得满,正常会议根本撞不到。真正要防的是意外丢稿——刷新页面、页面切到后台超过 1 分钟被自动暂停、电脑休眠,都会打断当前这一段,所以长会议建议每 20~30 分钟点一次「下载 TXT」,分段存比最后一次性存稳妥得多。
- 语音转文字能自动加标点吗
- 标点由浏览器的识别引擎决定,本工具不做二次加标点。实测 Chrome 上中文普通话与英语通常会自动补逗号、句号,粤语和小语种经常整段不带标点,Safari 的表现也和 Chrome 不同。有两个办法可以省事:一是试着把「逗号」「句号」当口令念出来,认这套口令的引擎会照着断句,先说一句试试就知道认不认;二是识别完在文本框里补,成批的问题用站内「查找替换」一次改完。段落层面不用担心——本页的「自动断句换行」开关默认开着,每识别完一段就自动另起一行,这一步是页面加的,不依赖引擎。
- 语音转文字识别不准确怎么办
- 识别准确率由浏览器引擎和录音环境决定,本工具不做二次纠错,也不承诺「99% 准确」。实测下来:安静环境、标准普通话、嘴离麦克风近、语速平稳时短句最稳;口音、方言、多人同时说话、背景音乐会明显掉准;人名、公司名、专业术语常被识别成同音字,标点是否自动加也各引擎不一。建议先说一两句试试效果,识别完直接在文本框里改错字,量大时可以用站内「查找替换」批量订正。
- 语音转文字说着说着就停了怎么解决
- 这是浏览器引擎的正常行为:连续静音几十秒后它会自己结束这一轮识别。本工具默认开启「自动续听」,会在退避 1 秒后自动接上,并用重叠去重把引擎重启时重复吐出的尾句截掉,所以不会出现「今天天气不错今天天气不错」这种重复。如果连续几轮都没听到任何声音,工具会主动暂停并提示,避免无意义地反复重启麦克风,这时点「开始听写」即可继续。
- 语音转文字下载的 TXT 打开乱码吗
- 不会乱码。下载的 TXT 是 UTF-8 编码并带 BOM,Windows 记事本、写字板、Word、Excel 直接打开都正常,macOS 与手机上同样正常。带时间戳的那一份每行以 [00:01:23] 开头,方便回头定位内容。有一点要说清楚:带时间戳的文稿是按识别当时的分段生成的,不包含你后来在文本框里手动改掉的错字,需要改后的版本请下载普通 TXT,或者复制全文再粘贴保存。
- 语音转文字支持粤语和英语等多语言吗
- 支持。语言下拉里有中文(普通话)、粤语(广东话)、中文(台湾)、中文(香港)、英语(美国 / 英国)、日语、韩语、法语、德语、西班牙语、俄语,听写过程中也能直接切换,工具会自动换一台识别器继续。实际效果取决于你所用浏览器对该语言的支持程度——中文普通话和英语最稳,粤语和小语种的表现差异较大。
- 语音转文字用什么浏览器,Firefox 为什么用不了
- Firefox 默认没有开启语音识别接口,所以打开本页会看到「当前浏览器不支持语音识别」的提示,这不是页面出错。推荐用电脑或手机版的 Chrome、Edge、Safari。另外语音转文字必须在 https 安全连接下使用,用 http 或本地文件方式打开时浏览器会直接拒绝麦克风;部分安卓 WebView 与微信内置浏览器也可能不支持或授权受限,遇到时请点右上角「在浏览器中打开」。
语音转文字准确率怎么样,录音会不会被上传
准确率由浏览器引擎和录音环境决定,本工具不做二次纠错,识别完直接在文本框里改错字即可。 录音方面,小鹿tools 没有服务器,不接收也不保存你的音频与文字;但识别这一步走浏览器内置引擎,音频可能被送到浏览器厂商的云端处理。
- 识别引擎
- 浏览器内置的 Web Speech 语音识别,不装插件、不下载模型;准确率与语言支持由浏览器决定
- 实测效果
- 安静环境 + 标准普通话 + 近距麦克风的短句最稳;口音、方言、多人对话、背景音乐会明显掉准
- 自动续听
- 引擎静音数十秒会自停,本工具退避 1 秒自动重启并去掉重复尾句;连续无声则主动暂停,不会反复重启
- 导出格式
- 复制全文、下载 TXT(UTF-8 带 BOM,记事本打开不乱码)、下载带时间戳 TXT([00:01:23] 行首)
- 浏览器支持
- Chrome / Edge / Safari 可用,Firefox 默认不支持;必须 https 打开才能用麦克风
- 本地记忆
- 只记住识别语言与几个开关,绝不把文稿内容写进浏览器存储;文稿刷新即失
- 字数换算
- 中文口语每分钟约 180~260 字:10 分钟发言约 1800~2600 字,1 小时会议约 1.1 万~1.6 万字;单次会话上限 100 万字符,够连着讲 60 小时以上
- 语言与切换
- 中文(普通话/粤语/台湾/香港)、英语(美/英)、日、韩、法、德、西、俄共 12 种,听写中途也能换
把电脑放在发言人一侧、一次只让一个人说,效果比放在桌子中央收全场好得多。开着「自动断句换行」,一人一段更好整理;每 20~30 分钟下载一次 TXT 分段存档,散会后再用「查找替换」统一订正人名与公司名。
用语音转文字记网课笔记要注意什么
外放声音让麦克风收音属于隔空录音,衰减明显、准确率不如自己讲话,适合记要点而不是逐字稿。开「记录时间戳」,回头按 [00:12:30] 就能定位到那一段视频重听,比纯文字好用。
用语音转文字写口播草稿快不快
口述通常比打字快好几倍,适合先把想法一口气说完再回头改。写完直接在文本框里删改,需要正式排版可以复制到别处;识别错的同音字成批出现时,用「查找替换」一次改完。