零门槛实测TMSpeech:Windows离线语音转文字工具,5分钟上手会议实时字幕
零门槛实测TMSpeech:Windows离线语音转文字工具,5分钟上手会议实时字幕
【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech
今天这篇,是我的 Windows 离线语音转文字工具 TMSpeech 亲测记录——从下载解压,到把一场线上会议变成可复制的文字稿,全程没有任何代码。如果你也开小差被抓过包,往下看。
一个开小差救回我的下午
周二下午的周会,我盯着窗外发呆,突然被点名:"这部分你来补充下?"那一瞬间,之前聊了什么,脑子里一片空白。会后同事推给我一个叫 TMSpeech 的开源小工具——它的中文名梗很直白:腾讯会议摸鱼工具。原理说穿了不复杂:它用 WASAPI 回环捕获电脑正在播放的所有声音,哪怕系统音量静音也能抓到,再把语音实时转成字幕浮在屏幕上。下一次再走神,扫一眼字幕就全补回来了。
开箱初体验:比想象中更轻
没有安装向导、没有注册登录,解压 release 包直接双击TMSpeech.exe就启动。主界面是一条细长的浅蓝字幕条,右上角几个按钮:红色圆点控制开始/停止,旁边是录音计时,还有历史记录、隐私锁和设置齿轮。第一次上手只需要记住四步:
- 双击
TMSpeech.exe启动程序 - 点齿轮进设置,把音频源选为"系统音频"
- 在"资源"页点一下,安装中文语言模型(一次性下载,之后全程离线)
- 回主界面按红色圆点,开始识别
能力逐个过:我替你验证了四件事
验证一:系统静音了,字幕照样出
我想验证的是"完全关闭电脑声音也能用"。做法:把系统音量拉到 0,播放一段网课。结果:字幕一行行正常跳出来。因为它抓的是声卡内部数据,不经过扬声器,所以"聋子听哑巴"的问题不存在。
验证二:拔网线也能识别
装上中文模型后,我直接断网测试。识别照常运行,声音数据一步都没有离开本机。在 AMD 5800u 的笔记本上,CPU 占用不到 5%,边开视频会议边挂着,几乎感觉不到它的存在。
验证三:三种识别引擎随意换
在"语音识别"设置里,可以切换命令行识别器、Sherpa-Ncnn 离线识别器(可调 GPU)和 Sherpa-Onnx 离线识别器(纯 CPU 优化)。普通用户选 Onnx 最省心;爱折腾的可以选命令行识别器,仓库的external_recognizer/目录里就带了基于 SenseVoice 的 Python 示例脚本,一行配置即可接入自己的识别流程。
验证四:会议刚结束,纪要初稿已在手边
识别完成的每句话都会自动写入"我的文档/TMSpeechLogs",按日期归档成文件;点时钟图标打开历史窗口,右键即可复制任意一段。会开完,把记录整理一下就是一份像样的纪要。
模型方面,资源页提供了中文、英文、中英双语三种模型,中英双语适合跟读外文视频的场合,点一下"安装"就能用。
调优与避坑:我的踩坑清单
- 抓不到系统声音:确认设置里音频源选的是"系统音频",而非麦克风;个别电脑需要先到 Windows 声音设置里允许应用访问录音设备。
- 识别不太准:换引擎或换模型往往比调参数更有效,模型路径可以在识别器配置里手动指定;嘈杂环境和口音影响最大。
- 命令行识别器路径带空格:用双引号包住整个路径;用
.bat脚本时开头加@隐藏回显,结尾别写pause,否则程序无法判断进程退出。 - CPU 偏高:切到 Sherpa-Onnx CPU 引擎,再配轻量模型,日常负载立刻降下来。
- 日志找不到:检查
我的文档/TMSpeechLogs目录是否存在、是否有写入权限,必要时以管理员身份运行。 - 配置改乱了:跑一下仓库自带的重置配置脚本,秒回出厂状态,不用重装。
适合谁 + 现在就去试试
如果你属于下面任何一类,都值得花五分钟试一次:天天开会想要留底稿的职场人;上网课、看技术视频恨不得把每一句话都记下来的学生;担心隐私、不想把对话上传云端的人;以及想折腾插件的开发者——项目是插件化架构,核心接口都在src/TMSpeech.Core/Plugins/下,加音频源、换识别器都不动主程序。
想直接用,下载 release 解压即跑;想看看代码,一行命令就能拿到全部源码:
git clone https://gitcode.com/gh_mirrors/tm/TMSpeech
下一次会议走神的时候,让字幕帮你兜底。
【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
