三步装好、五步成稿:Buzz本地语音转文字工具从入门到自动化
三步装好、五步成稿:Buzz本地语音转文字工具从入门到自动化
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
开了两小时会,录音躺在手机里,逐字整理却要熬到凌晨——这是不是你的日常?Buzz 是一款完全离线运行的开源本地语音转文字工具,基于 OpenAI Whisper 打造,能把音频和视频一键变成带时间戳的文字稿,全程不联网、不上传,隐私和数据安全都有保障。这篇文章就带你从安装一路走到自动化,把这份"听写苦差"彻底交给它。
为什么偏偏是它:本地转录到底香在哪 🍀
先做个简单的对比。市面上的在线转录服务通常按分钟计费,动辄每小时几十块,还得把录音上传到别人的服务器;而 Buzz 的选择是完全在本地完成全部计算:
| 对比维度 | 云端转录服务 | Buzz 本地转录 |
|---|---|---|
| 音频上传 | 必须上传,存在泄露风险 | 全程不出电脑 |
| 收费标准 | 按时长付费 | 免费 |
| 网络依赖 | 断网即停摆 | 离线可用 |
| 支持格式 | 通常仅音频 | 音频+视频都能转 |
对于内容创作者、做访谈的学者、频繁开会整理纪实的职场人来说,这三点几乎就是刚需。而且 Buzz 同时支持 macOS、Windows、Linux,还给开发者提供了 Python 包和命令行接口,后面想玩自动化也有现成的路。
动手前先摸清两件事:转写靠什么、电脑要什么配置
很多新手装完软件发现跑不起来,其实是没搞懂 Buzz 背后有五套不同的转写引擎:
- OpenAI Whisper:官方 Python 实现,兼容性最好;
- Faster Whisper:基于 CTranslate2 优化,速度和显存占用更友好;
- Whisper.cpp:C++ 编写,支持 Vulkan 加速,大部分显卡都能用上;
- Hugging Face 模型:可接入社区里五花八门的微调模型;
- OpenAI API:少数需要联网的场景(如翻译、AI 摘要)会用到。
至于硬件,纯 CPU 也能跑,只是慢一些。建议至少 8GB 内存,配置越高、转录越快;NVIDIA 显卡可以走 CUDA 加速,Apple Silicon 有原生优化。第一次使用某个模型时需要联网下载权重,之后就可以断网工作了。
三步完成安装:三个平台的三种打开方式
安装本身没什么门槛,按你的系统挑一条路走:
- macOS:从 SourceForge 下载
.dmg安装包,拖进应用程序文件夹即可; - Windows:下载安装程序一路下一步。注意应用未签名,首次运行会被 SmartScreen 拦截,点"更多信息"→"仍要运行"即可;
- Linux:推荐用包管理器安装——
flatpak install flathub io.github.chidiwilliams.Buzz或者用 Snap(Snap 版建议先装好音频库):
sudo apt-get install libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module sudo snap install buzz
Python 开发者还有更轻的玩法,一条命令装进环境里:
pip install buzz-captions python -m buzz想从源码跑、顺便改代码,也可以git clone https://gitcode.com/GitHub_Trending/buz/buzz后按仓库文档安装。装好之后,验证是否正常就是打开软件看主界面有没有加载出来。
五步跑通第一次转录:从一段录音到一份文稿
第一次用,别急着研究高级设置,先按下面五步跑通最小流程。
第 1 步:导入音频文件🎯 点击工具栏的"+"按钮,或用快捷键 Ctrl/Cmd+O 选择文件。支持 MP3、WAV、MP4、AVI 等常见格式,可以一次拖多个文件进来批量添加;从 1.2.0 版本起还支持直接粘贴 YouTube 链接,把在线视频抓下来转写。
第 2 步:设置任务与语言
- 任务类型:选"转录"保留原语言,或选"翻译"把所有内容译成英文;
- 语言:能确定就手动指定,不确定就交给自动检测;
- 模型:先用 Tiny 或 Base 验证流程,后面再换大的。
第 3 步:打开高级选项初始提示(Initial Prompt)可以塞专业术语;"提取语音"能从嘈杂音频里分离人声;"单词级时间戳"会生成精确到每个词的时间标记,后续做字幕调整会用到。
第 4 步:点击运行任务列表会显示实时进度百分比、所用模型和当前状态,支持暂停和取消。文件越长、模型越大,等待越久,都是正常现象。
第 5 步:查看与导出双击任务行进入转录详情页,可以看到每段文字的时间轴,边播放音频边高亮对应文字,还能用搜索框快速定位。导出时四种格式任选:
| 格式 | 适用场景 |
|---|---|
| TXT | 纯文本,快速分享 |
| SRT | 标准字幕,兼容主流剪辑软件 |
| VTT | 网页视频字幕 |
| JSON | 结构化数据,方便程序处理 |
💡 避坑提示:首次运行需要下载模型,务必保证联网;想快速验证流程,先用 Tiny 模型跑一段 30 秒的音频,别一上来就挑战 Large。
模型选型:想让效率和准确率同时在线,先看懂这张表 ⚡
模型大小直接决定转录的速度与准确率,Buzz 官方把 Whisper 五个档位的模型都搬了进来:
| 模型 | 参数量 | 磁盘占用 | 速度 | 准确率 | 典型场景 |
|---|---|---|---|---|---|
| Tiny | 3900 万 | 约 75MB | 最快 | 中等 | 实时转录、短音频试水 |
| Base | 7400 万 | 约 142MB | 快 | 良好 | 日常会议记录 |
| Small | 2.44 亿 | 约 466MB | 中等 | 优秀 | 播客、采访 |
| Medium | 7.69 亿 | 约 1.5GB | 较慢 | 极佳 | 专业内容制作 |
| Large | 15.5 亿 | 约 2.9GB | 慢 | 顶级 | 学术研究、高要求场景 |
模型管理在"首选项 → Models"标签页里:可以查看已下载的模型、下载新版本、填写自定义模型链接,删掉不用的模型还能释放磁盘空间。
想让 Large 也能跑得动,就要请出硬件加速:
- NVIDIA GPU:装 CUDA 版 PyTorch,例如
pip3 install -U torch==2.8.0+cu129 torchaudio==2.8.0+cu129 --index-url https://download.pytorch.org/whl/cu129; - Apple Silicon:开箱即用,M 系列芯片有原生优化;
- 其他 GPU 或集显:Whisper.cpp 走 Vulkan,覆盖面最广。
再补两个性能口诀:内存够大就调大批处理大小;模型文件放 SSD 上,加载速度肉眼可见地变快。
把转录结果"喂"得更准的三个小动作
模型选对了,准确率还能靠操作再上一层楼:
- 手动指定语言。自动检测偶尔会翻车,尤其面对口音或混合语言时。能确定就用确定的,哪怕内容里混了几句外语,也以主要语言为准;
- 用好初始提示。把专业术语、人名、公司名预先写进提示里,Whisper 会明显更"懂事"。做讲座录音时,把课件里出现的关键词都塞进去;
- 按内容挑模型。日常会议 Base 就够,访谈播客上 Small/Medium,学术材料直接 Large,别用大炮打蚊子也别凑合。
背景噪音大的录音,先勾选"提取语音"分离人声,或者配合后面要讲的 DeepFilterNet 降噪插件,效果立竿见影。
会议和访谈救星:实时录音转写这样玩 🎙️
除了导入现成文件,Buzz 还能一边录音一边出文字,开会时打开它,散会就有初稿。操作路径很清晰:
- 点击主界面麦克风图标进入录音模式;
- 选择输入设备(内置麦克风或外接);
- 把延迟参数调到 20–30 秒,兼顾实时性和识别质量;
- 开始录音,实时查看逐句结果。
如果是在讲座、发布会这类场合,可以打开演示窗口全屏展示实时转录,观众抬头就能看到字幕,还能自定义字体大小和颜色。想要显示更干净,就调高静音阈值过滤背景噪音、隐藏尚未确认的部分;担心电脑卡顿,就拉大转录步长降低系统负载。
另外在"首选项 → General"里可以勾选"实时录音转录导出",并指定导出目录,散会即出稿、自动落盘。
从手动到全自动:命令行与文件夹监控两条自动化路线
手动点按钮适合零散任务,批量场景就该上命令行。Buzz 的 CLI 以buzz add为核心:
# 转录单个文件并指定语言和模型 buzz add --task transcribe --language zh --model-type whisper --model-size medium input.mp3 # 批量处理目录下所有 MP3 buzz add --model-type whispercpp --model-size small *.mp3 # 输出 SRT 字幕 buzz add --task transcribe --srt video.mp4 # 同时导出 SRT、VTT、TXT buzz add --task transcribe --srt --vtt --txt audio.wav # 指定输出目录 buzz add --task transcribe --output-dir ./transcripts audio_files/*.mp3高级参数同样能带进命令行:--prompt "专业术语:神经网络,机器学习"注入提示词,--word-timestamps开启单词级时间戳,--extract-speech分离人声,--hide-gui则让任务在后台静默跑完——非常适合放进定时脚本里。
不想写脚本,就用文件夹监控:在"首选项 → Folder Watch"里指定一个目录,Buzz 会盯着它,一旦有新音频文件落入就自动转录。还能配置是否递归监控子目录、按扩展名过滤文件类型,以及处理完成后对原文件移动、重命名或删除。配合"跳过已转录文件"插件,把文件重新丢进监控目录也不会重复劳动。
让字幕"听话":批量整形与说话人识别
转录出来的文字经常一段长一段短,直接导出成字幕很难看。Buzz 内置了"字幕调整"功能,打开 Resize 面板就能给字幕"整形":
- 期望字幕长度:控制每行字幕字符数,默认 42,适合快速对话可以调小,演讲内容可以调大;
- 按间隙合并:把间隔小于 0.2 秒的片段拼起来;
- 按标点分割:遇到句号、逗号自动断行;
- 按最大长度分割:强制每行不超过设定长度。
经验是"间隙合并 + 标点分割"组合使用,字幕最自然。
需要区分发言人时,还有说话人识别功能,会议记录里谁说了什么一目了然。
给转录流水线加点私货:插件系统 🧩
从 1.4.5 版本开始,Buzz 支持插件扩展,不用改核心代码就能定制流程。内置插件已经覆盖了不少高频需求:
- AI 摘要:调用 OpenAI 兼容 API,把整段转录浓缩成摘要,存进备注或单独文件;
- 增强语言检测:转录前用本地 Whisper 模型先定语言,适合完全未知语种的音频;
- 导出 DOCX:一键把转录导出成 Word 文档,可选带时间戳;
- 转录调整:自动把单词级片段重组成字幕大小的块,按间隙合并、按标点分割、强制最大长度,和前面的 Resize 是一对好搭档;
- DeepFilterNet 降噪:转录前用 AI 模型去背景噪音,处理后的音频会存成
_DeepFilterNet3.wav新文件; - 跳过已转录文件:检查结果文件或转录数据库,避免重复劳动。
管理入口在"帮助 → 插件":可以启用/禁用单个插件、拖拽调整执行顺序、点设置图标配置参数,甚至通过"添加 URL"安装社区插件。想自己写插件的话,仓库里的buzz/plugins/目录和plugins/AGENTS.md文档就是最好的入门教材。
疑难排解速查表:慢、不准、延迟高,分别怎么办
| 症状 | 原因与对策 |
|---|---|
| 转录速度太慢 | 检查是否启用 GPU 加速;换 Tiny/Base 小模型;关掉吃资源的后台程序;确认内存充足 |
| 识别准确率不高 | 排查音频底噪;手动指定语言;在初始提示里补充专业术语;尝试 Medium 档位 |
| 实时录音延迟明显 | 把延迟参数调到 20–30 秒;换外接麦克风;关掉不必要的系统声音 |
| 模型下载失败 | 首次使用必须联网,检查网络代理设置后重试 |
| 导出字幕时间轴错乱 | 确认转录时开启了单词级时间戳,再使用 Resize 调整 |
收尾:一份可以立刻照做的行动清单 ✅
按部就班走完这篇文章,你已经具备了把 Buzz 用出生产力的所有知识。接下来建议这样推进:
- 按自己的系统完成安装,打开主界面确认运行正常;
- 用一段 1 分钟内的短音频跑通"导入 → 转录 → 导出"全流程;
- 尝试验证不同模型档位,找到自己场景下的效率/准确率平衡点;
- 下次开会时打开实时录音,体验"散会即出稿";
- 把常用批次整理成一个文件夹,配置监控目录,让转录真正自动化;
- 需要时按需启用插件,把流水线调成自己的形状。
工具是死的,工作流是活的。把重复的听写交给 Buzz,把时间留给真正需要判断力的事——这才是本地语音转文字工具存在的意义。现在就装一个,用第一条录音开始吧。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
