faster-whisper-GUI 完整使用指南:离线语音转文字从安装到说话人识别
faster-whisper-GUI 完整使用指南:离线语音转文字从安装到说话人识别
【免费下载链接】faster-whisper-GUIfaster_whisper GUI with PySide6项目地址: https://gitcode.com/gh_mirrors/fa/faster-whisper-GUI
下午三点,会议室刚散场,我把一段 47 分钟的访谈录音拖进窗口。勾选 VAD 过滤、选好 medium 模型、打开 WhisperX 说话人识别,十几分钟后桌面上多了一份带人名标签、带时间戳的 SRT 文稿。整个过程中音频没有离开本地,也没有走任何云端识别接口。这就是 faster-whisper-GUI 的日常:一款用 PySide6 写成的免费离线语音转文字桌面工具,当前版本 0.8.0。
它到底是什么
faster-whisper-GUI 是 faster-whisper 的图形化前端,并把 WhisperX(词级时间戳对齐、说话人识别)和 Demucs(人声分离)整合进同一套界面。它解决一件很具体的事:把本地的音频、视频文件批量转成带时间戳的字幕或文稿,同时把 faster-whisper 暴露的参数几乎全部摆到面板上——不写代码也能调到模型内部。
和同类工具相比,三个特点值得记住:
- 参数全:VAD、beam、温度、热词、词级时间戳,界面上都能改;
- 引擎多:faster-whisper 负责转写,WhisperX 负责对齐与分人,Demucs 负责降噪分离;
- 输出杂食:SRT、VTT、TXT、LRC、SMI、ASS、JSON 七种格式,中文场景还能选 GBK 或 UTF-8 编码。
三步跑通第一次转写
环境只需要 Python 3 和一台能跑 torch 的机器,三步即可看到结果:
git clone https://gitcode.com/gh_mirrors/fa/faster-whisper-GUI cd faster-whisper-GUI pip install -r requirements.txt python FasterWhisperGUI.py启动后先到模型页下载模型。tiny、base、small、medium、large-v1/v2/v3 都在列表里,还附带了 distil 蒸馏版;软件内置了模型下载与格式转换,不需要手动去 HuggingFace 翻目录。第一次建议选 small 或 medium:速度与准确率均衡,也方便你熟悉界面。设备按硬件选 cuda 或 cpu,计算精度用 float16(GPU)或 int8(CPU)。
能力拆解:按你的目标选配置
与其按界面顺序介绍模块,不如反过来——你想得到什么结果,就用对应的那组参数。
想要更准,先看两个地方。一是模型,large-v3 是当前列表里准确率的上限,英文内容用带.en后缀的模型更稳。二是温度和热词:temperature 调到 0.2~0.3,能明显减少重复和编造式的"幻听";如果人名、产品名经常被认错,把热词(hotwords)填进文本框,识别会立刻改善。语言尽量手动指定(简体中文选 zhs),自动检测会牺牲开头 30 秒的准确性。
想要更快,策略是换小模型、压精度、开 VAD。tiny/base 或 distil 系列最快;GPU 选 float16,CPU 选 int8,再把 CPU 线程数调高。VAD 过滤基于 Silero VAD,会跳过静音段,对播客、访谈这类有停顿的录音能省下不少处理时间;不需要逐词对齐时,关掉词级时间戳也能提速。
想要更省心,用批量与文件管理。多个文件可以拖进列表一起转,非音视频文件会被自动过滤;输出格式、编码、保存目录一次设好,剩下就是排队等待。开着词级时间戳导出 LRC,可以直接当卡拉 OK 歌词用(配合 foobar2000 的 ESLyric 插件)。字幕编码选 UTF-8 BOM 或 GBK,在 Windows 播放器里更不容易乱码。
想区分说话人,这是 WhisX 的主场(项目内置 WhisperX 3.1.1)。勾选 WhisperX 后,引擎先做词级时间戳对齐,再做说话人分离,结果里每句话带独立的说话人标签和时间段,适合会议纪要、访谈整理。结果页可以直接看到对齐后的时间轴,并手工修正时间戳。
音频太吵怎么办:转写前先用 Demucs 分离。它能把人声从音乐里单独提出来,也可分 Bass、Drums、Other 等音轨,参数页提供采样重叠度、分段长度与输出音轨选项。处理完再喂给转写引擎,嘈杂环境的识别率提升肉眼可见。
一个可以照做的完整工作流:一小时例会变会议纪要
目标:把 60 分钟的周会录音转成带说话人标签的 SRT,供复盘使用。
- 准备:模型页选 medium(机器跑得动就上 large-v3),设备 cuda、精度 float16;模型下载只需首次联网,之后全程离线。
- 执行:把录音拖进文件列表,语言选 zhs,任务选 transcribe,打开 VAD 过滤和词级时间戳,chunk_length 保持在 15 秒上下。
- 调整:转完发现人名有误,在热词里补上这些词重跑;如果静音段被编造内容填充,把 temperature 降到 0.2,并打开 hallucination_silence_threshold。
- 产出:勾选 WhisperX 说话人识别重新生成,在结果页检查时间戳,导出 SRT。转写耗时取决于模型与硬件,建议先用 5 分钟片段试跑定参数,再整段提交。
快问快答
没有 GPU 能用吗?能。选 cpu + int8,medium 以下模型尚可接受,只是慢。内存建议 8GB 起步。
模型下载失败怎么办?模型页内置了下载与转换功能;也可以把模型文件提前放进下载目录,勾选 local_files_only 离线加载,绕开网络问题。
结果里为什么有重复和"幻听"?多半是温度偏高或静音段过长。把 temperature 降到 0.2~0.3,打开 VAD 和 hallucination_silence_threshold,通常能压下去。
VAD 什么时候该关?当你用 clip_timestamps 指定只转某一段时,VAD 会被忽略;音乐类音频也建议关闭,避免把旋律误判为静音。
能实时转写吗?项目里带有麦克风采集与流式转写的工作线程,适合边录边出文本的轻量场景。
接下来可以做什么
想深入调参,项目根目录的《参数说明:.md》把转写、VAD、模型三层参数逐一列出,是最完整的说明书;faster_whisper_GUI/config.py 里可以改默认语言表、模型列表、字幕格式与主题色。建议的下一步:挑一段 5~10 分钟的录音,按上面的工作流完整跑一遍,再回头调温度、热词和 VAD 这三个旋钮。跑通一次你就会发现,多数会议、课程和访谈的整理,其实不需要依赖任何在线服务。
【免费下载链接】faster-whisper-GUIfaster_whisper GUI with PySide6项目地址: https://gitcode.com/gh_mirrors/fa/faster-whisper-GUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
