Win10安装OmniVoice 部署本地TTS服务
OmniVoice 完整安装指南:小米开源的高质量语音克隆 TTS 模型
前言
OmniVoice 是小米 AI 实验室旗下的语音团队 k2-fsa(下一代 Kaldi 团队)于 2026 年 4 月正式开源的多语言文本转语音(TTS)模型。它是一款大规模多语言零样本语音合成模型,支持600 多种语言,具备语音克隆和语音设计两大核心能力。
模型参数量仅 0.8B,基于 58.1 万小时开源语音数据训练而成,采用 Apache-2.0 协议,个人和商业均可免费使用。其推理速度 RTF 低至 0.025,即40 倍实时速度。
本文将带你一步步完成 OmniVoice 在 Windows 系统上的完整安装与配置。
一、前提条件
在开始之前,请确保你的系统满足以下要求:
| 项目 | 要求 |
|---|---|
| 操作系统 | Windows 10(21H2 或更新版本)或 Windows 11,64位 |
| Python | Python 3.11 或更高版本 |
| 硬盘空间 | 至少 10-14 GB 可用空间(用于存放应用、Python环境和模型权重) |
| 显卡(可选) | NVIDIA GPU + 最新驱动程序(可实现CUDA加速);AMD显卡在Windows上仅支持CPU模式 |
| 网络 | 需要稳定访问互联网,以下载模型文件(约14GB)和依赖包 |
💡提示:如果你没有 NVIDIA 显卡,OmniVoice 仍然可以在 CPU 上运行,但生成速度会明显变慢。
二、安装步骤
第 1 步:安装 Python
- 访问 python.org 下载 Python 3.11 或更高版本的安装包。
- 运行安装程序,务必勾选“Add Python to PATH”(将Python添加到环境变量)。
- 安装完成后,打开命令提示符(CMD)或 PowerShell,验证安装是否成功:
python--version应显示类似Python 3.11.x的信息。
第 2 步:安装 Git(可选但推荐)
Git 用于从 GitHub 克隆代码。如果只从 PyPI 安装则非必需,但建议安装以备后续开发使用。
- 从 git-scm.com 下载并安装 Git for Windows。
- 安装后可在 PowerShell 中验证:
git--version第 3 步:安装 Microsoft C++ Build Tools(可选)
某些 PyPI 源码包(如 pyannote.audio)在安装时需要编译 C++ 代码,建议提前安装:
- 下载并安装 Visual Studio 2022 Build Tools
- 安装时勾选“Desktop development with C++”工作负载
第 4 步:创建 Python 虚拟环境(强烈推荐)
使用虚拟环境可以避免包版本冲突。
# 创建项目文件夹并进入mkdir omnivoice_project cd omnivoice_project# 创建 Python 虚拟环境python-m venv venv# 激活虚拟环境(Windows)venv\Scripts\activate激活成功后,命令提示符前会出现(venv)标识。
第 5 步:安装 PyTorch(深度学习框架)
OmniVoice 依赖 PyTorch。根据你的显卡类型选择对应的安装命令。
✅ 如果你有 NVIDIA 显卡(推荐)
首先确认你的显卡驱动支持的 CUDA 版本。在终端运行:
nvidia-smi查看右上角的 CUDA Version 信息。根据你的 CUDA 版本选择对应命令。例如 CUDA 12.x 版本:
pip install torch==2.8.0+cu128 torchaudio==2.8.0+cu128--extra-index-url https://download.pytorch.org/whl/cu128 pip install torch==2.11.0+cu130 torchaudio==2.11.0+cu130--extra-index-url https://download.pytorch.org/whl/cu130-i https://mirrors.aliyun.com/pypi/simple/注意:Windows 下 OmniVoice 的 GPU 加速仅支持 NVIDIA/CUDA,无需单独安装 CUDA Toolkit,驱动程序已包含所需支持。
✅ 如果你没有 NVIDIA 显卡(仅 CPU 模式)
pip install torch torchaudio第 6 步:安装 OmniVoice
选择以下任意一种方式安装:
方式一:从 PyPI 安装(稳定版,推荐)
pip install omnivoice pip install omnivoice-i https://mirrors.aliyun.com/pypi/simple/方式二:从 GitHub 源码安装(最新开发版)
pip install git+https://github.com/k2-fsa/OmniVoice.git方式三:克隆源码后开发模式安装
git clone https://github.com/k2-fsa/OmniVoice.git cd OmniVoice pip install-e.三、验证安装
安装完成后,可以通过以下命令验证 OmniVoice 是否安装成功:
# 查看 omnivoice 命令是否可用omnivoice-tts--help如果显示帮助信息,说明安装成功。
四、命令行使用方法
1. 基本文字转语音
最简单的用法,将文字转换为语音:
omnivoice-tts--text"你好,欢迎使用小米开源的语音合成服务。"生成的音频文件默认保存在当前目录下。
2. 语音克隆(核心功能)
使用一段 3-10 秒的参考音频来克隆声音:
omnivoice-tts--text"这是克隆出来的声音。"--ref-audio"C:\path\to\your\reference.wav"将C:\path\to\your\reference.wav替换为你自己的音频文件路径。
📱提示:手机录音即可使用,内置去噪功能可处理轻微噪音。建议在安静环境下录制清晰完整的语句,效果更稳定。
3. 语音设计
通过文字描述来控制生成音色的属性:
omnivoice-tts--text"你好。"--voice-design"male, elderly, low pitch, British accent"支持控制的属性包括:性别、年龄、音调、方言、口音、耳语等。
4. 情绪控制
在文本中加入特殊标签来控制语气:
omnivoice-tts--text"这真是太有趣了,[laughter] 我忍不住笑了出来。"支持的标签包括:[laughter](笑声)、[sigh](叹气)、[breath](呼吸声)等。
5. 启动本地 Web 界面(可选)
如果你想要更友好的图形化操作界面,可以启动本地 Web 服务:
omnivoice-demo--ip 0.0.0.0--port 8001然后在浏览器中访问http://localhost:8001即可使用 Web 界面。
五、Python API 使用示例
除了命令行工具,OmniVoice 也提供了完整的 Python API:
fromomnivoiceimportOmniVoiceimporttorchimporttorchaudio# 加载模型model=OmniVoice.from_pretrained("k2-fsa/OmniVoice",device_map="cuda:0",dtype=torch.float16)# 生成音频(语音克隆)audio=model.generate(text="Hello, this is a test of zero-shot voice cloning.",ref_audio="ref.wav",ref_text="Transcription of the reference audio.",)# 保存音频(采样率 24kHz)torchaudio.save("out.wav",audio[0],24000)六、常见问题与解决方案
Q1: 首次运行时报错“模型下载失败”或连接超时
原因:HuggingFace 在国内访问可能不稳定。
解决方案:设置国内镜像源:
$env:HF_ENDPOINT ="https://hf-mirror.com"然后再运行生成命令。
Q2: 提示 CUDA 不可用
原因:PyTorch 未正确识别 GPU。
解决方案:
- 确认 NVIDIA 显卡驱动已更新到最新版本
- 确认安装了正确 CUDA 版本的 PyTorch
- 运行以下命令验证:
importtorchprint(torch.cuda.is_available())Q3: 内存不足或生成速度慢
建议:
- 使用 GPU 模式(NVIDIA 显卡,推荐 6GB 显存以上)
- 4GB 显存可运行但速度偏慢
- CPU 模式仅适合测试用途(1 秒语音约需 10 秒生成)
七、总结
OmniVoice 作为一款开源的多语言零样本语音合成模型,凭借其600+ 语言支持、40 倍实时推理速度、3 秒语音克隆等特性,在同类开源 TTS 模型中表现突出。通过本文的逐步指南,你应该已经能够在 Windows 系统上顺利完成 OmniVoice 的安装与配置。
更多信息请参考:
- GitHub 仓库
- PyPI 页面
- Hugging Face 模型页
