当前位置: 首页 > news >正文

CrisperWhisper2.0_large实战教程:3分钟上手专业级语音识别,支持多语言与实时时间戳

CrisperWhisper2.0_large实战教程:3分钟上手专业级语音识别,支持多语言与实时时间戳

【免费下载链接】CrisperWhisper2.0_large项目地址: https://ai.gitcode.com/hf_mirrors/nyralabs/CrisperWhisper2.0_large

CrisperWhisper2.0_large是一款专业级语音识别工具,能够提供精准的逐字记录和预期内容转录,支持多语言识别与实时时间戳功能,让你轻松应对各种语音转文本需求。

🌟 CrisperWhisper2.0_large核心优势

CrisperWhisper2.0_large作为一款先进的语音识别模型,具有以下突出特点:

✅ 双重转录模式,满足不同需求

  • 逐字模式:精确记录说话内容,包括填充词、重复、口吃和 vocal 事件,例如:[um] so we we need to, to reschedule the th- thursday meeting to [uh] march third at nine thirty [laughter]
  • 预期模式:生成清晰易读的版本,自动格式化数字、日期和电子邮件等内容,例如:So we need to reschedule the Thursday meeting to March 3 at 9:30.

⏱️ 精准的词级时间戳

提供平均约30毫秒的词边界误差(朗读语音)和41毫秒(会话语音),是目前基准测试中最精确的词级时间戳系统。

🌍 多语言支持

支持多种语言的逐字和预期模式转录,在Nyra Verbatim Speech Benchmark基准测试中,跨十种语言的不流畅F1得分领先于所有测试的闭源替代方案。

🚀 生产级推理

采用CTranslate2运行时,结合推测解码技术,并内置缓解Whisper循环幻觉故障模式的机制,确保稳定高效的语音识别体验。

📊 性能对比

在Nyra Verbatim Speech Benchmark基准测试中,CrisperWhisper2.0_large表现出色:

#SystemDisfluency F1
1CrisperWhisper 2.0 Pro93.5
2CrisperWhisper 2.087.8
3ElevenLabs Scribe v279.2
4Microsoft MAI-Transcribe-1.577.5
5CrisperWhisper 1.0*64.8

*CrisperWhisper 1.0仅支持英语/德语;其平均值涵盖这两种语言。英语和德语使用人工标记的评估集;其他八种语言使用合成逐字集。

在词定时准确性方面,CrisperWhisper2.0_large同样领先:

#SystemBoundary error
1CrisperWhisper 2.029.6 ms
2xAI Grok Speech-to-Text37.1 ms
3CTC-seg49.3 ms
4ElevenLabs Scribe v251.3 ms
5NeMo-FA60.0 ms

📥 快速安装步骤

NVIDIA GPU(Linux)安装

这是最快的安装方式,包含推测解码功能。只需安装NVIDIA驱动,CUDA库将通过pip自动安装:

pip install "crisperwhisper[ct2]"

纯PyTorch安装

可在任何支持torch的环境(macOS、Windows、CPU)上运行:

pip install "crisperwhisper[transformers]"

🚀 3分钟快速上手

基本转录

from crisperwhisper import CrisperWhisperModel # 加载模型(默认加载nyralabs/CrisperWhisper2.0_large) model = CrisperWhisperModel() # 也可选择不同大小的模型:CrisperWhisperModel("turbo") # turbo / medium / small # 逐字转录(默认模式):包含所有填充词、重复、口吃和vocal事件 result = model.transcribe("meeting.wav", language="en") print(result.text) # 预期模式:生成清晰易读的版本 clean = model.transcribe("meeting.wav", language="en", mode="intended")

获取词级时间戳

# 获取词级时间戳 result = model.transcribe("meeting.wav", language="en", word_timestamps=True) for w in result.words: print(f"{w.start:6.2f}-{w.end:6.2f} {w.word}")

升级现有转录文本

# Verbatimize:将现有干净转录文本升级,添加音频中实际存在的不流畅表达 result = model.verbatimize("clip.wav", "I think we should ship it Friday.")

更快的推理:推测解码(ct2)

使用小型草稿模型提出标记,主模型进行验证,输出相同但速度提升1.3至1.4倍:

model = CrisperWhisperModel("large", draft_model="turbo") result = model.transcribe("meeting.wav", language="en", speculative_decoding=True)

🧩 可用模型

ShorthandHuggingFace IDNotes
"large" (default)nyralabs/CrisperWhisper2.0_large最佳开放质量
"turbo"nyralabs/CrisperWhisper2.0_turbo最快,质量略有下降;推荐作为推测草稿
"medium"nyralabs/CrisperWhisper2.0_medium接近large质量;尺寸和质量之间的最佳权衡
"small"nyralabs/CrisperWhisper2.0_small最小型
"large_pro" / "turbo_pro" / "medium_pro" / "small_pro"nyralabs/CrisperWhisper2.0_ _proPro:我们最好的模型,性能提升,热词增强,在额外专有数据上训练

标准模型根据非商业研究许可证发布,可用于商业许可。Pro模型仅可通过商业许可获得。

📦 其他功能

CrisperWhisper2.0_large还提供以下实用功能:

OptionWhat it does
mode="verbatim" / "intended"每次调用选择"所说内容"与"所指内容"
word_timestamps=True通过监督交叉注意力对齐获得每个词的开始/结束时间
hotwords=[...]偏向识别名称和罕见术语(仅Pro模型)
model.transcribe_dual(...)一次传递中获得逐字和预期版本(ct2)
model.verbatimize(audio, transcript)将真实的不流畅表达插入可信的干净转录文本
model.forced_align(audio, text)为已有转录文本生成时间戳
Longform超过30秒的音频通过条件延续无缝转录,无块边界重复、丢失或拼接问题
Hallucination mitigation默认开启:在解码过程中检测并抑制Whisper的循环重复故障模式
compute_type="float16" / "int8_float16"量化

📜 许可证信息

CrisperWhisper 2.0根据组件的不同分布在两个单独的许可证下:

ComponentLicense
Software— 推理代码、预处理和后处理代码以及脚本MIT License— 宽松,包括商业使用
Model— 模型权重、检查点、参数、配置文件、分词器/词汇表 —以及模型生成的任何输出nyra health Non-Commercial Research License— 仅非商业使用

简而言之:推理代码和其他软件采用MIT许可,可用于任何目的,包括商业用途。只有模型权重及其生成的输出被许可用于非商业用途;任何商业使用模型权重或输出都需要获得nyra health GmbH的单独商业许可。

📚 相关资源

  • 完整文档
  • 发布文章
  • 论文
  • 模型
  • 基准测试
  • 基准测试仓库

【免费下载链接】CrisperWhisper2.0_large项目地址: https://ai.gitcode.com/hf_mirrors/nyralabs/CrisperWhisper2.0_large

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

http://www.cnnetsun.cn/news/3773451.html

相关文章:

  • 3分钟免费解锁付费墙:13ft Ladder自托管工具完整指南
  • Redis 月度运维日志:向量搜索服务的监控数据、告警处理和优化记录
  • 月度检索技术前沿速递:7 月向量检索领域的重要突破和技术趋势
  • 分布式共识协议学习的十步法:从理论到代码到生产运维的系统化进阶路径
  • 如何在OBS直播中免费实现专业级视觉效果:StreamFX插件完整指南
  • 如何使用Landsat-util快速获取高分辨率卫星影像?5分钟上手教程
  • 信号与系统-数学公式
  • 为什么选择RxOptional?解决Swift开发中可空值处理痛点
  • 智能文件伪装神器apate:3分钟掌握格式转换新革命
  • 高频交易C++工程师:我用LLM做策略语义分析,量化背景成了最硬的敲门砖
  • 安卓通讯数据守护者:SMS Backup+ 如何安全备份你的数字记忆
  • GitHub Action协作发推神器:Twitter, together!工作原理解析
  • 图书馆智能书法体验台:落地场景与技术实现要点拆解
  • x86 汇编中的 Fall-through
  • 可靠性测试项目之可靠性试验
  • Claudia检查点技术:代码状态快照与差异对比的终极指南
  • 2026老旧社区智能化改造选型指南:从技术路径到落地效果全解析
  • 突破马里奥关卡:mario-ai空间变换器网络原理与实现
  • decentralized_agent.py
  • HarmonyOS 上架审核材料实战:权限、隐私、截图与测试账号一次准备清楚
  • Skywork-Reward-V2-Qwen3-8B分布式部署教程:SGLang实现高吞吐量推理
  • OpenControl源码探秘:核心组件设计与AI工具调用实现原理
  • IRust与Jupyter集成:打造强大的Rust数据分析工作流
  • 抖音批量下载神器:douyin-downloader完整指南,告别手动下载烦恼
  • 如何用metrics-spring监控Spring应用?5分钟快速上手教程
  • 10个你必须知道的analyze-css指标:让CSS性能优化事半功倍
  • 2026天津geo优化服务商有哪些?广拓时代解析本地企业AI搜索增长的落地路径
  • foobox-cn:5分钟打造你的专属音乐播放中心
  • 【单片机毕设案例分享】基于单片机的管道水压异常声光报警装置 基于嵌入式技术的水压阈值自定义监测系统(015401)
  • 【单片机毕设案例分享】基于 STM32 的图书馆 IC 卡增删管理与座位提示装置 嵌入式红外传感图书馆智能门禁座位一体化系统设计(015501)