多语言语音识别新纪元:CrisperWhisper2.0_large如何突破10种语言的精准转录难题
多语言语音识别新纪元:CrisperWhisper2.0_large如何突破10种语言的精准转录难题
在全球化沟通日益频繁的今天,语音识别技术正面临着多语言精准转录的重大挑战。CrisperWhisper2.0_large作为一款领先的语音识别模型,凭借其突破性的技术,成功解决了10种语言的精准转录难题,为用户带来了前所未有的语音转文本体验。
🌟 CrisperWhisper2.0_large:重新定义语音识别标准
CrisperWhisper2.0_large是目前生产环境中可运行的最准确的逐字语音识别系统,它具有可控性、多语言支持和单词级时间戳等强大功能。与传统语音转文本系统不同,它明确区分了“所说内容”和“所指含义”,让用户可以根据需求自由选择转录模式。
两种转录模式,满足不同需求
逐字模式,精确记录所说内容,格式统一:
[um] so we we need to, to reschedule the th- thursday meeting to [uh] march third at nine thirty [laughter]意图模式,呈现说话者想要表达的清晰版本,数字、日期和电子邮件等均按书写规范格式化:
So we need to reschedule the Thursday meeting to March 3 at 9:30.
🚀 核心优势:为何选择CrisperWhisper2.0_large
单词级时间戳:精准到毫秒
CrisperWhisper2.0_large提供约30毫秒的平均边界误差(朗读语音)和41毫秒(对话语音),是目前基准测试中最精确的单词计时系统。这一精度为语音分析、字幕生成等应用提供了坚实基础。
Verbatimize功能:升级现有转录文本
给定音频和可信的清晰转录文本,模型能够逐字重现内容,并仅插入音频中实际存在的不流畅和声音事件。与重新转录相比,罕见词召回率从6.8%跃升至96.1%。这一功能将大量清晰语料库转化为逐字语料库,为TTS数据、临床语音分析和数据集构建提供了可能。
多语言支持:突破10种语言壁垒
CrisperWhisper2.0_large的逐字和意图模式适用于Whisper支持的大多数语言。在Nyra逐字语音基准测试中,它在10种语言的不流畅F1评分中位居榜首,领先于所有测试的闭源替代方案。
无缝长文本处理:告别 chunk 边界伪影
无论音频长度如何,转录过程都不会出现通常的 chunk 边界伪影。每个窗口都从已转录的单词继续(条件延续),因此在接缝处不会有重复或丢失的单词,也无需复杂的时间戳 - 令牌记录。
生产推理:高效可靠
采用CTranslate2运行时,结合推测性解码和内置的Whisper循环幻觉失败模式缓解措施,确保了模型在生产环境中的高效稳定运行。
📊 性能表现:数据说话
Nyra逐字语音基准测试对填充词、重复、中断和声音进行了单独的类型化 metrics 评分。其核心指标是不流畅F1:系统可靠地记录实际说出的不流畅,而不会编造不存在的不流畅。10种语言的平均值如下:
| # | 系统 | 不流畅F1 |
|---|---|---|
| 1 | CrisperWhisper 2.0 Pro | 93.5 |
| 2 | CrisperWhisper 2.0 | 87.8 |
| 3 | ElevenLabs Scribe v2 | 79.2 |
| 4 | Microsoft MAI-Transcribe-1.5 | 77.5 |
| 5 | CrisperWhisper 1.0* | 64.8 |
| 6 | Inworld STT | 59.5 |
| 7 | xAI Grok Speech-to-Text | 42.8 |
| 8 | Deepgram Nova-3 | 37.8 |
| 9 | Fish Audio ASR | 35.0 |
| 10 | AssemblyAI Universal-3 Pro | 30.5 |
*CrisperWhisper 1.0仅支持英语/德语;其平均值涵盖这两种语言。英语和德语使用人工标记的评估集;其他八种语言使用合成的逐字集。每种语言的细分以及指标的计算方法在基准测试文章中。
单词计时精度
朗读语音(TIMIT)的平均绝对单词边界误差,数值越低越好:
| # | 系统 | 边界误差 |
|---|---|---|
| 1 | CrisperWhisper 2.0 | 29.6 ms |
| 2 | xAI Grok Speech-to-Text | 37.1 ms |
| 3 | CTC-seg | 49.3 ms |
| 4 | ElevenLabs Scribe v2 | 51.3 ms |
| 5 | NeMo-FA | 60.0 ms |
| 6 | Deepgram Nova-3 | 63.3 ms |
| 7 | WhisperX | 64.8 ms |
| 8 | Cartesia Ink-Whisper | 69.4 ms |
| 9 | Canary | 85.5 ms |
根据每个系统正确识别的单词进行评分。如何从监督交叉注意力中提取时间,以及在对话语音上的结果,详见对齐器文章。
📥 快速安装指南
NVIDIA GPU(Linux):最快,包含推测性解码
只需安装NVIDIA驱动,CUDA库将通过pip自动安装:
pip install "crisperwhisper[ct2]"
纯PyTorch:可在任何支持torch的环境运行(macOS、Windows、CPU)
pip install "crisperwhisper[transformers]"
🚀 快速开始使用
from crisperwhisper import CrisperWhisperModel
model = CrisperWhisperModel() # 默认使用 nyralabs/CrisperWhisper2.0_large
# 也可选择不同大小的模型:CrisperWhisperModel("turbo") # turbo / medium / small
# 逐字转录(默认):包含所有填充词、重复、口吃、错误开始和声音事件
result = model.transcribe("meeting.wav", language="en")
print(result.text)
# 意图模式:清晰可读的版本
clean = model.transcribe("meeting.wav", language="en", mode="intended")
# 单词级时间戳
result = model.transcribe("meeting.wav", language="en", word_timestamps=True)
for w in result.words:
print(f"{w.start:6.2f}-{w.end:6.2f} {w.word}")
# Verbatimize:将现有清晰转录文本升级,添加音频中实际存在的不流畅
result = model.verbatimize("clip.wav", "I think we should ship it Friday.")
超过30秒的音频会自动处理(见下文“功能亮点”中的长文本处理)。首次加载模型时,会从HuggingFace下载,并在ct2后端上,将其转换一次到本地缓存。
模型选择
| 简写 | HuggingFace ID | 说明 |
|---|---|---|
"large" (默认) |
nyralabs/CrisperWhisper2.0_large |
最佳开源质量 |
"turbo" |
nyralabs/CrisperWhisper2.0_turbo |
最快,质量略有下降;推荐作为推测性草稿 |
"medium" |
nyralabs/CrisperWhisper2.0_medium |
接近large质量;在大小和质量之间的最佳权衡 |
"small" |
nyralabs/CrisperWhisper2.0_small |
最小 |
"large_pro" / "turbo_pro" / "medium_pro" / "small_pro" |
nyralabs/CrisperWhisper2.0_<size>_pro |
Pro:我们的最佳模型,性能提升,热词增强,使用额外专有数据训练 |
标准模型根据非商业研究许可证发布,可用于商业许可。Pro模型仅提供商业许可。有关这两种许可,请联系我们。
更快推理:推测性解码(ct2)
小型草稿模型提出令牌,主模型进行验证。输出相同,速度提高1.3到1.4倍:
model = CrisperWhisperModel("large", draft_model="turbo")
result = model.transcribe("meeting.wav", language="en",
speculative_decoding=True)
📦 功能亮点
以下功能均可开箱即用,详细内容在DOCS.md中有深入介绍:
| 选项 | 功能 |
|---|---|
mode="verbatim" / "intended" |
每次调用选择“所说内容”与“所指含义” |
word_timestamps=True |
基于监督交叉注意力对齐的每个单词的开始/结束时间 |
hotwords=[...] |
偏向识别名称和罕见术语(仅Pro模型) |
model.transcribe_dual(...) |
一次通过获得逐字和意图转录(ct2) |
model.verbatimize(audio, transcript) |
将真实的不流畅插入可信的清晰转录文本 |
model.forced_align(audio, text) |
为已有转录文本提供时间戳 |
| 长文本处理 | 超过30秒的音频通过条件延续无缝转录,无chunk边界重复、丢失或拼接问题 |
| 幻觉缓解 | 默认开启:在解码过程中检测并抑制Whisper的循环重复失败模式 |
compute_type="float16" / "int8_float16" |
量化 |
🧩 工作原理
每个机制都有深入的文章介绍:
- 衡量逐字性:Nyra逐字语音基准测试。对填充词、重复、中断和声音的类型化指标,而非单一的WER数字。
- 我们如何大规模解锁多语言风格控制转录。跨语言的逐字/意图控制。
- 将涌现的交叉注意力转化为精确的对齐器。监督Whisper的对齐头以实现约30毫秒的单词边界。
- 使用条件延续的长文本转录。使用已转录的单词解决窗口接缝,而非复杂的时间戳令牌。
- 使用Verbatimize弥合逐字数据差距。大规模将清晰语料库升级为逐字语料库。
- 更快推理和缓解幻觉。CTranslate2堆栈、推测性解码和抗循环解码器。
📚 文档
DOCS.md涵盖完整API:后端及其权衡、每个transcribe()选项、双模式转录、强制对齐、长文本策略、推测性K调优、幻觉修复阈值、量化、模型转换和结果对象。
📄 许可证
模型权重根据Nyra Health非商业研究许可证发布:免费用于研究和其他非商业用途;任何商业用途需要商业许可。Pro模型仅提供商业许可。有关这两种许可的商业许可,请联系Nyra。
🔧 开始使用CrisperWhisper2.0_large
要开始使用这个强大的语音识别工具,只需克隆仓库:
git clone https://gitcode.com/hf_mirrors/nyralabs/CrisperWhisper2.0_large
CrisperWhisper2.0_large为多语言语音识别开启了新纪元,无论你是研究人员、开发者还是需要精准语音转录的用户,它都能满足你的需求。立即体验,感受语音识别的革命性突破!
更多推荐
所有评论(0)