多语言语音识别新纪元:CrisperWhisper2.0_large如何突破10种语言的精准转录难题

【免费下载链接】CrisperWhisper2.0_large 【免费下载链接】CrisperWhisper2.0_large 项目地址: https://ai.gitcode.com/hf_mirrors/nyralabs/CrisperWhisper2.0_large

在全球化沟通日益频繁的今天,语音识别技术正面临着多语言精准转录的重大挑战。CrisperWhisper2.0_large作为一款领先的语音识别模型,凭借其突破性的技术,成功解决了10种语言的精准转录难题,为用户带来了前所未有的语音转文本体验。

🌟 CrisperWhisper2.0_large:重新定义语音识别标准

CrisperWhisper2.0_large是目前生产环境中可运行的最准确的逐字语音识别系统,它具有可控性、多语言支持和单词级时间戳等强大功能。与传统语音转文本系统不同,它明确区分了“所说内容”和“所指含义”,让用户可以根据需求自由选择转录模式。

两种转录模式,满足不同需求

逐字模式,精确记录所说内容,格式统一: [um] so we we need to, to reschedule the th- thursday meeting to [uh] march third at nine thirty [laughter]

意图模式,呈现说话者想要表达的清晰版本,数字、日期和电子邮件等均按书写规范格式化: So we need to reschedule the Thursday meeting to March 3 at 9:30.

🚀 核心优势:为何选择CrisperWhisper2.0_large

单词级时间戳:精准到毫秒

CrisperWhisper2.0_large提供约30毫秒的平均边界误差(朗读语音)和41毫秒(对话语音),是目前基准测试中最精确的单词计时系统。这一精度为语音分析、字幕生成等应用提供了坚实基础。

Verbatimize功能:升级现有转录文本

给定音频和可信的清晰转录文本,模型能够逐字重现内容,并仅插入音频中实际存在的不流畅和声音事件。与重新转录相比,罕见词召回率从6.8%跃升至96.1%。这一功能将大量清晰语料库转化为逐字语料库,为TTS数据、临床语音分析和数据集构建提供了可能。

多语言支持:突破10种语言壁垒

CrisperWhisper2.0_large的逐字和意图模式适用于Whisper支持的大多数语言。在Nyra逐字语音基准测试中,它在10种语言的不流畅F1评分中位居榜首,领先于所有测试的闭源替代方案。

无缝长文本处理:告别 chunk 边界伪影

无论音频长度如何,转录过程都不会出现通常的 chunk 边界伪影。每个窗口都从已转录的单词继续(条件延续),因此在接缝处不会有重复或丢失的单词,也无需复杂的时间戳 - 令牌记录。

生产推理:高效可靠

采用CTranslate2运行时,结合推测性解码和内置的Whisper循环幻觉失败模式缓解措施,确保了模型在生产环境中的高效稳定运行。

📊 性能表现:数据说话

Nyra逐字语音基准测试对填充词、重复、中断和声音进行了单独的类型化 metrics 评分。其核心指标是不流畅F1:系统可靠地记录实际说出的不流畅,而不会编造不存在的不流畅。10种语言的平均值如下:

# 系统 不流畅F1
1 CrisperWhisper 2.0 Pro 93.5
2 CrisperWhisper 2.0 87.8
3 ElevenLabs Scribe v2 79.2
4 Microsoft MAI-Transcribe-1.5 77.5
5 CrisperWhisper 1.0* 64.8
6 Inworld STT 59.5
7 xAI Grok Speech-to-Text 42.8
8 Deepgram Nova-3 37.8
9 Fish Audio ASR 35.0
10 AssemblyAI Universal-3 Pro 30.5

*CrisperWhisper 1.0仅支持英语/德语;其平均值涵盖这两种语言。英语和德语使用人工标记的评估集;其他八种语言使用合成的逐字集。每种语言的细分以及指标的计算方法在基准测试文章中。

单词计时精度

朗读语音(TIMIT)的平均绝对单词边界误差,数值越低越好:

# 系统 边界误差
1 CrisperWhisper 2.0 29.6 ms
2 xAI Grok Speech-to-Text 37.1 ms
3 CTC-seg 49.3 ms
4 ElevenLabs Scribe v2 51.3 ms
5 NeMo-FA 60.0 ms
6 Deepgram Nova-3 63.3 ms
7 WhisperX 64.8 ms
8 Cartesia Ink-Whisper 69.4 ms
9 Canary 85.5 ms

根据每个系统正确识别的单词进行评分。如何从监督交叉注意力中提取时间,以及在对话语音上的结果,详见对齐器文章

📥 快速安装指南

NVIDIA GPU(Linux):最快,包含推测性解码

只需安装NVIDIA驱动,CUDA库将通过pip自动安装:

pip install "crisperwhisper[ct2]"

纯PyTorch:可在任何支持torch的环境运行(macOS、Windows、CPU)

pip install "crisperwhisper[transformers]"

🚀 快速开始使用

from crisperwhisper import CrisperWhisperModel

model = CrisperWhisperModel()          # 默认使用 nyralabs/CrisperWhisper2.0_large
# 也可选择不同大小的模型:CrisperWhisperModel("turbo")  # turbo / medium / small

# 逐字转录(默认):包含所有填充词、重复、口吃、错误开始和声音事件
result = model.transcribe("meeting.wav", language="en")
print(result.text)

# 意图模式:清晰可读的版本
clean = model.transcribe("meeting.wav", language="en", mode="intended")

# 单词级时间戳
result = model.transcribe("meeting.wav", language="en", word_timestamps=True)
for w in result.words:
    print(f"{w.start:6.2f}-{w.end:6.2f}  {w.word}")

# Verbatimize:将现有清晰转录文本升级,添加音频中实际存在的不流畅
result = model.verbatimize("clip.wav", "I think we should ship it Friday.")

超过30秒的音频会自动处理(见下文“功能亮点”中的长文本处理)。首次加载模型时,会从HuggingFace下载,并在ct2后端上,将其转换一次到本地缓存。

模型选择

简写 HuggingFace ID 说明
"large" (默认) nyralabs/CrisperWhisper2.0_large 最佳开源质量
"turbo" nyralabs/CrisperWhisper2.0_turbo 最快,质量略有下降;推荐作为推测性草稿
"medium" nyralabs/CrisperWhisper2.0_medium 接近large质量;在大小和质量之间的最佳权衡
"small" nyralabs/CrisperWhisper2.0_small 最小
"large_pro" / "turbo_pro" / "medium_pro" / "small_pro" nyralabs/CrisperWhisper2.0_<size>_pro Pro:我们的最佳模型,性能提升,热词增强,使用额外专有数据训练

标准模型根据非商业研究许可证发布,可用于商业许可。Pro模型仅提供商业许可。有关这两种许可,请联系我们

更快推理:推测性解码(ct2)

小型草稿模型提出令牌,主模型进行验证。输出相同,速度提高1.3到1.4倍:

model = CrisperWhisperModel("large", draft_model="turbo")
result = model.transcribe("meeting.wav", language="en",
                          speculative_decoding=True)

📦 功能亮点

以下功能均可开箱即用,详细内容在DOCS.md中有深入介绍:

选项 功能
mode="verbatim" / "intended" 每次调用选择“所说内容”与“所指含义”
word_timestamps=True 基于监督交叉注意力对齐的每个单词的开始/结束时间
hotwords=[...] 偏向识别名称和罕见术语(仅Pro模型
model.transcribe_dual(...) 一次通过获得逐字和意图转录(ct2)
model.verbatimize(audio, transcript) 将真实的不流畅插入可信的清晰转录文本
model.forced_align(audio, text) 为已有转录文本提供时间戳
长文本处理 超过30秒的音频通过条件延续无缝转录,无chunk边界重复、丢失或拼接问题
幻觉缓解 默认开启:在解码过程中检测并抑制Whisper的循环重复失败模式
compute_type="float16" / "int8_float16" 量化

🧩 工作原理

每个机制都有深入的文章介绍:

📚 文档

DOCS.md涵盖完整API:后端及其权衡、每个transcribe()选项、双模式转录、强制对齐、长文本策略、推测性K调优、幻觉修复阈值、量化、模型转换和结果对象。

📄 许可证

模型权重根据Nyra Health非商业研究许可证发布:免费用于研究和其他非商业用途;任何商业用途需要商业许可。Pro模型仅提供商业许可。有关这两种许可的商业许可,请联系Nyra

🔧 开始使用CrisperWhisper2.0_large

要开始使用这个强大的语音识别工具,只需克隆仓库:

git clone https://gitcode.com/hf_mirrors/nyralabs/CrisperWhisper2.0_large

CrisperWhisper2.0_large为多语言语音识别开启了新纪元,无论你是研究人员、开发者还是需要精准语音转录的用户,它都能满足你的需求。立即体验,感受语音识别的革命性突破!

【免费下载链接】CrisperWhisper2.0_large 【免费下载链接】CrisperWhisper2.0_large 项目地址: https://ai.gitcode.com/hf_mirrors/nyralabs/CrisperWhisper2.0_large

Logo

智能硬件社区聚焦AI智能硬件技术生态,汇聚嵌入式AI、物联网硬件开发者,打造交流分享平台,同步全国赛事资讯、开展 OPC 核心人才招募,助力技术落地与开发者成长。

更多推荐