CrisperWhisper2.0_large实战教程:3分钟上手专业级语音识别,支持多语言与实时时间戳

CrisperWhisper2.0_large实战教程:3分钟上手专业级语音识别,支持多语言与实时时间戳
CrisperWhisper2.0_large实战教程3分钟上手专业级语音识别支持多语言与实时时间戳【免费下载链接】CrisperWhisper2.0_large项目地址: https://ai.gitcode.com/hf_mirrors/nyralabs/CrisperWhisper2.0_largeCrisperWhisper2.0_large是一款专业级语音识别工具能够提供精准的逐字记录和预期内容转录支持多语言识别与实时时间戳功能让你轻松应对各种语音转文本需求。 CrisperWhisper2.0_large核心优势CrisperWhisper2.0_large作为一款先进的语音识别模型具有以下突出特点✅ 双重转录模式满足不同需求逐字模式精确记录说话内容包括填充词、重复、口吃和 vocal 事件例如[um] so we we need to, to reschedule the th- thursday meeting to [uh] march third at nine thirty [laughter]预期模式生成清晰易读的版本自动格式化数字、日期和电子邮件等内容例如So we need to reschedule the Thursday meeting to March 3 at 9:30.⏱️ 精准的词级时间戳提供平均约30毫秒的词边界误差朗读语音和41毫秒会话语音是目前基准测试中最精确的词级时间戳系统。 多语言支持支持多种语言的逐字和预期模式转录在Nyra Verbatim Speech Benchmark基准测试中跨十种语言的不流畅F1得分领先于所有测试的闭源替代方案。 生产级推理采用CTranslate2运行时结合推测解码技术并内置缓解Whisper循环幻觉故障模式的机制确保稳定高效的语音识别体验。 性能对比在Nyra Verbatim Speech Benchmark基准测试中CrisperWhisper2.0_large表现出色#SystemDisfluency F11CrisperWhisper 2.0 Pro93.52CrisperWhisper 2.087.83ElevenLabs Scribe v279.24Microsoft MAI-Transcribe-1.577.55CrisperWhisper 1.0*64.8*CrisperWhisper 1.0仅支持英语/德语其平均值涵盖这两种语言。英语和德语使用人工标记的评估集其他八种语言使用合成逐字集。在词定时准确性方面CrisperWhisper2.0_large同样领先#SystemBoundary error1CrisperWhisper 2.029.6 ms2xAI Grok Speech-to-Text37.1 ms3CTC-seg49.3 ms4ElevenLabs Scribe v251.3 ms5NeMo-FA60.0 ms 快速安装步骤NVIDIA GPULinux安装这是最快的安装方式包含推测解码功能。只需安装NVIDIA驱动CUDA库将通过pip自动安装pip install crisperwhisper[ct2]纯PyTorch安装可在任何支持torch的环境macOS、Windows、CPU上运行pip install crisperwhisper[transformers] 3分钟快速上手基本转录from crisperwhisper import CrisperWhisperModel # 加载模型默认加载nyralabs/CrisperWhisper2.0_large model CrisperWhisperModel() # 也可选择不同大小的模型CrisperWhisperModel(turbo) # turbo / medium / small # 逐字转录默认模式包含所有填充词、重复、口吃和vocal事件 result model.transcribe(meeting.wav, languageen) print(result.text) # 预期模式生成清晰易读的版本 clean model.transcribe(meeting.wav, languageen, modeintended)获取词级时间戳# 获取词级时间戳 result model.transcribe(meeting.wav, languageen, word_timestampsTrue) for w in result.words: print(f{w.start:6.2f}-{w.end:6.2f} {w.word})升级现有转录文本# Verbatimize将现有干净转录文本升级添加音频中实际存在的不流畅表达 result model.verbatimize(clip.wav, I think we should ship it Friday.)更快的推理推测解码ct2使用小型草稿模型提出标记主模型进行验证输出相同但速度提升1.3至1.4倍model CrisperWhisperModel(large, draft_modelturbo) result model.transcribe(meeting.wav, languageen, speculative_decodingTrue) 可用模型ShorthandHuggingFace IDNoteslarge (default)nyralabs/CrisperWhisper2.0_large最佳开放质量turbonyralabs/CrisperWhisper2.0_turbo最快质量略有下降推荐作为推测草稿mediumnyralabs/CrisperWhisper2.0_medium接近large质量尺寸和质量之间的最佳权衡smallnyralabs/CrisperWhisper2.0_small最小型large_pro / turbo_pro / medium_pro / small_pronyralabs/CrisperWhisper2.0_ _proPro我们最好的模型性能提升热词增强在额外专有数据上训练标准模型根据非商业研究许可证发布可用于商业许可。Pro模型仅可通过商业许可获得。 其他功能CrisperWhisper2.0_large还提供以下实用功能OptionWhat it doesmodeverbatim / intended每次调用选择所说内容与所指内容word_timestampsTrue通过监督交叉注意力对齐获得每个词的开始/结束时间hotwords[...]偏向识别名称和罕见术语仅Pro模型model.transcribe_dual(...)一次传递中获得逐字和预期版本ct2model.verbatimize(audio, transcript)将真实的不流畅表达插入可信的干净转录文本model.forced_align(audio, text)为已有转录文本生成时间戳Longform超过30秒的音频通过条件延续无缝转录无块边界重复、丢失或拼接问题Hallucination mitigation默认开启在解码过程中检测并抑制Whisper的循环重复故障模式compute_typefloat16 / int8_float16量化 许可证信息CrisperWhisper 2.0根据组件的不同分布在两个单独的许可证下ComponentLicenseSoftware— 推理代码、预处理和后处理代码以及脚本MIT License— 宽松包括商业使用Model— 模型权重、检查点、参数、配置文件、分词器/词汇表 —以及模型生成的任何输出nyra health Non-Commercial Research License— 仅非商业使用简而言之推理代码和其他软件采用MIT许可可用于任何目的包括商业用途。只有模型权重及其生成的输出被许可用于非商业用途任何商业使用模型权重或输出都需要获得nyra health GmbH的单独商业许可。 相关资源完整文档发布文章论文模型基准测试基准测试仓库【免费下载链接】CrisperWhisper2.0_large项目地址: https://ai.gitcode.com/hf_mirrors/nyralabs/CrisperWhisper2.0_large创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考