ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

实测Audio8-ASR-0.1B语音识别效果:WER低至2.7%的技术突破

实测Audio8-ASR-0.1B语音识别效果:WER低至2.7%的技术突破 实测Audio8-ASR-0.1B语音识别效果WER低至2.7%的技术突破【免费下载链接】Audio8-ASR-0.1B项目地址: https://ai.gitcode.com/hf_mirrors/Audio8/Audio8-ASR-0.1BAudio8-ASR-0.1B是一款紧凑型自回归语音识别模型其语言模型组件仅含0.1B参数却支持中文、英文、法语、德语、日语、韩语及粤语等多语言语音识别是LLM时代最小可用的高性能ASR模型之一。语音识别技术的革命性突破在语音识别领域模型性能与体量往往难以兼得。Audio8-ASR-0.1B却以0.1B的语言模型参数实现了令人惊叹的识别精度为行业树立了新标杆。低至2.7%的WER值在Open ASR Leaderboard评测中Audio8-ASR-0.1B展现出卓越性能。其中在LibriSpeech test.clean数据集上词错误率WER仅为2.70%。该模型在多个数据集上均有出色表现AMI CleanedWER 10.99%Earnings22WER 12.31%GigaSpeech CleanedWER 8.48%LibriSpeech test.otherWER 6.59%SPGISpeechWER 3.73%VoxPopuli Cleaned AAWER 4.39%七项公开数据集的平均WER低至7.03%充分彰显了其在语音识别任务上的强大能力。模型架构解析Audio8-ASR-0.1B的出色性能源于其精心设计的架构核心组件任务自动语音识别解码器8层Qwen风格因果语言模型音频前端Qwen3-ASR音频编码器MLP适配器/投影器语言模型参数103,502,336约0.104B端到端唯一参数323,990,528约0.324B运行时Hugging Face Transformers创新设计该模型巧妙融合了高效的音频编码与紧凑的语言模型在保证识别精度的同时显著降低了参数量为在资源受限设备上部署高性能语音识别模型开辟了新路径。简单易用的部署与使用快速开始使用Transformer进行推理的代码示例简单直观只需几行代码即可实现语音转文字功能import torch from transformers import AutoModelForCausalLM, AutoProcessor model_path AutoArk-AI/Audio8-ASR-0.1B audio_path path/to/audio.wav device cuda if torch.cuda.is_available() else cpu torch_dtype torch.bfloat16 if device cuda else torch.float32 processor AutoProcessor.from_pretrained(model_path, trust_remote_codeTrue) model AutoModelForCausalLM.from_pretrained( model_path, trust_remote_codeTrue, torch_dtypetorch_dtype, attn_implementationeager, ).to(device) model.eval() # 后续代码省略...也可直接使用项目提供的示例脚本python examples/transcribe.py path/to/audio.wav --model AutoArk-AI/Audio8-ASR-0.1B热词增强功能Audio8-ASR-0.1B还支持解码时的热词增强功能无需微调即可提升特定词汇的识别准确率python examples/transcribe_hotword.py path/to/audio.wav \ --model AutoArk-AI/Audio8-ASR-0.1B \ --hotwords Audio8,AutoArk多场景部署方案除基础模型外项目还提供了面向不同场景的部署版本Audio8-ASR-0.1B-onnx-runtime专为边缘设备部署设计峰值内存占用约1.1GBAudio8-ASR-0.1B-iOS-ANE针对iPhone本地转录优化峰值运行时内存占用约200MB如何获取与使用要开始使用Audio8-ASR-0.1B可通过以下步骤克隆仓库git clone https://gitcode.com/hf_mirrors/Audio8/Audio8-ASR-0.1B项目文件结构清晰包含模型配置、代码实现及示例脚本等关键文件如modeling_arkasr.py模型实现代码processing_arkasr.py处理逻辑代码examples/transcribe.py转录示例脚本hotword/热词相关代码总结Audio8-ASR-0.1B以其0.1B的语言模型参数实现了低至2.7%的WER值在性能与效率之间取得了完美平衡。其多语言支持、简单易用的接口及多样化的部署方案使其成为语音识别应用的理想选择为开发者和用户带来了前所未有的语音识别体验。无论是在边缘设备还是移动平台Audio8-ASR-0.1B都展现出了强大的潜力无疑是语音识别技术领域的一项重要突破。【免费下载链接】Audio8-ASR-0.1B项目地址: https://ai.gitcode.com/hf_mirrors/Audio8/Audio8-ASR-0.1B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表