ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Audio8 ASR Infinite 架构深度解析:Voxtral 音频塔 + Qwen2.5 解码器的流式设计

Audio8 ASR Infinite 架构深度解析:Voxtral 音频塔 + Qwen2.5 解码器的流式设计 Audio8 ASR Infinite 架构深度解析Voxtral 音频塔 Qwen2.5 解码器的流式设计【免费下载链接】Audio8-ASR-Infinite项目地址: https://ai.gitcode.com/hf_mirrors/Edge0/Audio8-ASR-InfiniteAudio8 ASR Infinite是一个开源的原生流式语音识别Streaming ASR模型由 Voxtral Realtime 音频塔与 Qwen2.5-3B 文本解码器组合而成配合 Rolling KV Cache可实现不限长度的 24/7 实时转写且内存与延迟保持恒定。它支持 80/120/160 ms 三档可选择的音频时钟、240–560 ms 可配置的转写延迟中英双语输出并内置语义 VAD语音活动检测头。下面用一篇文章带你读懂它的流式架构设计。为什么需要「流式语音识别」传统离线 ASR 需要等音频录完再处理而流式识别一边听一边出字适合会议实时字幕、实时对话、24/7 监控录音等场景。Audio8 ASR Infinite 针对流式场景做了三项关键设计能力说明⚡ 超快响应原生流式架构80 ms 时钟下每秒解码 12.5 次♾️ 不限长度Rolling KV Cache 让内存和延迟在长期运行中保持恒定️ 时钟可选80/120/160 ms 三档音频时钟对应 12.5 / 8.3 / 6.25 次文本决策/秒⏱️ 延迟可调target_delay_ms可在 240–560 ms 之间权衡速度与准确率 语义 VAD区分「思考停顿」「口吃」与「真正的轮次结束」传统声学 VAD 在此容易失效架构总览三部件的流式流水线整个模型是一条单向流水线音频 → 音频塔 → 投影器 → Qwen 解码器 → 文本。各部件的初始权重与训练情况如下见 README.md组件初始权重是否训练Causal Audio Tower音频塔Voxtral Realtime 4B✅Audio Projector投影器随机初始化✅Frame Length Embedding帧长嵌入随机初始化✅Decoder解码器Qwen2.5-3B-Instruct✅LM HeadQwen2.5-3B-Instruct✅具体规格可查 config.json音频塔32 层、hidden 1280、128 mel bins、sliding window 750config.json#L5-L27特征提取器为 16 kHz / 128 mel 的VoxtralRealtimeFeatureExtractorpreprocessor_config.json解码器36 层、hidden 2048、16 个 query 头 / 2 个 KV 头GQA词表 151936config.json#L91-L159投影器max frame len 8 → 投影维度 10240激活函数 geluconfig.json#L64-L65权重文件约 8.17 GB 的 model.safetensorsbfloat16权重分片索引见 model.safetensors.index.json。流式解码器层Voxtral 风格延迟调制与普通 LLM 不同音频塔的每个 decoder 层Qwen2RealtimeV1DecoderLayer/Qwen3RealtimeV1DecoderLayer在 attention 之后、MLP 之前插入了一层AdaRMSNorm 时间调制把「当前延迟了多少个 token」编码成t_cond按层缩放隐状态。这个设计的核心逻辑在 modeling_audio8_asr_infinite.py文件头部注释也点明了机制num_delay_tokens - sinusoidal time embedding - per-layer adaptive MLP - post-attention hidden scaling也就是说模型不是「被动地」知道当前处于流的哪个位置而是每个解码层都显式感知「延迟时间」这正是它能在流中稳定输出、不漂移的关键。帧长嵌入一套权重三档时钟模型同时支持 4/6/8 三种 frame_len对应 80/120/160 ms 时钟。为了让一个共享的投影器同时服务三档时钟configuration_audio8_asr_infinite.py 启用了use_frame_len_embedding用一段可学习嵌入把「当前用了哪档帧长」信息加到时间嵌入上modeling_audio8_asr_infinite.py#L1074-L1089。音频时钟与转写延迟如何选参数这是使用者最关心的一步。frame_len决定时钟档位target_delay_ms决定「牺牲多少延迟换准确率」且delay 必须是时钟的整数倍。各档位的已训练最优组合如下音频时钟frame_len左填充 token 数可选target_delay_ms80 ms418240 / 320 / 480 / 560120 ms612240 / 480160 ms89320 / 480换算关系delay 毫秒 ÷ 时钟毫秒 延迟 token 数直接写在 config.json#L46-L61 的num_delay_tokens_by_frame_len中配置类的参数校验逻辑见 configuration_audio8_asr_infinite.py#L208-L224。新手建议追求低延迟选 80 ms 240 ms delay追求准确率选 80 ms 480 ms delay下文评测即此配置。Rolling KV Cache24/7 转写不漂移该 checkpoint 的原生上下文只有 30 秒但适配版 vLLM 通过Rolling KV Cache 精确 RoPE 重基re-basing让缓存窗口不断滚动从而在连续数小时的音频上保持内存与延迟有界README.md#L189-L191。部署上推荐 Docker Compose 一键启动同一个 socket 还提供网页实时演示和 WebSocket 客户端README.md#L164-L191。语义 VAD不止是「有声音 / 没声音」除了转写本仓库还附带一组独立的语义 VAD 头权重semantic_vad_heads.safetensors。它在文本主干的最终隐状态上挂了 4 个分类器分别预测未来 0.5 / 1.0 / 2.0 / 3.0 秒内会出现多少个语义单元8 分类第 0 类即「轮次结束」配置见 config.json#L66-L72挂载逻辑在 modeling_audio8_asr_infinite.py#L585-L624。相比传统声学 VAD它能区分「用户还在思考的停顿」「口吃」和「真的说完了」对实时对话的产品体验提升很大。评测表现80 ms 时钟 480 ms 延迟下的硬指标在贪心解码、80 ms 时钟、target_delay_ms 480的设置下README.md#L100-L112测试集指标Audio8 ASR InfiniteVoxtral-Mini-4B-Realtimenemotron-3.5-asr-streamingaishell1/testCER1.75016.79512.927 560msaishell4/testCER2.89316.45614.677 560mslibrispeech test.cleanWER3.0422.2103.353 560mslibrispeech test.otherWER6.8085.5527.140 560ms平均3.62310.2539.524中文场景优势非常明显aishell1 CER 从 16.795 降到 1.750英文场景与 Voxtral 各有胜负整体平均分 3.623 显著领先。仓库文件速查文件作用config.json音频塔 / 解码器 / 流式时钟等全部超参configuration_audio8_asr_infinite.py配置类含帧长与 delay 的解析校验modeling_audio8_asr_infinite.py模型主体音频塔 投影器 流式解码层 语义 VADmodel.safetensors合并后的主权重约 8.17 GBbfloat16semantic_vad_heads.safetensors语义 VAD 头权重4 个时间尺度 × 8 类tokenizer_config.jsonQwen2 分词器及[STREAMING_PAD]、[LANGUAGE_ZH]等流式专用 tokenpreprocessor_config.json16 kHz / 128 mel 音频特征提取参数chat_template.jinja对话模板小结Audio8 ASR Infinite 用「Voxtral 因果音频塔 帧长感知投影器 Qwen2.5 解码器」的三件套加上按层感知的延迟时间嵌入和Rolling KV Cache把「实时性、准确率、无限时长」这三件通常难以兼得的事捏在了一起。对新手而言上手只需三步选时钟档位 → 定target_delay_ms→ 用 vLLM 或 Torch 模拟流式解码跑通第一条转写。想深入细节直接读 modeling_audio8_asr_infinite.py 的build_t_cond与forward两个方法即可抓住核心。【免费下载链接】Audio8-ASR-Infinite项目地址: https://ai.gitcode.com/hf_mirrors/Edge0/Audio8-ASR-Infinite创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表