ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

NVIDIA开源会“插嘴“语音AI:随时打断,448ms 延时,实时工具调用

NVIDIA开源会“插嘴“语音AI:随时打断,448ms 延时,实时工具调用 你有没有遇到过这种场景跟语音助手说话话说到一半你意识到说错了想纠正—— 但它已经开始答了完全没听到你后半句。你只能等它说完重新开口。就这一秒你突然明白这玩意儿根本不是在对话它只是在轮流说话。01PARTAI 终于学会 → 打断你AI· 中断聊天有多重要最近英伟达悄悄开源了一个叫NemotronLabs VoiceChat 11B的模型。它做了一件听起来很小、但改变很大的事真正的全双工语音对话。什么叫全双工打个比方——你打电话你能随时开口对方也能随时说话两边的声音可以同时传输互不等待。这就是全双工。但现在几乎所有语音 AI本质上是对讲机模式——你按键说话它播放回答然后轮到你。VoiceChat 11B 不一样。它在你说话的同时就已经在理解你说的内容、准备回应了。你说到一半想打断它它立刻让路等你说完再接着说——响应延迟只有450 毫秒比人类正常对话的停顿还要自然。02PARTAI 打断你 → 为啥这么难AI· 中断聊天过去这件事为什么这么难你可能会问这不就是个快一点的语音助手吗不是的。传统的 AI 语音系统背后其实串联着三个独立的模型语音识别ASR→ 大语言模型LLM→ 语音合成TTS你说一句话先转成文字文字交给大模型想答案答案再转回语音播给你听。这条链路每一段都要时间加在一起延迟动辄一两秒。更大的问题是这三段是串行的你说话时它在等它说话时它不在听。打断做不到。VoiceChat 11B 把这三个模型合并成了一个统一架构输入音频直接输出音频中间不再有拆包-重组的过程。这不是优化了一点是把整个流水线推倒重来。最颠覆的那个细节它在说话的时候还能查资料这是我觉得最有意思的地方。它支持实时工具调用Tool Calling——比如你问它帮我查一下北京今天的天气它不会停下来沉默等待而是在你说完的瞬间一边说好的我帮您查一下一边在后台真的去调天气接口拿到数据之后无缝说出结果。03PARTAI → 打断你意味着什么AI· 中断聊天你可以跟 AI 说话就像跟一个真正有能力帮你办事的人说话一样。不是那种我知道答案但我只能说给你听的工具而是那种我知道我去查我帮你搞定的助理。它是全球第一个开源、支持实时工具调用的全双工语音模型。11B 参数却在榜单排到第二模型规模是 110 亿参数11B在大模型里算中等体量。但在全双工语音模型的 VoiceBench 榜单上它排名第二——超过了大量参数量更大的模型。在打断处理测试里用户插话它让位的成功率接近100%。训练数据约55 万小时的语音覆盖真实录音和合成语料。支持硬件NVIDIA A100、H100、H200以及 RTX 6000。普通消费级显卡跑不动这目前还是研究者和企业部署的工具但开源意味着门槛已经打开。04PART架构和部署细节AI· 技术探讨这一节写给工程师和想自己跑起来的读者不感兴趣可以跳过。模型架构三块拼在一起但不是简单堆叠VoiceChat 11B 的内部由三个组件串联但它们被训练成一个整体端到端优化而不是三个独立模型的拼接第一块是语音编码器用的是 Fast Conformer 架构来自英伟达自家的 Nemotron-Speech-Streaming把 16kHz 的原始音频流实时压缩成音频 token 序列这一步在流式状态下持续运行不等你说完。第二块是LLM 主干基于 Nemotron Nano V29B 参数架构上采用 Mamba 与 Transformer 的混合设计。Mamba 的优势在于处理长序列时线性复杂度配合 Transformer 的注意力机制在保持低延迟的同时维持对话上下文理解能力。LLM 同时预测两条输出一条是文本 token用于生成回答和触发工具调用另一条走独立通道专门输出工具调用指令两条通道并行不互相阻塞。第三块是TTS 解码器把 LLM 生成的文本 token 实时转成音频编码最终输出 22.05kHz 的语音。由于 LLM 是流式生成 token 的TTS 可以边收边合不用等整句话生成完再开始发音——这是 450ms 低延迟的关键所在。工具调用的实现方式工具调用走的是一条独立的输出通道与语音生成并行。当 LLM 判断需要调用工具时会在这条通道输出标准格式的调用指令TOOLCALL[{name: get_weather, arguments: {city: Beijing}}]/TOOLCALL与此同时语音通道继续说出预设的占位语on-hold message比如好的我帮您查一下让对话不出现静默空白。工具返回结果后模型把 JSON 格式的响应转成 TTS 友好的纯 ASCII 文本无缝衔接进对话流。值得注意的是系统提示和工具响应目前只支持 ASCII中文场景下需要在外层做一次转写处理这是当前版本的已知限制之一。05PARTAI voice chat→ 基准测试AI· 测试数据核心指标Full-Duplex-Bench 1.0 上的核心指标测试项得分平滑轮换成功率TOR↑0.82轮换延迟↓越好448ms用户打断成功率TOR↑1.00满分打断响应延迟↓越好480ms打断质量GPT-4o 评分满5分4.33工具调用方面在 AU Harness BFCL-v3 基准上场景类型准确率单一工具调用58.5%多工具调用62.5%并行调用42.5%无关请求拒绝率89.6%并行工具调用的 42.5% 说明这块还有提升空间但作为第一个开源实现已经是里程碑级别的结果。06PARTAI voice chat → 本地如何跑AI· 配置与教程硬件最低要求是一张 NVIDIA A10080GB 显存H100/H200 是推荐配置。离线推理用 conda 环境 vLLM 即可流式交互部署需要拉英伟达官方容器镜像通过 WebSocket 协议做双向音频流传输。关键依赖版本坑点版本不对会报错PyTorch 2.10.0Transformers 4.56.0Mamba-ssm 2.3.2Causal-conv1d 1.6.2代码库在 GitHub 的 nemotron-labs-voicechat 分支文档覆盖从环境搭建到 Triton 模型仓库生成的完整流程比大多数开源项目的文档要详细得多。它意味着什么如果你是开发者现在可以拿这个权重直接实验GitHub 上有完整的部署文档从离线推理到实时 WebSocket 流式对话都有手把手的说明。如果你只是对 AI 感兴趣——想象一下家里的智能音箱终于能真正听你说话而不是等你说完客服电话再也不需要说请等待正在为您查询那段令人窒息的沉默会开会的 AI 助手能实时回应能被打断能纠正能当场帮你查数据——这不是科幻片VoiceChat 11B 已经做到了原型级别。语音是人类最自然的交流方式。我们花了几十年让计算机能听懂我们说什么。现在也许终于有机会让它学会真正和我们说话。更多transformerVITswin tranformer 参考头条号人工智能研究所 v号人工智能研究Suo, 启示AI科技动画详解transformer 在线视频教程
返回列表