NVIDIA开源会“插嘴“语音AI:随时打断,448ms 延时,实时工具调用
2026/9/17 2:19:09 网站建设 项目流程

你有没有遇到过这种场景:

跟语音助手说话,话说到一半,你意识到说错了,想纠正—— 但它已经开始"答"了,完全没听到你后半句。

你只能等它说完,重新开口。

就这一秒,你突然明白:这玩意儿根本不是在"对话",它只是在轮流说话。

01

PART

AI 终于学会 → 打断你

AI· 中断聊天有多重要?

最近,英伟达悄悄开源了一个叫NemotronLabs VoiceChat 11B的模型。

它做了一件听起来很小、但改变很大的事:

真正的全双工语音对话。

什么叫全双工?打个比方——你打电话,你能随时开口,对方也能随时说话,两边的声音可以同时传输,互不等待。这就是全双工。

但现在几乎所有语音 AI,本质上是"对讲机模式"——你按键说话,它播放回答,然后轮到你。

VoiceChat 11B 不一样。它在你说话的同时,就已经在"理解"你说的内容、准备回应了。你说到一半想打断它?它立刻让路,等你说完再接着说——响应延迟只有450 毫秒,比人类正常对话的停顿还要自然。

02

PART

AI 打断你 → 为啥这么难?

AI· 中断聊天

过去这件事为什么这么难,你可能会问:这不就是个"快一点的语音助手"吗?

不是的。

传统的 AI 语音系统,背后其实串联着三个独立的模型:

语音识别(ASR)→ 大语言模型(LLM)→ 语音合成(TTS)

你说一句话,先转成文字,文字交给大模型想答案,答案再转回语音播给你听。

这条链路每一段都要时间,加在一起,延迟动辄一两秒。更大的问题是:这三段是"串行"的,你说话时,它在等;它说话时,它不在听。打断?做不到。

VoiceChat 11B 把这三个模型合并成了一个统一架构,输入音频,直接输出音频,中间不再有拆包-重组的过程。

这不是"优化了一点",是把整个流水线推倒重来

最颠覆的那个细节:它在说话的时候还能"查资料"

这是我觉得最有意思的地方。它支持实时工具调用(Tool Calling)——比如你问它"帮我查一下北京今天的天气",它不会停下来沉默等待,而是在你说完的瞬间,一边说"好的,我帮您查一下",一边在后台真的去调天气接口,拿到数据之后,无缝说出结果。

03

PART

AI → 打断你意味着什么?

AI· 中断聊天

你可以跟 AI 说话,就像跟一个真正有能力帮你办事的人说话一样。

不是那种"我知道答案但我只能说给你听"的工具,而是那种"我知道,我去查,我帮你搞定"的助理。

它是全球第一个开源、支持实时工具调用的全双工语音模型。

11B 参数,却在榜单排到第二

模型规模是 110 亿参数(11B),在大模型里算中等体量。

但在全双工语音模型的 VoiceBench 榜单上,它排名第二——超过了大量参数量更大的模型。在打断处理测试里,用户插话,它让位的成功率接近100%

训练数据:约55 万小时的语音,覆盖真实录音和合成语料。

支持硬件:NVIDIA A100、H100、H200,以及 RTX 6000。普通消费级显卡跑不动,这目前还是研究者和企业部署的工具,但开源意味着门槛已经打开。

04

PART

架构和部署细节

AI· 技术探讨

这一节写给工程师和想自己跑起来的读者,不感兴趣可以跳过。

模型架构:三块拼在一起,但不是简单堆叠

VoiceChat 11B 的内部由三个组件串联,但它们被训练成一个整体端到端优化,而不是三个独立模型的拼接:

第一块是语音编码器,用的是 Fast Conformer 架构(来自英伟达自家的 Nemotron-Speech-Streaming),把 16kHz 的原始音频流实时压缩成音频 token 序列,这一步在流式状态下持续运行,不等你说完。

第二块是LLM 主干,基于 Nemotron Nano V2(9B 参数),架构上采用 Mamba 与 Transformer 的混合设计。Mamba 的优势在于处理长序列时线性复杂度,配合 Transformer 的注意力机制,在保持低延迟的同时维持对话上下文理解能力。LLM 同时预测两条输出:一条是文本 token(用于生成回答和触发工具调用),另一条走独立通道,专门输出工具调用指令,两条通道并行,不互相阻塞。

第三块是TTS 解码器,把 LLM 生成的文本 token 实时转成音频编码,最终输出 22.05kHz 的语音。由于 LLM 是流式生成 token 的,TTS 可以边收边合,不用等整句话生成完再开始发音——这是 450ms 低延迟的关键所在。

工具调用的实现方式

工具调用走的是一条独立的输出通道,与语音生成并行。当 LLM 判断需要调用工具时,会在这条通道输出标准格式的调用指令:

<TOOLCALL>[{"name": "get_weather", "arguments": {"city": "Beijing"}}]</TOOLCALL>

与此同时,语音通道继续说出预设的"占位语"(on-hold message),比如"好的,我帮您查一下",让对话不出现静默空白。工具返回结果后,模型把 JSON 格式的响应转成 TTS 友好的纯 ASCII 文本,无缝衔接进对话流。

值得注意的是:系统提示和工具响应目前只支持 ASCII,中文场景下需要在外层做一次转写处理,这是当前版本的已知限制之一。

05

PART

AI voice chat→ 基准测试

AI· 测试数据核心指标

Full-Duplex-Bench 1.0 上的核心指标:

测试项

得分

平滑轮换成功率(TOR↑)

0.82

轮换延迟(↓越好)

448ms

用户打断成功率(TOR↑)

1.00(满分)

打断响应延迟(↓越好)

480ms

打断质量(GPT-4o 评分,满5分)

4.33

工具调用方面,在 AU Harness BFCL-v3 基准上:

场景类型

准确率

单一工具调用

58.5%

多工具调用

62.5%

并行调用

42.5%

无关请求拒绝率

89.6%

并行工具调用的 42.5% 说明这块还有提升空间,但作为第一个开源实现,已经是里程碑级别的结果。

06

PART

AI voice chat → 本地如何跑

AI· 配置与教程

硬件最低要求是一张 NVIDIA A100(80GB 显存),H100/H200 是推荐配置。离线推理用 conda 环境 + vLLM 即可,流式交互部署需要拉英伟达官方容器镜像,通过 WebSocket 协议做双向音频流传输。

关键依赖版本(坑点,版本不对会报错):

  • PyTorch 2.10.0

  • Transformers 4.56.0

  • Mamba-ssm 2.3.2

  • Causal-conv1d 1.6.2

代码库在 GitHub 的 nemotron-labs-voicechat 分支,文档覆盖从环境搭建到 Triton 模型仓库生成的完整流程,比大多数开源项目的文档要详细得多。

它意味着什么

如果你是开发者,现在可以拿这个权重直接实验,GitHub 上有完整的部署文档,从离线推理到实时 WebSocket 流式对话,都有手把手的说明。

如果你只是对 AI 感兴趣——

想象一下:家里的智能音箱,终于能真正"听你说话",而不是等你说完;客服电话,再也不需要说"请等待,正在为您查询"那段令人窒息的沉默;

会开会的 AI 助手,能实时回应,能被打断,能纠正,能当场帮你查数据——这不是科幻片,VoiceChat 11B 已经做到了原型级别。

语音是人类最自然的交流方式。我们花了几十年,让计算机能"听懂"我们说什么。

现在,也许终于有机会,让它学会真正和我们说话

更多transformer,VIT,swin tranformer 参考头条号:人工智能研究所 v号:人工智能研究Suo, 启示AI科技

动画详解transformer 在线视频教程


需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询