你有没有遇到过这种场景:
跟语音助手说话,话说到一半,你意识到说错了,想纠正—— 但它已经开始"答"了,完全没听到你后半句。
你只能等它说完,重新开口。
就这一秒,你突然明白:这玩意儿根本不是在"对话",它只是在轮流说话。
01
PART
AI 终于学会 → 打断你
AI· 中断聊天有多重要?
最近,英伟达悄悄开源了一个叫NemotronLabs VoiceChat 11B的模型。
它做了一件听起来很小、但改变很大的事:
真正的全双工语音对话。
什么叫全双工?打个比方——你打电话,你能随时开口,对方也能随时说话,两边的声音可以同时传输,互不等待。这就是全双工。
但现在几乎所有语音 AI,本质上是"对讲机模式"——你按键说话,它播放回答,然后轮到你。
VoiceChat 11B 不一样。它在你说话的同时,就已经在"理解"你说的内容、准备回应了。你说到一半想打断它?它立刻让路,等你说完再接着说——响应延迟只有450 毫秒,比人类正常对话的停顿还要自然。
02
PART
AI 打断你 → 为啥这么难?
AI· 中断聊天
过去这件事为什么这么难,你可能会问:这不就是个"快一点的语音助手"吗?
不是的。
传统的 AI 语音系统,背后其实串联着三个独立的模型:
语音识别(ASR)→ 大语言模型(LLM)→ 语音合成(TTS)
你说一句话,先转成文字,文字交给大模型想答案,答案再转回语音播给你听。
这条链路每一段都要时间,加在一起,延迟动辄一两秒。更大的问题是:这三段是"串行"的,你说话时,它在等;它说话时,它不在听。打断?做不到。
VoiceChat 11B 把这三个模型合并成了一个统一架构,输入音频,直接输出音频,中间不再有拆包-重组的过程。
这不是"优化了一点",是把整个流水线推倒重来。
最颠覆的那个细节:它在说话的时候还能"查资料"
这是我觉得最有意思的地方。它支持实时工具调用(Tool Calling)——比如你问它"帮我查一下北京今天的天气",它不会停下来沉默等待,而是在你说完的瞬间,一边说"好的,我帮您查一下",一边在后台真的去调天气接口,拿到数据之后,无缝说出结果。
03
PART
AI → 打断你意味着什么?
AI· 中断聊天
你可以跟 AI 说话,就像跟一个真正有能力帮你办事的人说话一样。
不是那种"我知道答案但我只能说给你听"的工具,而是那种"我知道,我去查,我帮你搞定"的助理。
它是全球第一个开源、支持实时工具调用的全双工语音模型。
11B 参数,却在榜单排到第二
模型规模是 110 亿参数(11B),在大模型里算中等体量。
但在全双工语音模型的 VoiceBench 榜单上,它排名第二——超过了大量参数量更大的模型。在打断处理测试里,用户插话,它让位的成功率接近100%。
训练数据:约55 万小时的语音,覆盖真实录音和合成语料。
支持硬件:NVIDIA A100、H100、H200,以及 RTX 6000。普通消费级显卡跑不动,这目前还是研究者和企业部署的工具,但开源意味着门槛已经打开。
04
PART
架构和部署细节
AI· 技术探讨
这一节写给工程师和想自己跑起来的读者,不感兴趣可以跳过。
模型架构:三块拼在一起,但不是简单堆叠
VoiceChat 11B 的内部由三个组件串联,但它们被训练成一个整体端到端优化,而不是三个独立模型的拼接:
第一块是语音编码器,用的是 Fast Conformer 架构(来自英伟达自家的 Nemotron-Speech-Streaming),把 16kHz 的原始音频流实时压缩成音频 token 序列,这一步在流式状态下持续运行,不等你说完。
第二块是LLM 主干,基于 Nemotron Nano V2(9B 参数),架构上采用 Mamba 与 Transformer 的混合设计。Mamba 的优势在于处理长序列时线性复杂度,配合 Transformer 的注意力机制,在保持低延迟的同时维持对话上下文理解能力。LLM 同时预测两条输出:一条是文本 token(用于生成回答和触发工具调用),另一条走独立通道,专门输出工具调用指令,两条通道并行,不互相阻塞。
第三块是TTS 解码器,把 LLM 生成的文本 token 实时转成音频编码,最终输出 22.05kHz 的语音。由于 LLM 是流式生成 token 的,TTS 可以边收边合,不用等整句话生成完再开始发音——这是 450ms 低延迟的关键所在。
工具调用的实现方式
工具调用走的是一条独立的输出通道,与语音生成并行。当 LLM 判断需要调用工具时,会在这条通道输出标准格式的调用指令:
<TOOLCALL>[{"name": "get_weather", "arguments": {"city": "Beijing"}}]</TOOLCALL>
与此同时,语音通道继续说出预设的"占位语"(on-hold message),比如"好的,我帮您查一下",让对话不出现静默空白。工具返回结果后,模型把 JSON 格式的响应转成 TTS 友好的纯 ASCII 文本,无缝衔接进对话流。
值得注意的是:系统提示和工具响应目前只支持 ASCII,中文场景下需要在外层做一次转写处理,这是当前版本的已知限制之一。
05
PART
AI voice chat→ 基准测试
AI· 测试数据核心指标
Full-Duplex-Bench 1.0 上的核心指标:
测试项 | 得分 |
平滑轮换成功率(TOR↑) | 0.82 |
轮换延迟(↓越好) | 448ms |
用户打断成功率(TOR↑) | 1.00(满分) |
打断响应延迟(↓越好) | 480ms |
打断质量(GPT-4o 评分,满5分) | 4.33 |
工具调用方面,在 AU Harness BFCL-v3 基准上:
场景类型 | 准确率 |
单一工具调用 | 58.5% |
多工具调用 | 62.5% |
并行调用 | 42.5% |
无关请求拒绝率 | 89.6% |
并行工具调用的 42.5% 说明这块还有提升空间,但作为第一个开源实现,已经是里程碑级别的结果。
06
PART
AI voice chat → 本地如何跑
AI· 配置与教程
硬件最低要求是一张 NVIDIA A100(80GB 显存),H100/H200 是推荐配置。离线推理用 conda 环境 + vLLM 即可,流式交互部署需要拉英伟达官方容器镜像,通过 WebSocket 协议做双向音频流传输。
关键依赖版本(坑点,版本不对会报错):
PyTorch 2.10.0
Transformers 4.56.0
Mamba-ssm 2.3.2
Causal-conv1d 1.6.2
代码库在 GitHub 的 nemotron-labs-voicechat 分支,文档覆盖从环境搭建到 Triton 模型仓库生成的完整流程,比大多数开源项目的文档要详细得多。
它意味着什么
如果你是开发者,现在可以拿这个权重直接实验,GitHub 上有完整的部署文档,从离线推理到实时 WebSocket 流式对话,都有手把手的说明。
如果你只是对 AI 感兴趣——
想象一下:家里的智能音箱,终于能真正"听你说话",而不是等你说完;客服电话,再也不需要说"请等待,正在为您查询"那段令人窒息的沉默;
会开会的 AI 助手,能实时回应,能被打断,能纠正,能当场帮你查数据——这不是科幻片,VoiceChat 11B 已经做到了原型级别。
语音是人类最自然的交流方式。我们花了几十年,让计算机能"听懂"我们说什么。
现在,也许终于有机会,让它学会真正和我们说话。
更多transformer,VIT,swin tranformer 参考头条号:人工智能研究所 v号:人工智能研究Suo, 启示AI科技动画详解transformer 在线视频教程