郭震 AI公众号:郭震AI

实时 AI 消息

NVIDIA 开源 Nemotron 3 Diarization,实时多说话人转写再进一步

NVIDIA 在 Hugging Face 发布开放权重的 1 亿参数模型 Nemotron 3 Diarization,可在流式与离线音频中标出最多八位说话人的发言时段。官方称其在 VoiceArena 的 Diarization-Bench 上以 14.72% 的错误率排名第一,1.04 秒延迟下相较上一代四说话人流式模型平均降低约 40% 错误率。

发布时间
NVIDIA 开源 Nemotron 3 Diarization,实时多说话人转写再进一步
图源: huggingface.co

NVIDIA 于 9 月 23 日在 Hugging Face 博客发布 Nemotron 3 Diarization,这是一个开放权重的 1 亿参数说话人日志(diarization)模型,用于在流式对话与录制音频中标出"谁在什么时间说话"。官方称它在 VoiceArena 的 Diarization-Bench 上排名第一,说话人日志错误率(DER)为 14.72%,支持最多八位说话人。

说话人日志解决的是转写之外的另一半问题。语音识别只给出文字,日志则给出每位说话人的活动时间区间,包括多人同时说话的片段;两者结合,才能得到带说话人归属的转写。缺了这层归属,会议、客服通话与播客的转写虽然每个字都对,却无法判断谁做出了承诺、谁提出了反对、谁打断了谁,搜索、摘要、待办提取与语音 Agent 的记忆都会因此打折。

官方特别强调,独立日志与"带说话人归属的语音识别"是两个任务:日志产出的是说话人活动与时间戳,不含文字;语音识别产出文字但不保证归属。评估时必须分别考察两个组件以及组合后的流水线。

在模型结构上,Nemotron 3 Diarization 沿用 Sortformer 的"按出现顺序排序"思路,把最先出现的新声音固定为第一条说话人通道,从而让说话人标签在分块推理中保持稳定。模型接收 16kHz 单声道音频,转换为 10 毫秒步长的梅尔频谱特征并按 8 帧堆叠为 80 毫秒帧,送入带旋转位置编码(RoPE)的 31 层 Transformer 编码器,再由 Conv1D 上采样回输入分辨率,默认输出 T×8 的概率张量,每一格表示某位说话人在该时刻处于活动状态,因此重叠说话可以自然地由多条通道同时被激活来表达。

流式推理依赖两类记忆:到达顺序说话人缓存(AOSC)保存此前分块中说话人的信息,先进先出队列提供最近若干帧的上下文,输入缓冲还包含当前分块之后的右上下文。模型提供 30.4 秒、1.04 秒、0.64 秒与 0.32 秒等推荐缓冲延迟档位,缓冲越短响应越快,上下文越多通常越准。

基准结果方面,VoiceArena 首版 Diarization-Bench 在 139 段英文对话、约 22 小时录音上评估了 12 个系统、17 种系统配置,并在计入重叠语音、使用系统自带语音活动检测、不设边界宽容(0 毫秒 collar)的条件下打分,Nemotron 3 Diarization 以 14.72% 的 DER 排第一,第二名是 19.3%,相对降低约 24%;在 100 毫秒与 250 毫秒 collar 以及线下、线上录音分类中同样排名第一。

与 NVIDIA 上一代四说话人流式模型 diar_streaming_sortformer_4spk-v2.1 相比,在 1.04 秒输入缓冲延迟下,新模型在全部八个评测条件上都降低了 DER,相对降幅从 CALLHOME-Part2 的 9.0% 到 NOTSOFAR1 MHM 的 65.2%,八项相对降幅的未加权平均约为 40%。

官方也保留了对自己不利的数据:在两说话人 CALLHOME 子集上,新模型为 5.98%,略高于旧基线的 5.68%;不过在整个 CALLHOME-Part2 上 DER 从 10.32% 改善到 9.10%,高说话人数子集收益更大。另外,DIHARD III 的汇总包含五到九位说话人的录音,其中九人已超出模型支持的八人上限。需要说明的是,模型输出的说话人编号是匿名标签,不等于真实身份,下游需要结合会议元数据或说话人验证模型才能映射到具体的人。

训练数据方面,模型使用了公开与授权语音数据,包括授权自 David AI 的多说话人真实对话,以及覆盖 21 种语言的模拟英文与多语言混合数据;加入 David AI 数据后,在离线与超低延迟两种工作点下复合 DER 从 11.19% 降到 10.42%,绝对下降 0.77 个百分点。模型可配合 NVIDIA NeMo Speech 工具链使用,官方给出了流式日志叠加流式语音识别、离线日志、延迟-质量权衡与日志结合离线识别的具体做法。

对产品而言,这条路线意味着端侧也能做实时、带说话人归属的转写,语音 Agent 的会话记忆、会议纪要的待办归属、客服质检的责任划分都可以建立在同一层能力上。需要留意的是,VoiceArena 的完整 v1 评估与配对统计分析仍在进行,当前排名可能随评估完善而变化。

为什么重要

说话人归属是把语音转写变成可检索、可追责数据的必要一层,模型开放权重并支持端侧实时推理,会直接抬升会议纪要、语音 Agent 记忆和客服质检等应用的基线能力。

微博邮件

NVIDIASpeech AIOpen Source
返回实时消息

附近消息

全部

09/23 21:05

通义千问发布 Qwen-Audio-3.1 音频模型

据新浪财经 9 月 23 日的 AI 行业动态汇总,通义千问发布 Qwen-Audio-3.1,这是千问音频模型系列的一次版本迭代。目前公开信息只确认了发布动作,参数规模、支持语言与开放方式等细节尚未披露。

09/23 20:39

深蓝汽车与火山引擎官宣合作,豆包大模型首搭深蓝S07 AI激光版,9月28日上市

深蓝汽车与火山引擎正式官宣合作,豆包大模型将首次搭载于深蓝 S07 AI 激光版,该车型定于 9 月 28 日上市。这次合作把字节跳动体系的大模型能力装进量产车型,也让大模型上车从发布会的演示环节,变成按车型、按上市日期推进的交付项目。

09/23 20:09

OpenAI 将 Daybreak 网络防御计划扩展至乌克兰政府

OpenAI 宣布将其 Daybreak 计划的使用权限扩展给乌克兰政府,用于支持民用基础设施的网络防御。公告未说明具体技术能力、覆盖系统与合作期限,BBC 等媒体的报道也集中在同一核心信息上。

09/23 20:00

Ema完成7700万美元融资,累计1.4亿美元,企业客户超50家

企业 AI 公司 Ema 完成 7700 万美元新一轮融资,累计融资额达到 1.4 亿美元,目前拥有 50 多家企业客户,名单中包括 Google 和 Microsoft。TechCrunch 把这一轮融资放在 AI 开始吃进企业软件与服务预算的背景下解读,认为采购重心正在从工具转向能够直接完成工作的智能体。