郭震 AI公众号:郭震AI

实时 AI 消息

英伟达发布 Magpie 多语言 TTS 更新:12 种语言、开放权重,主打低延迟语音 Agent

英伟达发布开源 Magpie 多语言 TTS 模型更新,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,语言覆盖扩展到 12 种,并提升了多个原有语言的合成质量。模型开放权重,可通过 NVIDIA NIM 在自有基础设施上部署,单流首音频延迟低至 32 毫秒,面向低延迟语音 Agent 场景。

发布时间
英伟达发布 Magpie 多语言 TTS 更新:12 种语言、开放权重,主打低延迟语音 Agent
图源: huggingface.co

英伟达在 Hugging Face 博客发布 Magpie 多语言 TTS 模型的新版本,新增现代标准阿拉伯语、韩语和巴西葡萄牙语三种语言,使单模型语言覆盖扩展到 12 种。官方同时表示,这次更新通过改进训练数据与模型结构,显著提升了多个原有语言的合成质量。

Magpie TTS Multilingual 是一个 3.64 亿参数的开放权重模型,除新增语言外还覆盖英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语和日语,每种语言都提供男声与女声,并通过共享的多语言说话人表征实现统一管理。

新版本还加强了对印地语和日语的中英混说支持,借助 IPA 音素转换与自定义发音词典,让模型更准确地读出人名、技术术语和混合语言内容。按照官方数据,法语的字符错误率从 2.70% 降至 1.54%,西语从 1.14% 降至 0.60%,说话人相似度也有明显提升。

延迟是这次更新的核心卖点。在 B200 上单流首音频延迟(TTFA)低至 32 毫秒,64 路并发时首音频延迟为 239 毫秒,吞吐量达到实时速度的 320 倍;H100、A100 与 DGX Spark 的实测数据同样被完整公布。

低延迟来自两项架构改进:帧堆叠让解码器每步预测两帧音频,把解码迭代次数减半;局部 transformer 则建模同帧码本 token 之间的依赖,弥补帧堆叠可能带来的音质损失。相关架构已发表于 ICASSP 2026 论文。

与一体化语音模型不同,Magpie 面向级联式语音管线设计,ASR、LLM、TTS 各层独立可调。开放权重配合 NVIDIA NIM 容器,让企业可以在自有或隔离环境中部署,自主控制延迟预算、数据驻留与发音定制。

英伟达还将 Magpie 纳入 Nemotron Voice Agent 开发者示例,与 Nemotron Speech 流式识别、Nemotron 语言与多模态模型组合,提供支持打断式对话、多模态理解和多语言交互的端到端参考实现。

对开发者而言,下一步是直接下载开放权重做微调,或使用 NIM 容器上线生产。在客服、医疗助手、翻译系统等场景,Magpie 让企业自建多语言语音 Agent 有了一个可落地的开源起点。

为什么重要

开放权重加 NIM 微服务,让企业能自主掌控语音延迟、数据驻留与定制能力,直接推动多语言语音 Agent 从 API 依赖走向私有化部署。

微博邮件

NVIDIATTSOpen SourceVoice AI
返回实时消息

附近消息

全部