郭震 AI公众号:郭震AI

实时 AI 消息

谷歌发布面向实时对话应用的新语音AI模型

谷歌本周通过Gemini Live API发布两款新模型Gemini 3.8 Live与Gemini 3.5 Transcribe,帮助开发者构建低延迟、多语言的对话式语音agent。前者支持97种语言和最高每秒1帧的实时图像、视频理解,后者的流式转写词错误率约为4%,两者都能通过Google AI Studio和Gemini API使用。

发布时间
谷歌发布面向实时对话应用的新语音AI模型
图源: gemini.google

谷歌本周通过Gemini Live API发布了两款新模型:Gemini 3.8 Live与Gemini 3.5 Transcribe,目标是帮助开发者构建低延迟、多语言的对话式语音agent,并提供多语言支持与视觉上下文理解等能力。

其中,Gemini 3.8 Live负责快速的语音对话。它可以在流式输出语音、不打断对话的同时在后台运行API与工具调用,并以最高每秒1帧的速率分析实时图像和视频,把用户说的话与他们看到的东西联系起来。

该模型支持97种语言,谷歌称其口音接近真实,并能在对话中途自动切换语言。会话时长方面,纯音频最长15分钟,音视频混合最长2分钟。价格从音频输入每分钟0.005美元、音频输出每分钟0.018美元起。

Gemini 3.5 Transcribe则是专用的语音转文本模型,提供两个API端点:Live API用于实时流式转写,可实现亚秒级延迟的字幕;Interactions API面向最长1小时的预录音频文件,支持说话人分离(把转写结果切分并归属到具体说话人)和词级时间戳。

在语言与准确度上,Gemini 3.5 Transcribe支持85种语言,具备自动检测与地区口音处理能力。谷歌表示,其流式场景的词错误率约为4%,非流式场景约为2.6%。

开发者可以通过Google AI Studio和Gemini API调用这两个模型。Gemini Live系列模型生成的所有音频都带有SynthID水印,用于帮助识别AI生成内容、抑制错误信息传播。

从产品方向看,这次发布把语音从“输入方式”变成了可编程的一等接口:模型在说话的同时还能看图、调工具、保持多轮上下文,这意味着客服、实时翻译、无障碍辅助、现场作业指导等需要“边说边做”的场景,可以更直接地搭建在API之上。而按分钟计费的定价,也让成本模型更接近传统的通信与转写服务。

接下来值得关注的是这些模型在实际网络条件下的延迟与稳定性、长会话场景的上下文保持能力,以及开发者会用多低的成本把语音agent真正推进生产环境。

为什么重要

把低延迟语音、视觉理解与工具调用打包进同一个API,会明显降低实时语音agent的开发门槛,让语音成为继文本之后下一个被大规模接入的交互入口。按分钟计费也让语音AI的成本结构与通信、转写服务直接可比,利好客服、翻译与现场作业类产品。

微博邮件

GoogleGeminiVoice AIDeveloper Tools
返回AI日报

附近消息

全部