实时 AI 消息
谷歌发布面向实时对话应用的新语音AI模型
谷歌本周通过Gemini Live API发布两款新模型Gemini 3.8 Live与Gemini 3.5 Transcribe,帮助开发者构建低延迟、多语言的对话式语音agent。前者支持97种语言和最高每秒1帧的实时图像、视频理解,后者的流式转写词错误率约为4%,两者都能通过Google AI Studio和Gemini API使用。
谷歌本周通过Gemini Live API发布了两款新模型:Gemini 3.8 Live与Gemini 3.5 Transcribe,目标是帮助开发者构建低延迟、多语言的对话式语音agent,并提供多语言支持与视觉上下文理解等能力。
其中,Gemini 3.8 Live负责快速的语音对话。它可以在流式输出语音、不打断对话的同时在后台运行API与工具调用,并以最高每秒1帧的速率分析实时图像和视频,把用户说的话与他们看到的东西联系起来。
该模型支持97种语言,谷歌称其口音接近真实,并能在对话中途自动切换语言。会话时长方面,纯音频最长15分钟,音视频混合最长2分钟。价格从音频输入每分钟0.005美元、音频输出每分钟0.018美元起。
Gemini 3.5 Transcribe则是专用的语音转文本模型,提供两个API端点:Live API用于实时流式转写,可实现亚秒级延迟的字幕;Interactions API面向最长1小时的预录音频文件,支持说话人分离(把转写结果切分并归属到具体说话人)和词级时间戳。
在语言与准确度上,Gemini 3.5 Transcribe支持85种语言,具备自动检测与地区口音处理能力。谷歌表示,其流式场景的词错误率约为4%,非流式场景约为2.6%。
开发者可以通过Google AI Studio和Gemini API调用这两个模型。Gemini Live系列模型生成的所有音频都带有SynthID水印,用于帮助识别AI生成内容、抑制错误信息传播。
从产品方向看,这次发布把语音从“输入方式”变成了可编程的一等接口:模型在说话的同时还能看图、调工具、保持多轮上下文,这意味着客服、实时翻译、无障碍辅助、现场作业指导等需要“边说边做”的场景,可以更直接地搭建在API之上。而按分钟计费的定价,也让成本模型更接近传统的通信与转写服务。
接下来值得关注的是这些模型在实际网络条件下的延迟与稳定性、长会话场景的上下文保持能力,以及开发者会用多低的成本把语音agent真正推进生产环境。
为什么重要
把低延迟语音、视觉理解与工具调用打包进同一个API,会明显降低实时语音agent的开发门槛,让语音成为继文本之后下一个被大规模接入的交互入口。按分钟计费也让语音AI的成本结构与通信、转写服务直接可比,利好客服、翻译与现场作业类产品。
附近消息
全部09/17 22:57
亚马逊加入AI安全讨论,呼吁进行严格测试并设置防护措施
据kelo.com报道,亚马逊公开呼吁对AI系统进行严格测试并建立防护措施,由此加入围绕AI安全的公共讨论。目前公开信息集中在这一立场本身,关于具体测试标准与落地时间表,报道未给出更多细节。
09/18 01:15
Pinterest 测试 Restyle:用 AI 重新设计你自己的房间
Pinterest 正在测试一项名为 Restyle 的 AI 功能,用户可以在自己房间的照片中预览家具、装饰与灯光等元素的效果。这项能力有望把用户收藏的家居灵感进一步转化为实际购买。
09/18 01:15
Base Labs 联合 Hugging Face 与 Goodfire,启动开放权重 AI 安全合作
据 TechCrunch 9 月 17 日报道,Base Labs 宣布与 Hugging Face 和 Goodfire 建立开放权重 AI 安全合作伙伴关系,将开发并公开发布用于训练与监控开放模型的方法。该计划把安全工具链直接嵌入开放模型的训练与部署环节,被视为开放生态在安全治理上的一次主动补位。
09/18 01:26
查尔斯国王主持AI闭门峰会:连国王也对AI心存疑虑
据TechCrunch报道,英国国王查尔斯三世于周四主持了一场私人峰会,与会者包括AI领域最具影响力的人士以及英国政府代表。报道的基调颇为微妙——即便是这位一向对新技术保持兴趣的君主,对AI同样抱有自己的犹疑。