实时 AI 消息
谷歌发布面向实时对话应用的新语音AI模型
谷歌本周通过Gemini Live API发布两款新模型Gemini 3.8 Live与Gemini 3.5 Transcribe,帮助开发者构建低延迟、多语言的对话式语音agent。前者支持97种语言和最高每秒1帧的实时图像、视频理解,后者的流式转写词错误率约为4%,两者都能通过Google AI Studio和Gemini API使用。
谷歌本周通过Gemini Live API发布了两款新模型:Gemini 3.8 Live与Gemini 3.5 Transcribe,目标是帮助开发者构建低延迟、多语言的对话式语音agent,并提供多语言支持与视觉上下文理解等能力。
其中,Gemini 3.8 Live负责快速的语音对话。它可以在流式输出语音、不打断对话的同时在后台运行API与工具调用,并以最高每秒1帧的速率分析实时图像和视频,把用户说的话与他们看到的东西联系起来。
该模型支持97种语言,谷歌称其口音接近真实,并能在对话中途自动切换语言。会话时长方面,纯音频最长15分钟,音视频混合最长2分钟。价格从音频输入每分钟0.005美元、音频输出每分钟0.018美元起。
Gemini 3.5 Transcribe则是专用的语音转文本模型,提供两个API端点:Live API用于实时流式转写,可实现亚秒级延迟的字幕;Interactions API面向最长1小时的预录音频文件,支持说话人分离(把转写结果切分并归属到具体说话人)和词级时间戳。
在语言与准确度上,Gemini 3.5 Transcribe支持85种语言,具备自动检测与地区口音处理能力。谷歌表示,其流式场景的词错误率约为4%,非流式场景约为2.6%。
开发者可以通过Google AI Studio和Gemini API调用这两个模型。Gemini Live系列模型生成的所有音频都带有SynthID水印,用于帮助识别AI生成内容、抑制错误信息传播。
从产品方向看,这次发布把语音从“输入方式”变成了可编程的一等接口:模型在说话的同时还能看图、调工具、保持多轮上下文,这意味着客服、实时翻译、无障碍辅助、现场作业指导等需要“边说边做”的场景,可以更直接地搭建在API之上。而按分钟计费的定价,也让成本模型更接近传统的通信与转写服务。
接下来值得关注的是这些模型在实际网络条件下的延迟与稳定性、长会话场景的上下文保持能力,以及开发者会用多低的成本把语音agent真正推进生产环境。
为什么重要
把低延迟语音、视觉理解与工具调用打包进同一个API,会明显降低实时语音agent的开发门槛,让语音成为继文本之后下一个被大规模接入的交互入口。按分钟计费也让语音AI的成本结构与通信、转写服务直接可比,利好客服、翻译与现场作业类产品。
附近消息
全部09/17 22:57
亚马逊加入AI安全讨论,呼吁进行严格测试并设置防护措施
据kelo.com报道,亚马逊公开呼吁对AI系统进行严格测试并建立防护措施,由此加入围绕AI安全的公共讨论。目前公开信息集中在这一立场本身,关于具体测试标准与落地时间表,报道未给出更多细节。
09/17 21:46
AI 助手开始打电话:Instinct 上线 Concierge,Meta 的 Muse 同步跟进
9月17日,旧金山初创公司 Instinct 上线 Instinct Concierge,可代用户打电话预订不接线上订位的餐厅、排上牙医的候补名单、处理有线电视账单;同日 Meta 的 Muse 也开始向美国商家拨打外呼电话。此前通话能力一度是竞品用来与 Instinct 拉开差距的卖点,如今两家文本型 AI 助手在这一项上重新回到同一起跑线。
09/17 21:38
Google、Nvidia、Anthropic 联合 Emerald AI 成立联盟,目标为电网腾出 100 吉瓦数据中心容量
9月17日,电网软件独角兽 Emerald AI 与 Google、Nvidia 共同成立 AI Energy Management Alliance,Anthropic 及 AES、Constellation、National Grid、NRG Energy 等公用事业公司加入。联盟希望把“需求响应”变成数据中心建设的常规环节,通过暂停非关键任务、迁移部分算力负载,为电网额外接入 100 吉瓦容量。
09/17 20:42
监督机构指控OpenAI违反加州SB 53,点名三次模型发布
监督机构Midas Project指控OpenAI在2026年三次模型发布中违反加州SB 53《前沿人工智能透明度法案》,未按自订的《前沿治理框架》披露风险等级与失控风险(loss of control)评估。OpenAI称有信心符合SB 53,争议焦点因此落在它是否履行了写进框架的披露承诺,而非是否做过安全评估。