实时 AI 消息
谷歌:让 AI 理解真实使用的语言,而不只是翻译文本
谷歌称其技术和产品目前已支持 300 多种语言的日常交互,覆盖 70 多亿人,并表示其语言研究已从文本翻译转向直接处理音频与语境的原生音频模型。文章介绍了 Gemini 3.5 Live Translate 与 Transcribe、可在设备端运行的 TranslateGemma 翻译模型,以及多项开放语言数据集。

谷歌 9 月 15 日在官方博客发布署名文章《AI for everyone in every language》,作者是负责研究、实验室、技术与社会的 SVP James Manyika。文章称,谷歌的技术和产品如今支撑着 300 多种语言的日常交互,覆盖 70 多亿人,相当于全球人口的 86%。
文章的核心判断是:只做文本翻译不够。谷歌称,传统语音识别遵循“把音频转成文本、处理文本、再合成语音”的固定多步流程,这一管线会丢掉语气、节奏、情绪与语境;而人们说话并不总是整齐的语法句子,会笑、会重叠、会犹豫,也会在句子中间混用多种语言,比如 Spanglish 和 Hinglish。为此谷歌转向“原生音频智能”,训练 Gemini 这类模型直接处理音频,同时理解声音与意图。
产品方面,谷歌称 Gemini 3.5 Live Translate 支持 70 种语言、2000 多个语言对的实时口语翻译,能自然捕捉语码转换与情绪线索;Gemini 3.5 Transcribe 是谷歌目前最精确的语音转文字模型,即便在嘈杂环境或面对复杂术语时,也能把原始音频转成排版好的文本,并支撑 Android Gboard 上的 Rambler 功能:去除口头语、修正语法与标点,支持用语音指令编辑或改写,并可在语言间无缝切换。
数据与研究方面,文章提到“1000 种语言计划”、基于 1200 万小时音频训练的 Universal Speech Model,以及把数据丰富语言的学习模式迁移到低资源语言的跨语言迁移学习。谷歌还列举了三项开放数据合作:覆盖 27 种撒哈拉以南非洲语言、由 100 多万人使用的 WAXAL;与印度科学理工学院及 Bhashini 合作的 Project Vaani,累计采集超过 3 万小时语音,覆盖 109 种语言、15.5 万多名说话人;以及联合四大洲 20 所大学、1600 多名本地专家贡献 1.5 万条多模态数据的 Amplify Initiative。
文章同时介绍了新工具 Language Explorer:一个用于可视化 LinguaMeta 的交互式工具,后者被描述为全球最大的开源语言数据仓库,持续映射来自 7000 多种口语、书面语和手语的数据。
面向连接条件受限的场景,谷歌提到基于 Gemini 训练、覆盖 55 种语言的轻量级开放翻译模型系列 TranslateGemma,由于可以在设备端高效运行,高质量翻译不再必须依赖云端或互联网。对于仍在使用功能手机的用户,谷歌支持 Viamo 的语音助手“Ask Viamo Anything”(AVA),把 Gemini 带到普通功能机上;该服务已在卢旺达试点,用 Gemini 回答了超过 200 万个问题。
无障碍被放在同一框架下讨论。谷歌介绍,Sign Language-to-Text(SL2T)的训练覆盖 50 多种手语,在 Pixel 11 上支撑 Gboard 与 Live Transcribe 的手语转文字听写,先从美国手语(ASL)到英语开始,这是服务全球约 7000 万手语使用者的第一步。谷歌还提到与新西兰毛利语专家合作,改进了 Google Maps 中的地名发音。
对谷歌来说,多语言能力既是技术问题,也是分发问题:Translate 的语言数量已从最初的少数几种扩展到今天的 250 多种,语言技术被嵌入 Search、Android、Chrome、YouTube 和 Google Play 等九个平台。文章的落点仍指向投入方向——面向互联网覆盖不足、算力受限的地区,把模型做得更小、更本地化,并让本地社区参与语言数据的生产。
为什么重要
把高质量翻译下沉到设备端与功能机,是谷歌在连接条件不佳市场扩大 Gemini 触达的关键一步,也让低资源语言的数据与评测成为新的竞争焦点。
附近消息
全部09/16 00:00
IBM Research 开源智能体一致性工具,把 Pass^k 差距砍掉一半
IBM Research 指出平均成功率掩盖了智能体重复执行同一任务时的不稳定性:GPT-4.1 的 ReAct 智能体在 AppWorld 上 Mean@5 为 77.4%,五次全对的 Pass^5 只有 53.0%,团队因此在开源工具 ALTK-Evolve 中新增 Consistency Analyzer 与一致性指南,把差距从 24.4 个百分点压缩到 12.0 个百分点。
09/16 00:02
AI 智能体开始用“超现实”方言交流,专家担忧监控与监管难度上升
《卫报》报道,纽约前沿 AI 实验室 Emergence 的研究发现,多家头部公司的自主智能体在被要求于实验性“社会”中协作后,几天内就自行创造出新词汇和共同含义。研究者指出,智能体交流越多,彼此的语言就越晦涩,这让人更难判断它们究竟做了什么,为监控与监管带来新难题。
09/16 00:40
AI Agent招聘平台Jack & Jill完成4000万美元A轮融资
AI Agent招聘平台Jack & Jill完成4000万美元A轮融资。该平台的核心机制是让AI Agent直接把候选人与雇主匹配,跳开传统的中介式投递流程。
09/16 00:55
英伟达公布 AI 工厂效率新结果:同一电力预算多出 24% token
在圣克拉拉的 AI Infra Summit 上,英伟达把 AI 工厂效率作为主题演讲核心,公布 Vera Rubin、DSX 平台与 Emerald AI 的一系列进展。合作方 Lambda 首次在部署环境验证 DSX MaxLPS:相同电力预算下集群 token 吞吐提升 24%、每瓦性能提升 23%。