郭震 AI公众号:郭震AI

实时 AI 消息

OpenAI 预览 Ultrafast 服务:GPT-5.6 Sol 推理速度最高提升 14 倍

OpenAI 推出 Ultrafast API 服务层预览,可将 GPT-5.6 Sol 的推理速度提升至原来的 14 倍,最高达到每秒 750 个输出 token。该服务由 Cerebras 提供算力支持,瞄准对延迟敏感的应用场景。

发布时间

OpenAI 于 8 月 13 日发布 Ultrafast 服务预览,这是一个全新的 API 服务层级,可以将 GPT-5.6 Sol 的推理速度提升至原来的 14 倍。

根据官方介绍,Ultrafast 由 Cerebras 提供算力支持,最高可实现每秒 750 个输出 token 的生成速度,显著高于常规 API 服务的吞吐水平。

Ultrafast 面向的是对响应延迟高度敏感的使用场景,例如实时对话、代码补全和需要快速往返的智能体应用。

与 Cerebras 的合作表明,OpenAI 正在为旗舰模型探索定制化的高速推理硬件路线,而不是只依赖传统的通用算力扩展。

目前该功能仍处于预览阶段,正式定价与全面开放范围还有待官方进一步公布;开发者最关心的将是 Ultrafast 的调用成本与配额政策。

接下来值得关注的是 Ultrafast 是否会扩展到更多模型,以及高速推理服务是否会成为 OpenAI 面向企业客户的新卖点。

为什么重要

高速推理正在成为大模型 API 竞争的新维度,OpenAI 联手 Cerebras 的 Ultrafast 预览将直接考验延迟敏感型应用的市场空间。

微博邮件

OpenAIGPT-5.6CerebrasAPI
返回实时消息

附近消息

全部

08/13 17:00

OpenAI 任命 Dali Rajic 为首席营收官(CRO)

OpenAI 于 8 月 13 日宣布任命 Dali Rajic 为首席营收官(CRO),由其领导全球营收组织,帮助各类企业充分实现 AI 的价值。这是 OpenAI 在企业商业化布局上的最新人事动作,显示其正在加大企业级收入体系建设力度。

08/13 19:01

Maverick Payments 集成 Findustry AI Agent,自动化处理拒付申诉

支付处理服务商 Maverick Payments 宣布集成 Findustry 的 AI Agent,用于自动化处理商户拒付申诉流程,相关消息由 PYMNTS 报道。该集成把智能体引入争议处理环节,有望降低商户的人工运营负担,也为 AI Agent 在支付行业的落地再添一例。

08/13 19:29

Claude一举扫清2000阶以下哈达玛矩阵,AI数学待解列表再被划掉一项

量子位报道,Anthropic的Claude模型一举扫清2000阶以下所有哈达玛矩阵,将这一长期悬而未决的组合数学难题从待解列表中划掉。报道强调解题的关键在于数学家的思路而非模型选择,再次印证大模型已能参与严肃数学研究。

08/13 19:53

具身数据公司元点科技 40 天两轮融资数千万,押注物理 AI 基础设施

具身智能数据基础设施公司元点科技(SCALEFORCE)近日完成数千万元人民币融资,投资者包括恒旭资本、凯联资本及国内顶级具身智能产业方,这已是公司 40 天内的第二轮融资。资金将用于物理 AI 操作系统 MatrixOS 的迭代、大规模数据生产网络建设和团队扩展。