实时 AI 消息
Cerebras推出CS-4推理系统:单用户token速度号称比GPU方案快30倍
Cerebras发布了基于三颗晶圆级处理器的全新AI推理系统CS-4,称其单用户每秒token输出超过4400个,速度约为上一代CS-3的两倍、最高可比GPU方案快30倍。该系统瞄准智能体等串行推理场景,首批交付将于本季度开始。

Cerebras Systems近日发布其最新AI推理系统CS-4,该系统由三颗晶圆级处理器构成。据公司介绍,CS-4在开源权重模型GPT-OSS-120B(1200亿参数)上可为单用户提供每秒超过4400个token的输出速度,这家被视为英伟达潜在挑战者的AI芯片创业公司再次把推理速度推到了新高度。
Cerebras称CS-4是业内最快的AI加速器,也是公司下一代Nexus机架级平台架构上的首款产品。在相同提示词下,其单用户每秒token数约为上一代CS-3的两倍,最高可比GPU方案快30倍。
这一成绩来自颇为特殊的设计路线。与把晶圆切割成数百颗芯片再在板上互联不同,Cerebras保留整片晶圆作为单一处理器运行,晶圆上直接集成44GB内存。由于芯片与内存之间的数据搬运正是拖慢推理速度的关键环节,更短的数据路径带来了显著优势。公司称每片晶圆的内存带宽达每秒43.2PB,是上一代的两倍。
指标本身需要仔细解读。每秒每用户token衡量的是单个用户等待一次回答时文字到达的速度,而吞吐量衡量整个系统同时服务所有用户产生的总token数,两者通常互相牵制。GPU集群通过批处理保持硬件满载、压低单token成本,但每个请求都要排队等待;Cerebras选择了相反的设计优先级。按人话换算,每秒4400个token约合3300个单词,远超任何人的阅读速度。
Cerebras押注的方向是智能体工作负载。CTO兼联合创始人Sean Lie在新闻稿中表示,30倍的速度提升不只是让响应感觉更快,还让智能体系统在同一时间内多出超过一个数量级的推理、验证或工具调用空间。智能体逐步骤串行执行,每一步都要等待上一步返回,延迟会叠加而非重叠,这正是单用户低延迟最能发挥作用的地方。
规格对比上,Cerebras给出CS-3到CS-4的关键数据:算力从125提高到750 petaFLOPS,在硅片面积增加三倍的情况下输出提升六倍。能效方面,CS-4声称每瓦吞吐量最高提升10倍,但这是与自家CS-3相比,而非对标GPU。公司将电源转换模块移到距处理器约0.5毫米处,而传统GPU主板约为50毫米,称此举几乎消除了板级功耗损失。
需要指出的是,"比GPU方案快30倍"的对比并未指明具体GPU型号,Cerebras没有披露对比对象的厂商、型号或服务配置,新闻稿脚注也承认实际吞吐量会随模型架构、上下文长度、精度和服务配置而变化。
新闻稿还透露了Cerebras对自身角色的定位:其可编程I/O子系统被描述为对分离式推理特别有利,并点名AMD Helios与AWS Trainium作为生态伙伴。在分离式推理中,一个系统负责预填充(读题)、另一个负责解码(作答),Cerebras瞄准的是后者——不是取代GPU集群,而是作为其上的一个组件。首批交付将于本季度开始。
为什么重要
CS-4把推理竞争焦点从整体吞吐量转向单用户延迟,直接服务于智能体推理这一快速增长的工作负载;若其宣称兑现,Cerebras有望在英伟达主导的推理市场切出细分缺口。
附近消息
全部08/24 16:53
Inferenz推出临终关怀资格AI智能体,自动筛查转诊并排序入院
8月24日消息,美国医疗AI公司Inferenz宣布,其Caregence智能体平台新增的临终关怀资格AI智能体(Hospice Eligibility AI Agent)正式全面可用,可自动完成转诊资格筛查与入院优先级排序。该智能体将单份转诊的人工审核时间从30–90分钟压缩到约5分钟,并为合规审查保留完整可追溯的审计轨迹。
08/24 16:07
阿里达摩院推出肝癌AI模型DAMO LiON,精准识别1厘米微小肿瘤
8月24日消息,阿里巴巴达摩院联合中国医科大学附属盛京医院等机构推出肝癌诊断AI模型DAMO LiON,可通过增强CT影像识别微小癌变病灶,相关成果登上《自然·医学》。在两个月的真实世界临床试验中,该模型发现15例被医生遗漏的恶性肿瘤,其中绝大部分为1厘米左右的病灶,帮助患者及时获得手术或药物治疗。
08/24 15:54
英伟达洽谈投资Perplexity,估值或超300亿美元
据The Information报道,英伟达正在洽谈以超过300亿美元的估值投资AI搜索公司Perplexity,较一年前的200亿美元估值高出逾50%。该公司年化收入已从年初的不到2.5亿美元增长至超过7.5亿美元,云端AI代理产品Perplexity Computer是重要增长引擎。
08/24 15:51
用友网络发布2026年半年报:企业AI进入规模化落地阶段
用友网络发布2026年半年度报告,明确提出企业AI已进入规模化落地阶段。这一信号意味着企业级AI应用正从单点试点走向覆盖核心业务环节的系统性部署,企业软件的智能化竞争进入新阶段。