郭震 AI公众号:郭震AI

实时 AI 消息

「牛来」真身曝光:智谱开源GLM首个原生多模态模型GLM-5.3 Flash,跑在国产卡上

连日刷屏的神秘模型「牛来」(Ox Alpha)真身曝光:它是智谱刚发布即开源的GLM-5.3 Flash,也是GLM 5系列首个原生多模态模型,且承接全球流量的算力全部来自国产芯片。该模型以320B总参数、18B激活参数实现超越GLM-5.2的能力,AA榜单57分与Claude Opus 4.8持平,定价仅为后者的1/40。

发布时间
「牛来」真身曝光:智谱开源GLM首个原生多模态模型GLM-5.3 Flash,跑在国产卡上
图源: qbitai.com

连日来在海外刷屏的神秘模型「牛来」(Ox Alpha),真身终于曝光:它正是智谱刚刚发布即开源的GLM-5.3 Flash,也是GLM 5系列中首个原生多模态模型。

在智谱正式认领之前,匿名测试中的Ox Alpha已在OpenRouter首日冲上榜首,并刷新单日tokens用量历史纪录;在OpenCode上,它一出世便终结了DeepSeek连续56天的霸榜纪录。

参数规模上,GLM-5.3 Flash总参数为320B,能力却全面超越体量753B的GLM-5.2。根据最新AA榜单,它拿下57分、与Claude Opus 4.8持平;价格方面,其定价仅为GLM-5.3的1/10,限时折扣低至GLM-5.3的1/20、Opus 4.8的1/40,也低于DS-V4-Flash。

架构层面,GLM-5.3 Flash实际激活参数仅18B,层数从GLM-4.5时期的92层压到45层,并采用线性注意力+稀疏注意力的混合架构,配合IndexPool把索引器缓存向量从4个压到1个——注意力计算量较GLM-5.3降低3.01倍,KV Cache缩小4.44倍。

智谱还为Visual Coding构建了数据合成流水线,让模型在执行任务过程中自己查看最终页面、交互和3D场景,再根据视觉反馈继续修改。官方展示中,GLM-5.3 Flash独立运行12小时完成了3D Blender场景构建。

更受关注的是算力。匿名测试期间承接全球真实流量的62T Tokens,全部跑在国产加速芯片上。智谱将多模态编码、Prompt预填充和逐Token解码拆成可独立调度的Encode-Prefill-Decode分离式架构,叠加Layer Split、混合缓存量化等优化,端到端服务性能较初始基线提升3倍,单Token成本做到与主流英伟达GPU相当。

量子位实测显示,无论是多人说话视频的精准配字幕、整部电影的解说视频,还是基于一张UI设计稿生成可交互购物App,GLM-5.3 Flash都能端到端完成,展现出"一边写、一边看、一边改"的能力。

目前GLM-5.3 Flash已面向全球开源并接入ZCode、开放API,权重已在HuggingFace上线,企业也可以自行部署。模型、国产算力与开源生态这一次真正连在了一起,能否持续以低成本承接前沿任务,是接下来最值得观察的问题。

为什么重要

GLM-5.3 Flash首次把原生多模态、开源权重和国产算力三者合一,以极低价格冲击前沿模型市场,或将加速行业价格与开源格局的洗牌。

微博邮件

ZhipuGLMOpen Source
返回实时消息

附近消息

全部