郭震 AI公众号:郭震AI

实时 AI 消息

韩国Upstage开源2500亿参数AI智能体模型Solar Open 2,采用混合注意力MoE架构

韩国AI公司Upstage正式开源Solar Open 2大语言模型,总参数2500亿,每token仅激活150亿参数。该模型采用混合注意力机制的混合专家架构,支持100万token上下文,在多个Agent基准测试中表现领先。

发布时间

韩国AI公司Upstage在7月23日正式发布了开源大语言模型Solar Open 2(250B-A15B),采用Apache 2.0基础的开源许可证,允许商业使用和衍生开发。该模型是韩国政府支持的本土基础AI模型项目的一部分,专注于智能体(Agent)场景——工具调用、多步推理和端到端任务执行。

Solar Open 2的总参数量达到2500亿,但采用混合专家(Mixture of Experts)架构,每次推理仅激活150亿参数。其核心创新在于混合注意力机制——将3层线性注意力层与1层softmax注意力层交错排列,重复12次共48层。这种设计去除了位置编码(NoPE),线性注意力通过循环状态编码位置信息,从而避免了RoPE在长上下文下的外推限制。模型共包含321个专家(320个路由专家+1个共享专家),每token激活top-8专家。

在基准测试方面,Solar Open 2表现强劲。MMLU-Pro达到86.2分,GPQA-Diamond 86.3分,AIME 2026数学竞赛95.7分。在Agent专项测试中,APEX-Agents得分16.6,远超DeepSeek V4 Flash(13.2)和Mistral Medium 3.5(13.4)。模型还支持英、韩、日三种语言,在韩语测试中超越了OpenAI GPT-5.4 mini和Anthropic Claude Haiku 4.5。

该模型在约12万亿token数据上预训练,使用了NVIDIA B200 GPU,总计约200万GPU小时。量化版本可在2块NVIDIA H200上运行,推荐配置为8块H200。由于仅有12层(共48层)保留KV缓存,其推理时的显存占用约为全softmax模型的四分之一。Upstage表示,Solar Open 2是基于智能体自主完成任务的能力来设计的,而非仅仅追求基准分数。

Solar Open 2已在Hugging Face上开放权重和技术报告。Upstage计划将其应用于韩国Daum门户网站、旗下Tamnlee AI智能体平台,并拓展至金融、法律和医疗领域,同时与韩国国产AI芯片适配。对于开源社区而言,这款模型在Agent能力上的突出表现以及高效的MoE架构设计值得深入研究。

接下来值得关注的是:Solar Open 2在真实Agent工作流中的部署效果如何、社区能否构建围绕该模型的工具生态系统、以及Upstage能否借助这款模型在竞争激烈的韩语AI市场建立差异化优势。

为什么重要

Solar Open 2的开源为AI智能体领域带来了一个极具竞争力的200B+级MoE模型,其Agent基准成绩尤其值得关注。这将推动开源Agent模型的竞争,并为韩国AI生态提供了重要的基础模型支撑。

微博邮件

UpstageSolar Open 2Open SourceMoEAgentLLM
返回AI日报

附近消息

全部