郭震 AI公众号:郭震AI

实时 AI 消息

本地大模型StartLux-27B通过MCP专项测评:综合第二,多项专项第一

中国信通院人工智能研究所公布的MCP专项测评显示,StartLux研发的本地大模型StartLux-V1.0-27B-Preview以27B参数量取得综合第二,超过284B的DeepSeek-V4-Flash-0731,能力进入万亿参数模型区间。在位置导航、浏览器自动化、金融分析等专项上,其与1.6T参数的DeepSeek-V4-Pro并列第一或独占第一。

发布时间

工信部中国信息通信研究院(中国信通院)人工智能研究所近日公布的一份检验报告显示,上海原点星辉科学技术有限公司(StartLux)研发的本地大模型StartLux-V1.0-27B-Preview,在可信AI大模型基准测试——MCP专项测试中,以27B参数量取得综合性能排名第二的成绩,高于第三名的DeepSeek-V4-Flash,能力范围已经进入DeepSeek-V4-Pro所代表的万亿参数模型能力区间。

MCP专项测试涵盖位置导航、网页搜索、浏览器自动化、金融分析、代码仓库管理、3D设计6类专项任务及综合评估,共7项检验项目,重点考察大模型在多工具协同、复杂任务执行及真实环境交互等方面的综合表现。该专项测试部分指标和数据参考了开源项目MCP-Universe。

参测模型包括DeepSeek-V4-Pro(1.6T)、DeepSeek-V4-Flash-0731(284B)、Step-3.7-Flash(198B)、StartLux-27B-260715(27B)、Qwen-3.6-27B(27B)和AgentCPM-Explore(4B)。结果显示,StartLux-V1.0-27B-Preview综合得分39.25,排名第二,超过284B的DeepSeek-V4-Flash-0731和198B的Step-3.7-Flash;同等参数规模下,较Qwen-3.6-27B高出5.34个百分点。

单项任务中该模型表现更为突出:位置导航排名第一,浏览器自动化、金融分析等任务与1.6T参数的DeepSeek-V4-Pro并列第一或独占第一。StartLux表示,团队以Qwen3.6-27B为基座做后训练定向增强,把27B的本地模型推到与1.6T旗舰同级的位置,依靠的是自主设计的一套全新、多维度、可验证、可规模化的模型优化升级技术。

模型训练过程中,团队采用“AI训练AI”(Auto Research)的方法自主开展训练实验,并通过反馈持续优化训练策略。据报道,StartLux-V1.0-27B-Preview是国内首个采用该方法进行后训练的本地Agent模型,而这一方法代表了当前全球模型研发的前沿方向。

这一结果正值本地模型加速进入行业视野:Google于4月推出Gemma 4系列,其中31B Dense版本在开源模型排行榜排名第三,量化后可在消费级显卡上本地运行;Meta于8月初开源30B本地模型Muse Glimmer;NVIDIA也在8月推出30B参数的MoE开源模型Nemotron 3.5 Lightning,可直接在RTX PC等本地设备上运行。

行业对这一方向的押注正在加大。盛大网络创始人、语生科学董事长陈大年近期预测,本地模型将在3年内占据80%的大模型市场;量子与AI软件公司Multiverse Computing联合创始人兼首席科学官Roman Orús也表示,行业正进入本地大语言模型成为云服务真正竞争对手的时期。

目前StartLux-V1.0-27B-Preview已可在消费级个人电脑上运行,StartLux计划于年内推出第一代本地智能解决方案,并正对扩散式语言模型等新架构进行深入研究。27B本地模型逼近万亿参数旗舰的能力,验证了后训练优化路线的潜力,也让MCP这类工具调用测评成为衡量Agent能力的新标尺。

为什么重要

27B本地模型在工具调用类任务上比肩万亿参数旗舰,印证了后训练优化路线的价值,也推动MCP等工具调用基准成为衡量Agent能力的新标尺。

微博邮件

StartLuxMCPLocal LLM
返回实时消息

附近消息

全部