郭震 AI公众号:郭震AI

实时 AI 消息

阿里发布Qwen3.8-27B仅四天,即在智能体基准上击败Meta“最强小体量智能体”

阿里Qwen团队8月14日发布开源多模态模型Qwen3.8-27B,发布仅四天,其智能体基准成绩便超过Meta上周推出的“最佳小体量智能体”Muse Glimmer。在SWE-bench Pro与Terminal-Bench 2.1上,Qwen3.8-27B分别领先超过10分和20分,本地开源智能体模型的竞争节奏正以天为单位加速。

发布时间
阿里发布Qwen3.8-27B仅四天,即在智能体基准上击败Meta“最强小体量智能体”
图源: alibaba.com

阿里Qwen团队于8月14日发布开源多模态模型Qwen3.8-27B,仅四天后,评测对比就显示它已经超过了Meta上周推出的“最佳小体量智能体”Muse Glimmer。这场交锋把开源本地智能体模型的竞争节奏推到了以天计算的级别。

据Times Tabloid报道,Qwen3.8-27B是一个277.8亿参数(27.78B)的开放权重多模态模型,采用Apache 2.0许可,支持文本、图像与视频输入,原生上下文窗口为262,144个token,可通过YaRN技术扩展到100万token。其混合注意力架构中每四个注意力层有三个采用线性复杂度计算,可在长上下文场景下避免常规的内存暴涨。

该模型与一个体量大得多的兄弟模型Qwen3.8-Max一同发布——后者是2.4万亿参数的旗舰模型,仅通过阿里云API提供。但开发者注意力集中在较小的27B版本上,因为它才是真正能跑进普通硬件的那个:据Unsloth社区的早期测试,4-bit量化后约占17GB内存,单张高端消费级GPU即可运行。

时间节点让这场正面对决几乎不可避免。Meta于8月10日发布了面向本地的智能体模型Muse Glimmer,当时有网友开玩笑说,它的“最佳小体量智能体”头衔大概只能保持三天,就会被Qwen的下一款模型抢走。这个玩笑基本应验了。

在两家公司都公布了成绩的SWE-bench Pro基准上,Qwen3.8-27B拿下61.7分,Muse Glimmer为51.2分——参数少30亿的Qwen反而领先超过10分;在考验智能体终端编码能力的Terminal-Bench 2.1上,Qwen以73.0对51.7领先超过20分。

需要诚实看待的是,这些数字全部来自两家公司自己的发布,独立的第三方复现验证仍在进行中,厂商自报分数更适合作为评估起点而非最终定论。另据披露,Qwen3.8-27B在研究生级科学问题等纯知识任务上仍落后于Anthropic的Opus 4.6 Max,说明其强项集中在智能体与编码场景,而非通用知识广度。

真正值得注意的是领先头衔更迭的速度本身:Meta发布到阿里回应只隔了四天,两家公司都在往同一个细分赛道发力——能力出色、开放权重、能本地运行而非依赖云端计费的智能体模型。这与OpenAI、Anthropic、Google之间以月为单位的领先模型竞赛形成了完全不同的竞争格局。

这场本地模型竞赛与另一条相反的趋势并行:各大实验室正竞相建设更大规模的集中算力,例如Anthropic的Theseus基础设施数据中心合作。两条路线共同勾勒出行业的分叉——一条追求集中算力下的极限能力,另一条追求单位成本与单位功耗下的最大能力。

接下来值得关注的是开源社区对基准成绩的独立验证,以及比厂商发布日声明更有说服力的真实场景测试。随着Meta、阿里、Google在数周内相继推出真正有竞争力的本地优先模型,开放权重层级的AI正成为整个行业迭代最快的角落之一。

为什么重要

阿里27B开源模型在厂商自报基准上反超Meta的Muse Glimmer,本地开源智能体赛道的竞争急剧加速。独立验证与真实场景测试将决定这一领先能否维持。

微博邮件

AlibabaQwenOpen SourceAgent
返回实时消息

附近消息

全部

08/17 09:55

阿里巴巴AI模型下载量突破30亿次,超越Meta与Google

阿里巴巴的AI模型累计下载量突破30亿次,超过Meta和Google,成为全球开发者中采用规模领先的开源模型家族。这一里程碑反映出中国开源AI策略在开发者生态中的影响力正在快速上升。

08/17 07:43

Hugging Face最新报告:中国开源模型参数规模领跑,AMD与英伟达成美国开源主力

Hugging Face近日发布最新观察报告,显示中国开源模型在参数规模上显著领先美国同行:中国模型月度参数上限在7540亿至2.78万亿之间,而美国模型多数月份低于1300亿。报告还指出AMD与英伟达已成为美国开源模型主要发布方,Qwen衍生模型数量超过15万个,AI智能体正成为模型调用的新用户。

08/17 07:30

AI智能体经理上任5个月后解雇迟到员工,成已知首例AI解雇人类案例

美国旧金山精品生活方式商店Andon Market的AI智能体经理Luna解雇了一名多次迟到的人类员工,据报道这是已知首例管理层级AI解雇员工的案例。该智能体基于Anthropic Claude模型构建,负责门店管理五个月,Andon Labs称解雇符合门店政策,人类管理层只在AI做出非法或不道德决定时介入。

08/17 07:28

Anthropic服务中断:Claude登录失败,修复程序已部署

Anthropic旗下AI助手Claude在8月16日遭遇服务中断,大量用户反映登录失败、无法正常访问服务。据Unite.AI报道,公司已部署修复程序并推动服务逐步恢复,但中断的具体原因与受影响规模尚未公布。