郭震 AI公众号:郭震AI

实时 AI 消息

阿里Qwen3.8 Agentic能力得分全球第一,登顶Artificial Analysis榜单

独立评测平台Artificial Analysis的最新榜单显示,阿里通义千问Qwen3.8在Agentic(智能体)能力得分上排名全球第一,超越众多国内外大模型。这是国产开源模型在智能体方向上的又一里程碑,也意味着Qwen系列在复杂任务执行与工具调用能力上获得第三方权威评测的认可。

发布时间

独立AI评测平台Artificial Analysis发布的最新榜单显示,阿里通义千问Qwen3.8在Agentic(智能体)能力得分上位列全球第一。据量子位报道,这一成绩使Qwen3.8超越众多国内外头部大模型,成为智能体方向上的新标杆。

Artificial Analysis是业内常用的第三方大模型横向评测平台,覆盖语言能力、推理、编码、数学以及智能体等多个维度。Agentic能力评测主要考察模型在真实任务中的工具调用、多步规划和自主执行表现,是衡量大模型会用工具、能干活能力的关键指标。

作为阿里通义实验室的新一代开源模型,Qwen3.8延续了Qwen系列在开源生态中的影响力。此前Qwen系列已在多个公开榜单上名列前茅,此次Agentic能力的登顶,进一步坐实了其在智能体应用方向上的竞争力。

智能体能力正成为大模型竞争的下一个主战场。随着各类AI Agent产品落地,模型能否稳定调用工具、完成多步骤任务,直接决定了上层应用的效果。Qwen3.8在该维度拿到全球第一,意味着国产模型在智能体基础设施层面已经具备与国际顶尖模型正面竞争的实力。

对开发者而言,这一榜单结果也为模型选型提供了参考。在构建Agent应用时,Agentic能力得分高的模型往往意味着更低的调试成本和更稳定的任务完成率,Qwen3.8的开源属性也降低了接入门槛。

值得注意的是,榜单排名反映的是特定评测维度下的表现,不同任务场景下的实际体验仍可能存在差异。Qwen3.8能否在后续更多评测与真实业务场景中保持领先,还有待观察。

接下来值得关注的是,阿里是否会基于Qwen3.8继续推出能力更强的商用版本,以及该模型在开源社区的下载与二次开发热度能否延续。智能体评测的竞争格局,也可能随着更多新模型的发布而再次洗牌。

为什么重要

Qwen3.8在第三方权威榜单的Agentic维度登顶,将增强开发者基于国产开源模型构建智能体应用的信心,也可能带动更多Agent产品围绕Qwen系列展开开发。

微博邮件

AlibabaQwenAgenticBenchmark
返回实时消息

附近消息

全部