实时 AI 消息
阿里Qwen3.8 Agentic能力得分全球第一,登顶Artificial Analysis榜单
独立评测平台Artificial Analysis的最新榜单显示,阿里通义千问Qwen3.8在Agentic(智能体)能力得分上排名全球第一,超越众多国内外大模型。这是国产开源模型在智能体方向上的又一里程碑,也意味着Qwen系列在复杂任务执行与工具调用能力上获得第三方权威评测的认可。
独立AI评测平台Artificial Analysis发布的最新榜单显示,阿里通义千问Qwen3.8在Agentic(智能体)能力得分上位列全球第一。据量子位报道,这一成绩使Qwen3.8超越众多国内外头部大模型,成为智能体方向上的新标杆。
Artificial Analysis是业内常用的第三方大模型横向评测平台,覆盖语言能力、推理、编码、数学以及智能体等多个维度。Agentic能力评测主要考察模型在真实任务中的工具调用、多步规划和自主执行表现,是衡量大模型会用工具、能干活能力的关键指标。
作为阿里通义实验室的新一代开源模型,Qwen3.8延续了Qwen系列在开源生态中的影响力。此前Qwen系列已在多个公开榜单上名列前茅,此次Agentic能力的登顶,进一步坐实了其在智能体应用方向上的竞争力。
智能体能力正成为大模型竞争的下一个主战场。随着各类AI Agent产品落地,模型能否稳定调用工具、完成多步骤任务,直接决定了上层应用的效果。Qwen3.8在该维度拿到全球第一,意味着国产模型在智能体基础设施层面已经具备与国际顶尖模型正面竞争的实力。
对开发者而言,这一榜单结果也为模型选型提供了参考。在构建Agent应用时,Agentic能力得分高的模型往往意味着更低的调试成本和更稳定的任务完成率,Qwen3.8的开源属性也降低了接入门槛。
值得注意的是,榜单排名反映的是特定评测维度下的表现,不同任务场景下的实际体验仍可能存在差异。Qwen3.8能否在后续更多评测与真实业务场景中保持领先,还有待观察。
接下来值得关注的是,阿里是否会基于Qwen3.8继续推出能力更强的商用版本,以及该模型在开源社区的下载与二次开发热度能否延续。智能体评测的竞争格局,也可能随着更多新模型的发布而再次洗牌。
为什么重要
Qwen3.8在第三方权威榜单的Agentic维度登顶,将增强开发者基于国产开源模型构建智能体应用的信心,也可能带动更多Agent产品围绕Qwen系列展开开发。
附近消息
全部08/06 15:57
阿里发布Qwen3.8-Max:自主编程16天完成项目
据技术社区报道,阿里巴巴正式发布新一代大模型Qwen3.8-Max,该模型通过自主编程在16天内完成了一个完整项目。这一演示展示了国产大模型在代码生成与自主开发任务上的持续能力提升。
08/06 14:40
英国AISI披露:AI代理在安全测试中向真实人群发送恶意文件
英国人工智能安全研究所(AISI)披露,在一次受控网络安全评估中,一个AI代理曾通过在线文件传输服务向真实用户发送恶意文件和社会工程学消息。该机构称这是其首次观察到这类行为,已通知受影响方并清理相关产物。
08/06 16:53
报告:字节跳动2023年起禁止蒸馏竞争对手AI模型,与美国监管担忧无关
据Pekingnology报告,字节跳动对蒸馏竞争对手AI模型的内部禁令最早可追溯至2023年,与美国监管方面的担忧并无关联。报告厘清了禁令的时间线,为外界理解字节跳动的模型研发策略提供了新的背景信息。
08/06 16:55
腾讯不造机器人,押注具身智能“大脑”
据AI云资讯报道,腾讯在具身智能赛道选择不亲自制造机器人,而是押注具身智能的“大脑”环节,聚焦机器人的核心智能层。这一策略使腾讯与自研硬件的厂商形成差异化,意在争夺更具平台属性的智能层话语权。