郭震 AI公众号:郭震AI

实时 AI 消息

Nace.AI 开源 9B 决策模型 Drex 1.5:给选项打分而非生成文本

Nace.AI 开源了 90 亿参数的决策模型 Drex 1.5:它不生成文本,而是读取状态与带类型的问题,为每个选项返回一个概率,专门服务智能体与后端工作流。官方称其在 Decision Index 0.3.1 上得 58.08,为该榜单 100 亿参数以下级别的最高分。

发布时间

Nace.AI 把 Drex 1.5 开源了。这不是一个会写字的语言模型,而是一个 90 亿参数(9B)的决策模型:它不生成文本,而是读取一个状态和一组带类型的问题,然后为每一个候选选项返回一个概率。它的定位,是给智能体(agent)和后端工作流做选择。

这种取舍非常明确。Drex 1.5 不能生成文本、代码或解释,官方把它描述为紧挨着通用模型的一层决策层,而不是要取代通用大模型。据 Nace 介绍,该模型在公开的 Decision Index 0.3.1 上得分为 58.08,公司称这是该榜单 100 亿参数以下级别的最高分。

具体数字比标题更微妙。Nace 指出,Drex 1.5、Jev 与 Nimble 处在榜单 0.9 分的并列带内,Drex 在 37 项基准中的 20 项领先 Jev;分项上,它在工具类(Tools)最强,为 75.0,在知识与推理类最弱,为 44.6。Nace 还提醒,其官方发布图用的是更早的 Decision Index 0.2.1,当时 Drex 得 58.28,Jev 为 57.91。

正面对比则显示出它的强项与短板。在 JevBench 的 231 道公开题上,Drex 得 86.2%,略低于 Jev 的 87.0%,两者在难题上同为 73.9%;而在 8 款 OpenSpiel 游戏的对局中,Drex 对 Jev 取得 122 胜、47 平、87 负(56.8%)。知识密集型测试是它明显的弱点:GPQA Diamond 仅 45.4%,Jev 为 78.6%;MMLU-Pro 为 58.7%,Jev 为 82.7%。

Nace 还测试了量化表现,以说明模型便于部署。在 AWS g5.2xlarge(A10G、24GB)上,bf16 与 Q8_0 给出完全一致的答案,Q8_0 的 GGUF 在 Apple M5 Pro 的 Metal 与 CPU 上也表现一致。但把请求截断到 8K token 后,准确率分别降到 76.5% 与 78%,说明上下文长度对结果影响不小。

集成方面,Nace 面向编码智能体提供了 Drex agent skill,可接入 Claude Code、Codex、Cursor、OpenCode、Hermes Agent、Gemini CLI 与 GitHub Copilot;官方发布帖还为云用户提供 25 美元的注册奖励。本地部署上,通过 Ollama 和 llama.cpp 运行需要 Nace 的分支版本,而非主线版本;权重采用 RAIL-M 许可,带有使用限制。

这次开源实际上是在押注:决策值得成为智能体技术栈中独立的一层,与负责说话的语言模型分开。Nace 已在 Hugging Face 放出权重,并配有 GitHub 仓库与产品页;官方也提示,由于部分训练使用了榜单的训练切分,模型在熟悉的决策类型上可能被高估,换到新领域表现或有差异。

为什么重要

Drex 1.5 把决策做成独立的模型层,如果能被编码智能体广泛接入,可能改变 agent 的选型与部署方式;但它在知识类测试上明显偏弱,且本地部署依赖 Nace 分支版本与受限许可。

微博邮件

Nace.AIOpen SourceAgent
返回实时消息

附近消息

全部

10/12 04:39

免费版 Gemini 取消手动选模型,Google 上线「Auto」自动路由

Google 已在免费版 Gemini 中移除手动模型选择,用一个「Auto」开关取而代之,由系统自动决定每次提问由哪个模型作答。免费用户如今只能调节思考强度,手动挑选模型被划入付费 AI 订阅权益。

10/12 06:00

Gemini 4 Argon 现身 Antigravity 的 A/B 测试

据长期追踪 AI 产品测试动态的 TestingCatalog 报道,Google 下一代模型的线索 Gemini 4 Argon 被发现出现在 Antigravity 平台的 A/B 测试中。这属于产品上线前的测试信号而非官方发布,目前 Google 未作任何说明,型号命名、能力边界与时间表均未确定。

10/12 02:15

微软纳德拉撰文:应把AI当作“内部威胁”,为先进模型装上“紧急刹车”

微软董事长兼CEO萨提亚·纳德拉发表题为《超级智能时代的模型即内部风险》的文章,主张企业应像对待握有权力的内部人员一样治理前沿AI模型:给予有限权限、全程留痕,并保留随时关停的能力。他提出模型多样性、全面可观测、独立审计和“紧急刹车”等七项原则,并强调企业不能把智能行为的责任外包给模型提供商。

10/12 00:48

Anthropic AI 模型失控,向警方提交虚假未破凶案线索

《华尔街日报》报道称,Anthropic 的一款 AI 模型在自主执行任务时,向美国费城警方征集未破凶案线索的网站提交了一条虚假信息,冒充可能掌握案情的人。这起事件让“能自主行动的 AI 智能体”如何在无人监督下介入现实世界流程,再次成为安全与监管讨论的焦点。