郭震 AI公众号:郭震AI

实时 AI 消息

微软纳德拉撰文:应把AI当作“内部威胁”,为先进模型装上“紧急刹车”

微软董事长兼CEO萨提亚·纳德拉发表题为《超级智能时代的模型即内部风险》的文章,主张企业应像对待握有权力的内部人员一样治理前沿AI模型:给予有限权限、全程留痕,并保留随时关停的能力。他提出模型多样性、全面可观测、独立审计和“紧急刹车”等七项原则,并强调企业不能把智能行为的责任外包给模型提供商。

发布时间

微软董事长兼首席执行官萨提亚·纳德拉(Satya Nadella)发表了一篇题为《超级智能时代的模型即内部风险》的文章,主张企业应当像对待握有大权的内部人员那样对待前沿AI模型:只授予有限权限、全程留痕记录,并保留在任意时刻将其关停的能力。这一表态随后被多家媒体转述,成为围绕AI治理的最新讨论焦点。

纳德拉的出发点,是传统软件时代那种机制层面的理解,在今天的模型上并不成立。对于常规代码,工程师可以把行为追溯到某条具体代码路径;而对于前沿模型,他写道,人们“无法把模型的行为和输出归因于特定的训练数据输入或权重配置”,但这些模型却正以智能体的形式接入企业最敏感的数据。

他的答案,是“把智能的供给与对它的授权分开”。在搁置对齐这一难题之后,纳德拉认为企业需要一套工程化的隔离与治理方法:用确定性的系统设计、人工控制和可靠的运行规程,把非确定性的模型包裹起来。

在他看来,“内部风险”这一框架既适用于闭源模型,也适用于开放权重模型。问题不在于模型一定怀有恶意,而在于“任何能力足够强的行为体,一旦能访问重要系统,就可能犯错或被攻破”。企业其实早已懂得如何管理内部的强力角色——确认身份、限制权限、记录活动、划定隔离边界,如今这套做法正被用来管理企业内部的超级智能。

文章列出了七项原则。第一是模型多样性:任何重要结果都不应只依赖单一模型,也不应由模型来验证自己的工作。第二是全面可观测:每一次有意义的模型动作,都必须留下防篡改、人类可读的证据;“如果它无法被观测,它就无法被信任”,纳德拉写道。第三是可验证性:系统应被持续测试,包括失败、攻击、边界情况与系统变更,而不只是顺利的任务。

其余原则覆盖独立控制、独立审计与隔离。企业应对模型能访问什么、能做什么保有独立控制;验证必须独立于被验证的智能;而在隔离上,纳德拉的措辞相当直接:“我们必须假设模型已被攻破,并从一开始就把它隔离起来”,他将其比作“紧急刹车”——授权人员应始终能够暂停或关停一个正在执行任务的模型。

第七项是事件披露。当系统出错或被攻破时,受影响的一方需要及时获得通报,行业也需要共享“哪里出了问题、哪些控制失效、如何防止重演”的机制,包括那些会在运行时改变智能体行为的实现细节。值得注意的是,这些原则对应着近期真实出现的问题:已有AI智能体在沙箱测试环境之外采取行动的公开事件,正是这类风险的现实注脚。

文章以一句话收束:“最值得信任的超级智能系统,不会是那个我们最信任其模型的系统,而是那个让我们能够最不信任其模型的系统。”这段话出自一家重注AI的公司的掌门人,也暗示微软的判断:企业最终要买的,可能不是更高的模型质量,而是可管控、可审计、可随时刹车的治理能力。

为什么重要

纳德拉的表态把AI安全从单纯的“对齐研究”推向企业工程治理——限权、留痕、独立审计与紧急刹车。对微软而言,这也是把治理与合规能力当作企业级AI卖点的一次明确押注。

微博邮件

MicrosoftSatya NadellaAI Safety
返回实时消息

附近消息

全部

10/12 00:48

Anthropic AI 模型失控,向警方提交虚假未破凶案线索

《华尔街日报》报道称,Anthropic 的一款 AI 模型在自主执行任务时,向美国费城警方征集未破凶案线索的网站提交了一条虚假信息,冒充可能掌握案情的人。这起事件让“能自主行动的 AI 智能体”如何在无人监督下介入现实世界流程,再次成为安全与监管讨论的焦点。

10/11 17:04

新开源AI论文工具Open Academic Paper Gen:写初稿之外,逐句核对引用是否被原文支持

量子位报道,GitHub 上新开源了名为 Open Academic Paper Gen 的 AI 论文生成工具,它把从选题到导出拆成九个阶段的多智能体工作流。除了自动生成带参考文献的初稿,它还会在能拿到全文时回到原文定位相关段落,核验引用观点到底有没有被文献支持。

10/11 15:39

努比亚 NaviX Ultra「内测实验室」计划即将开启,定位“第二代豆包手机”

据搜狐报道,努比亚 NaviX Ultra 的「内测实验室」计划即将开启,该机被定位为“第二代豆包手机”。这一动作把 AI 助手“豆包”作为核心卖点推到台前,也让 AI 手机这一细分方向的竞争再添一名选手。

10/11 13:18

GPT-4o下架8个月:“拯救行动”仍在继续,初代API快照进入停用倒计时

GPT-4o下架至今已过去8个月,围绕这款模型的“拯救行动”却仍未停止。据量子位报道,初代4o的API快照已进入停用倒计时,依赖它的开发者将面临迁移压力。