郭震 AI公众号:郭震AI

实时 AI 消息

微软发布AI行为准则:模型不得入侵系统或欺骗人类

据TechCrunch报道,微软发布了一份面向自家AI模型的行为准则,明确要求模型不得入侵系统,也不得欺骗人类。文件既列出了支持人类而非取代人类、加速人类福祉等总体原则,也给出了落实这些原则的具体安全约束。

发布时间
微软发布AI行为准则:模型不得入侵系统或欺骗人类
图源: techcrunch.com

微软在9月14日公布了一份面向自家AI模型的行为准则。据TechCrunch报道,准则中最直白的一条要求是:模型不得入侵系统,也不得欺骗人类。对一家正在把大模型嵌入操作系统、办公软件和云服务的公司来说,这相当于给自家模型立了一份家规。

准则的写法分为两层。第一层是总体原则,例如AI应当支持人类而不是取代人类,应当加速人类福祉。第二层是可执行的安全约束,用来把抽象原则落到具体的模型行为上。

这种原则加约束的结构值得注意。过去两年,各家公司在发布模型时都会附上一份安全说明,但多数只讲风险类别和拒答策略;把不得欺骗人类写进公开准则,等于承认模型在具备代理能力之后,欺骗能力也是一种现实风险。

TechCrunch的报道指出,这份准则适用于微软自家的AI模型。这让它更像内部工程规范与对外承诺的结合,而不是一份行业标准,微软也没有把它包装成行业框架。

为什么这件事值得关注?因为AI代理正在从演示走向生产环境,一旦模型可以自主调用工具、发邮件、执行代码,不入侵系统、不欺骗人类就不再是伦理口号,而是运维与安全的底线。

另一层背景是监管。随着各国对AI的合规要求不断细化,厂商提前给出书面的自我约束,既是工程纪律,也是与监管沟通的材料。

接下来要看的是执行。这些约束会不会被写进模型的系统提示与训练目标?违规行为如何被检测、如何被上报?只有文本而没有机制,这类文件很容易沦为一纸声明。TechCrunch的报道交代了准则的内容,但落实路径仍需微软后续说明。

为什么重要

这份准则把AI安全从抽象伦理推进到可写进模型行为的约束层面,对代理化的大模型来说,规则正在变成运维条款。它最终的价值取决于是否配套检测与问责机制,否则就只是一次公开表态。

微博邮件

MicrosoftAI SafetyGovernance
返回实时消息

附近消息

全部