郭震 AI公众号:郭震AI

实时 AI 消息

Anthropic 与 OpenAI 拟把安全评估员请进实验室,独立性成焦点

TechCrunch 9 月 16 日报道,Anthropic 与 OpenAI 希望把独立安全评估员嵌入自家实验室,让外部研究者能在模型公开发布前接触到前沿系统。研究者欢迎这种前所未有的访问权限,但强调真正有效的监督仍取决于透明度、独立性和最终的监管安排。

发布时间
Anthropic 与 OpenAI 拟把安全评估员请进实验室,独立性成焦点
图源: techcrunch.com

TechCrunch 9 月 16 日报道称,Anthropic 与 OpenAI 希望把独立的安全评估员直接嵌入自家实验室。这意味着外部研究者将获得一种长期求而不得的访问权限:在模型正式发布之前,就能近距离接触前沿系统。

报道描述的方案是,评估员不再从外部审查模型,而是进入实验室内部,在系统仍处于开发阶段时考察其行为与风险。支持者认为,只有贴近开发过程,审查者才能拿到足够的上下文与访问权限,在模型触达数百万用户之前就发现问题。

受访研究者对如此程度的开放表示欢迎,但他们的支持附带了条件。他们提醒,有意义的监督需要方法透明、结论可查,需要评估方真正独立于被评估的公司,最终还需要成文的监管,而不是依赖企业的自觉。

争议的核心是结构问题。当评估者身处公司内部、依赖被评估方的配合时,要让其公开公司不愿看到的结论并不容易。若发布权、经费与职位任期都缺乏保障,访问权限就可能变成只有靠近、没有问责。

报道把这轮讨论放在行业竞争加剧的背景下:Anthropic 与 OpenAI 都把自己定位为安全领域的领先者,如今要面对更难的一问,是否愿意接受自己无法控制的审查。

对监管者而言,把评估员嵌入企业内部比立法更快,也比自建国家级评估体系更省钱;对批评者而言,这正是问题所在:由被监督对象自己设计和供养的监督机制,很难在商业压力下存活。

这一信号的意义超出两家公司。前沿评估正在成为政府、企业与公众了解新模型能力的主要渠道,而这条渠道的可信度,决定了整个体系能给出多少信任。

接下来值得盯住几件具体的事:嵌入的评估员能否不受限制地访问模型,结论是否完整公开,经费与招聘由谁决定,以及立法者是否会把这种安排从自愿行为变成法律要求。

为什么重要

嵌入式评估有可能成为前沿模型监督的默认模式,也可能变成一场可信度考验。评估员能拿到多少访问权限、能否自由发布结论,将决定外界如何看待实验室的安全承诺。

微博邮件

AnthropicOpenAISafety
返回实时消息

附近消息

全部