郭震 AI公众号:郭震AI

实时 AI 消息

Cognition 用 GPT-6 Astra 增强 Devin 自测能力,目标减少代码审查

据 OpenAI 发布的信息,Cognition 正借助 GPT-6 Astra 提升其 AI 软件工程师 Devin 测试自身改动的能力,让模型能够证明代码确实可用。官方给出的目标是帮助工程师减少审查、加快交付,这也意味着自动生成的代码开始需要自带可验证的证据链。

发布时间

OpenAI 发布的信息显示,Cognition 正在用 GPT-6 Astra 强化其 AI 软件工程师 Devin 的自测能力。案例的核心表述是:Astra 提升了 Devin 测试软件并证明其确实可用的能力。

官方给出的目标很直接——让工程师少花时间审查代码,把更多精力放在交付上。换句话说,AI 写出的代码不再只是等着被人类逐行检查,而是要先自己跑通、自己给出证据。

这背后的工程问题是:自动生成的代码越多,人类的审查负担越重,瓶颈会从编写环节转移到审查环节。如果模型能自己完成测试并展示结果,审查环节的压力才有可能真正下降。

Devin 的定位是承担开发任务的 AI 智能体,而测试与验证是这类智能体最难跨越的一环。能改动代码并不等于能确认改动正确,把测试自己作品的能力补上,是让智能体形成闭环的关键一步。

值得注意的是,这条信息同样来自 OpenAI 官方渠道,描述的是 Astra 在具体产品中的使用效果,但没有给出量化的测试覆盖率或缺陷率数据。因此它更适合被理解为一个能力方向的公开信号,而不是可直接比较的评测结论。

后续可以观察两点:一是这种自测能力能否在大型、长期维护的代码库中成立;二是当模型既能写代码又能自证正确时,团队的质量门禁与评审规范需要怎样调整。

为什么重要

自测能力把 AI 编程的瓶颈问题摆到台面上:代码生成越快,人工审查越堵。让模型自带验证证据,是智能体真正进入生产流程的前提条件。

微博邮件

OpenAICognitionAgent
返回实时消息

附近消息

全部

09/12 00:46

Nscale 在潜在 IPO 前引入前 OpenAI 高管 Fidji Simo 进入董事会

据 TechCrunch 9月11日报道,Nscale 在筹备潜在 IPO 之际,将前 OpenAI 高管 Fidji Simo 纳入其董事会。Simo 曾是 OpenAI 的二号人物,并带领 Instacart 完成了 2023 年的上市。

09/11 22:05

Anthropic 开出最高约 320 万元年薪招销售,只为服务 Meta 一家客户

Anthropic 近日在招聘页面挂出名为「Mega Account Executive, Meta」的岗位,面向的客户只有 Meta 一家,年收入区间为 38 万至 45 万美元(按 OTE 机制计算),最高约合人民币 320 万元。该岗位 9 月 3 日上线、9 月 9 日即停止接受申请,而 Meta 工程师已在大量使用 Claude Code,据《纽约时报》消息其在 Anthropic 上的潜在年支出可能达到 100 亿美元。

09/12 02:02

网商银行外滩大会首次披露AI银行进展:百灵2.0面向4200万小微商家开放

在2026外滩大会上,网商银行首次披露其AI银行落地进展:全球首个小微普惠金融Agent「百灵2.0」已面向4200万小微商家开放。后台的八大AI工作台已覆盖风控、人审、营销与产研等核心生产环节,AI Coding占比提升一倍,15%的业务修改需求由AI完成。

09/12 02:41

Anthropic研究员辞职并公开警告:公司正“直奔自我改进超级智能”,对齐负责人联署

一名 Anthropic 研究员本周辞职,并在 X 上公开警告称,公司“正在直奔自我改进的超级智能,拿我们的生命冒险”。Anthropic 自身的对齐负责人在这则信息上联署而非出面淡化,加之有报道称公司正在筹备 IPO,使这条来自内部的警告的时机格外引人关注。