郭震 AI公众号:郭震AI

实时 AI 消息

联想天禧自研代码智能体 TianxiCode 登顶 SWE-bench-Live 全球榜首

联想天禧 AI 自主研发的专业代码智能体框架 TianxiCode,以 71% 的问题解决率登上 SWE-bench-Live 全球第一名。这一成绩把国产自研 Agent 的工程能力推到公开、可比的基准之上,也让联想在企业级代码智能体赛道获得了一个显眼的位置。

发布时间

据量子位报道,联想天禧 AI 对外披露了其自主研发的专业代码智能体框架 TianxiCode,并在 SWE-bench-Live 评测中以 71% 的问题解决率登上全球第一名。对一款企业自研的代码智能体来说,这是一个相当直接的信号:它不只是概念演示,而是要在公开、持续更新的基准上证明自己解决真实工程问题的能力。

SWE-bench 系列是当前衡量代码智能体能力最受关注的评测之一。它把真实的软件仓库问题交给模型或 Agent,由其自行定位、修改并验证代码,最终以能否真正解决问题来计分。SWE-bench-Live 则强调题目的动态与新鲜度,意味着模型不能只依赖训练时见过的旧题,而要在不断更新的任务上保持稳定表现。

TianxiCode 被描述为联想天禧 AI 自研的专业代码智能体框架,其定位并非通用聊天助手,而是面向代码场景的 Agent。71% 的问题解决率是这次披露中最关键的数字——它决定了该框架在榜单上的排名,也是外界判断其工程完成度最直接的依据。

从行业视角看,代码智能体是过去一年里落地最快的 Agent 形态之一。相比偏展示性质的对话能力,代码任务有明确的正确性标准——测试是否通过、缺陷是否被修复,几乎无法靠话术蒙混。因此,一款 Agent 若能在 SWE-bench 这类基准上取得高位,往往被视为真正具备动手完成任务能力的证据。

联想选择在此时公布这一成绩,说明其企业级 AI 战略正从平台与模型层,延伸到具体的高价值 Agent 场景。对于一家拥有大量硬件、终端与企业服务业务的公司而言,把代码智能体做成可对外展示的能力,有助于在企业客户的开发与运维环节找到新的切入点。

需要注意的是,单一基准的排名并不等同于真实世界的全面能力。SWE-bench-Live 关注的是软件工程任务,而企业部署中还会涉及私有代码库、权限管理、合规与成本等一整套问题。TianxiCode 能否把榜单成绩转化为可规模交付的产品,仍要看后续的工程与生态落地。

接下来值得关注的是两点:一是联想是否会公开 TianxiCode 的技术细节、可用范围与部署方式;二是这一成绩能否带动更多国产 Agent 在公开基准上同台比较,推动整个赛道从发布即宣传走向可复现、可验证的竞争。

为什么重要

登顶 SWE-bench-Live 让联想在企业级代码智能体赛道获得一个可公开引用的基准背书,有助于其向企业客户推广开发者 Agent。这一成绩能否转化为真实商业优势,取决于后续是否公开技术细节并落地可用产品。

微博邮件

LenovoCoding AgentSWE-bench
返回实时消息

附近消息

全部

10/09 16:47

0.2秒急停、平均2秒重规划:Aether AI的CRIS-0让机器人看懂因果

由UCSD助理教授黄碧薇创立的因果智能公司Aether AI公布了机器人系统CRIS-0的官方Demo:在咖啡机被移开、光照突变等干扰下,系统平均约2秒就能识别关键因果变量并完成实时重规划,10次扰动中9次有效恢复。它把任务视为不断更新的因果状态,并在关门阶段做到0.2秒安全急停,试图解决端到端模型在长程任务中误差累积、一遇意外就崩溃的老问题。

10/09 15:52

ICANN 公布顶级域申请名单,OpenAI 申请 .gpt、.chatgpt 与 .agi

ICANN 公布了通用顶级域名的申请名单,人工智能公司 OpenAI 出现在申请者之列。据报道,OpenAI 申请的字符串包括 .gpt、.chatgpt 和 .agi,显示它希望把品牌与核心概念直接变成互联网地址。

10/09 18:00

谷歌收紧Gemini模型权限:免费用户只能用Flash Lite,Gemini Pro转为高价订阅专享

谷歌正在收紧Gemini的模型权限:从10月9日起,没有付费订阅的用户只能使用较弱的Gemini Flash Lite,此前可用的Gemini Flash与有限度访问的Gemini Pro被收回;Gemini Pro仅保留给每月19.99美元的AI Pro和起价99.99美元/月的AI Ultra等高价套餐。

10/09 15:00

Sophos 借助 OpenAI Daybreak 将威胁调查时间缩短 96%

OpenAI 介绍了安全厂商 Sophos 如何借助其 Daybreak 能力,把网络威胁调查所需时间缩短 96%,并自动处理 52% 的 MDR 案例。这一案例显示代理式 AI 正在安全运营等企业场景中落地,同时仍保留人工监督。