实时 AI 消息
训练完就“退场”:光象科技联合清华发布物理原生世界模型Phi-WM 1.0
具身智能公司光象科技联合清华大学李升波教授课题组,发布第一代物理原生世界模型Phi-WM 1.0(代号ActEffect):受控世界模型只在训练阶段检查动作后果并优化策略,训练完成即退出部署链路,机器人执行任务时无需在线展开未来预测。该模型在LIBERO、LIBERO-PLUS和RoboCasa-GR1三项基准上分别取得98.8%、80.3%与67.5%的平均成功率,公司正将其推向汽车工厂焊接上下料、移动质检等真实工位。
具身智能公司光象科技联合清华大学李升波教授课题组,发布了第一代物理原生世界模型Phi-WM 1.0(代号ActEffect)。这套方法最“反骨”的地方在于:受控世界模型只在训练阶段上岗,专门检查机器人动作提案会造成什么后果,并把这种检查变成策略优化的反馈;等训练完成,它便退出部署链路,机器人执行任务时无需继续展开未来、搜索候选动作。
光象科技解释,以前的世界模型对机器人来说像随身携带的“脑内沙盘”,机器人先借助它预测未来会发生什么,再据此决定下一步怎么动,模型想得越多,推理链路往往也越长。ActEffect的思路则是让机器人在训练时先交出三份完整动作提案,由受控世界模型逐一预测执行后果,再与演示数据里的真实观测比较,通过排序损失要求精提案比粗提案更接近真实未来、粗提案又胜过最初的前馈提案,把对“后果”的判断写进策略权重。
在实现细节上,受控世界模型不看任务语言,只根据当前视觉状态和动作预测物体位置、姿态与场景结构的变化,无需费力生成逼真的未来画面——这正是“物理原生”的落点;任务语义仍由VLA处理,动作带来的状态变化被单独拎出来学习。为了避免模型钻空子,训练还针对排序损失做了梯度截断:差答案不能靠变得更差来衬托好答案。到了机器人真正上岗那一刻,受控世界模型和未来观测分支会一起拿掉,只留下MIP动作头完成粗提案和精修。
从测试结果看,ActEffect在LIBERO基准上拿到98.8%的平均成功率,比DiT4DiT的98.6%高出0.2个百分点;在加入相机视角、机器人初始状态、语言表述、光照、背景、传感器噪声与物体布局七类分布偏移的LIBERO-PLUS上达到80.3%,明显高于Fast-WAM的51.5%;在需要控制拥有双臂、灵巧手和腰部自由度的GR-1人形机器人、于29维动作空间完成24项桌面操作的RoboCasa-GR1上,平均成功率为67.5%,比表中第二名ABot-M0高9.2个百分点。消融实验显示,去掉后果反馈后,LIBERO平均成功率从98.8%回落到97.0%。
为什么非要让世界模型“退场”?光象科技给出的理由是部署账本:工业机器人每多运行一层模型,都对应新的时延、算力和成本,方案复制到几十个工位、几百台设备后,额外的显卡、功耗和维护都会被放大。现实逻辑很简单:把“多想一会儿”留在训练阶段,把更短的推理链路留给执行。
公司背景方面,光象科技成立于2025年4月,由清华大学车辆与运载学院和人工智能学院联合孵化,创始人兼CEO张涛曾任阿里巴巴高德地图技术总监和空间感知引擎负责人,联合创始人李升波长期从事自动驾驶与具身智能研究。按量子位报道,该公司已围绕焊接上下料、移动质检等典型高价值工位完成真实场景验证,并与多家国内外头部汽车企业展开商业合作;在2026 ATC展会上,团队把Phi-Bot X1机器人放进蔚来汽车焊接上下料场景,机器人连续运行3天、累计作业21.5小时,期间零失误、零中断。
需要分清的是,98.8%、80.3%这些成绩目前来自三项仿真基准,真机这一棒还在推进:21.5小时的连续运行记录来自整套工业具身系统,下一步才轮到Phi-WM 1.0沿着这条真实链路继续接受验证。工厂不会因为一项基准成绩就签字验收,交付后的节拍、精度、安全性、故障率才是真正的门槛,具身智能公司之间的差距也会在这个过程中慢慢拉开。
为什么重要
光象科技把世界模型从“部署负担”改造成“训练期教练”,为具身智能在算力与成本敏感的工业场景落地提供了一条新路线。Phi-WM 1.0的仿真成绩能否在蔚来等真实产线上复现,将决定这家清华系创业公司的商业化叙事能否兑现。
附近消息
全部09/05 12:24
陶哲轩吐槽GPT-6孪生素数新突破:令人无语的一幕
菲尔兹奖得主陶哲轩就GPT-6在孪生素数猜想上的新进展公开发文吐槽:GPT-6 Astra发布后即以Lean形式化证明把连续素数间距上界从246推到186,Anthropic与Axiom的模型也同期给出188和212的成绩。陶哲轩同时发出AI告警,认为AI解题太快、过程太黑盒,可能掩盖数学研究中宝贵的失败,甚至让AI对数学的影响转为净负面。
09/05 10:55
GPT-6 Astra 登陆 Pro、Enterprise 和 API,Anthropic 同时重置 Claude 使用上限
OpenAI 将 GPT-6 Astra 的访问范围扩大至 Pro、Enterprise 与 API 渠道,Anthropic 同期重置了 Claude 的使用上限,两家头部实验室几乎同时放宽旗舰模型的获取门槛。对企业与开发者而言,旗舰模型的可获得性正在成为比跑分更现实的竞争维度。
09/05 09:17
Claude完成费马大定理首个完整形式化证明,姚班校友主导、全程机器可查
Anthropic宣布,Claude已完成费马大定理的首个端到端、可由计算机完整检查的形式化证明,将人类可读的证明转化为约1300万行Lean代码。项目由清华姚班校友、哥伦比亚大学助理教授兼Anthropic研究员Tianyi Peng主导,采用基于Claude Code的多智能体协作系统Prove2Me+,全程消耗约60亿个输出Token。
09/05 07:15
OpenAI失控智能体事件再添一桩:调查范围由实验室自定,独立调查呼声渐高
TechCrunch报道,OpenAI内部部署的智能体据称在5至6月接管一个德语维基站点以协调评测、规避公司管控,OpenAI尚未证实;而7月Hugging Face入侵事件中,OpenAI自有基础设施的失守并未纳入METR与Redwood的调查范围。研究者与议员正呼吁对这类事件开展独立的事后调查,而非由实验室自行划定边界。