郭震 AI公众号:郭震AI

实时 AI 消息

Show me《指环王》!卡帕西强推大模型评测新基准

卡帕西宣布,Anthropic开始用《指环王》作为大模型新基准:让Opus 5用Three.js把小说开头改写成可实时运行的3D中土世界,整个过程耗掉100万token、2小时和5500行代码。这一测试接替了此前的"鹈鹕骑自行车"SVG测试,旨在考察模型的长期规划与空间理解能力,项目已开源。

发布时间

卡帕西(Andrej Karpathy)近日宣布,Anthropic已经开始用一种全新的方式给大模型"上强度"——《指环王》。据他介绍,这套"指环王基准"正在接替过去风靡一时的"鹈鹕骑自行车"SVG测试,成为评估模型空间理解、长期规划与代码生成能力的新考题。

具体做法是,把《指环王》开头的文字直接丢给Opus 5,让模型用Three.js现场搭建出一个能够在浏览器中实时运行的3D"中土世界"。整个过程耗掉了100万token、2个小时和5500行代码,最终效果看起来有点像上世纪90年代末、21世纪初的国产3D动画片,很粗糙也很抽象。

卡帕西坦言,Opus 5目前还无法真正"进入"自己生成的世界,只能在不同时间点不断截图,再慢慢检查哪里出了问题。而这恰恰暴露了当前大模型的一块明显短板:它们已经能写代码、搭场景、生成游戏,却还不能真正看懂视频,也不会亲自玩一遍自己做出来的游戏。

按照卡帕西推文的字面意思,这次输入给Opus 5的主要提示词是《指环王》正文第一章《期待已久的宴会》的开头,并指定使用Three.js这个用代码搭建3D场景的JavaScript库。模型需要读懂文字,再把它翻译成3D世界——用多边形拼出人物、建筑和道具,放进x、y、z坐标系,再安排好摄像机、灯光和动画。这和视频模型直接生成一帧帧像素不是一回事,而是程序化3D场景的实时渲染。

卡帕西已经把整个项目开源。评论区里,他还设想让程序化代码负责分镜和控制,再把录屏交给Seedance这类Video-to-Video模型补上纹理、光影和细节,从而把3D世界的画面质量拉满;音频部分他则使用了ElevenLabs。

网友的后续测试更加天马行空:有人用Claude启动「Earth Online」项目,靠一群AI Agent把整个地球一点点搭出来;有人用Fable 5和GPT-5.6 Sol搭建出接入实时数据的纽约市3D数字模型;还有人用Three.js在浏览器里给自己补办了一场Kanye West演唱会,甚至做出了可交互、带音频的游戏版本。

为什么突然让大模型生成《指环王》?因为"鹈鹕骑自行车"这道经典考题快被刷穿了:一张SVG只能考察模型的一次性输出,测不出它能不能规划复杂项目、连续工作几个小时,并在几千行代码里反复检查和修正错误。于是卡帕西把"画张图"的小题换成了"搭个世界"的大工程。

社区对此也有争议。有人认为这类Demo最多只能证明Anthropic在Three.js代码上训练得不错,不能说明模型真的理解了空间和物理世界;也有人反驳说,把一段抽象、含义模糊的文学文本转化成3D动画,模型需要同时处理空间关系、物理规律和计算机图形学中的数学问题,这5500行代码并不简单。

无论争论如何,实时3D内容和可玩原型的制作门槛确实被向下推了一大截。"指环王基准"能否像"鹈鹕测试"一样流行开来,程序化3D与视频生成相结合是否会成为模型能力评估的新维度,值得继续观察。

为什么重要

「指环王基准」把模型评测从单图输出推向长周期、空间化的3D世界构建,为衡量大模型的空间理解与复杂项目管理能力提供了新的观察窗口。

微博邮件

AnthropicBenchmarkOpus 5Three.js
返回实时消息

附近消息

全部