实时 AI 消息
a16z投资的Vals:想在AI基准测试里做成“黄金标准”
获得Andreessen Horowitz投资的Vals AI,正试图在模型数量快速膨胀的AI行业里成为基准测试领域的“黄金标准”。TechCrunch报道称,该公司希望把评测做成更中立、更可信的资源,让第三方结果成为可用参考。

据TechCrunch 9月19日报道,获得Andreessen Horowitz(a16z)投资的Vals AI,正试图成为AI基准测试领域的“黄金标准”。在一个越来越被AI模型淹没的世界里,这家公司希望把基准测试做成更中立、更值得信赖的资源。
报道点出的问题并不新鲜,但越来越尖锐:模型越多,评测越乱。各家厂商都会公布对自己有利的分数,而榜单的样本来源和打分方式常常不够透明,外界很难横向比较不同模型在真实任务上的表现。
Vals的定位正是补上这一环。TechCrunch的描述是,它希望提供中立且可信的基准测试结果,让评测不再只是厂商的营销素材,而是可以被企业和技术团队直接拿来对照的参考坐标。
这类服务的价值最终体现在决策上。当企业要选型、要采购、要把模型接入自己的业务流程时,需要的不只是官方演示,而是可复现、可对照的第三方数据。基准测试的可信度,正在变成AI产业链上的基础设施问题。
a16z的投资让这件事带上了资本视角。基准测试本身不是模型,也不直接出售算力,但它牵涉“谁更强”的判断权,因此处在模型公司与下游客户之间的关键节点上。
需要观察的是,投资并不能自动换来中立性。Vals要在模型厂商、开发者和商业客户之间维持平衡,还要面对评测方法被质疑、榜单被刷分这类老问题。
接下来的看点在于,它能否让一套评测标准被行业广泛采用;以及在模型更新节奏不断加快的情况下,第三方基准测试是被更多人依赖,还是继续被各家自建评测稀释。
为什么重要
第三方基准测试正在成为模型选型的基础设施,谁能让评测结果可信,谁就在“谁更强”这件事上握有话语权。
附近消息
全部09/19 19:43
27B模型分分钟交付网页,Qwen 3.8还是太能了
量子位的实测显示,Qwen 3.8 27B 只用一句提示词,就能在几分钟内生成一个能上手操作的数据分析小工具,也能搭出一套外观完整的仿 12306 抢票页面,把过去产品、设计、前端分头数周的活压成一次性生成。不过作者也提醒,这些页面默认没有接入真实数据、账户、支付与后端,看着逼真,却办不成真实的事。
09/19 16:28
华为汪涛:要打造AI算力底座,只做好一颗芯片远远不够
在今年的华为全联接大会上,轮值董事长汪涛公布昇腾960与960超节点,并给出2028年昇腾970、2029年昇腾980的“一年一代”演进节奏。华为同时推出业界首个采用NPO光引擎的超节点与Hi-ONE光引擎,并称CANN生态已跨过拐点,核心使命是打造AI算力底座。
09/19 14:44
陶哲轩代表SAIR Foundation启动“开放数学模型计划”
菲尔兹奖得主陶哲轩代表SAIR Foundation宣布正式启动“开放数学模型计划”,意在联合学术界与产业界,为数学及科学研究构建开放权重模型与配套开源工具。计划首阶段聚焦论证理解、文献核对、代码编写与形式化证明等日常科研场景,并以开放许可、可复现评测与社区治理作为运作原则。
09/19 08:12
AI 演员蒂莉·诺伍德宣传行程遇挫:采访中疑似故障改说中文
TechCrunch AI 报道称,AI 演员蒂莉·诺伍德正在展开一轮宣传行程,但整体效果并不理想。报道提到,在一场格外反常的采访中,她似乎出现故障,转而开始用中文说话,成为这轮宣传中最受关注的一幕。