郭震 AI公众号:郭震AI

实时 AI 消息

B站上线AI无限竞技场测评榜:全球百大模型同场竞技

中文科技资讯报道,B站上线了名为“AI无限竞技场”的测评榜单,称全球百大模型将在同一场竞技中接受比较。这是这家视频社区首次以平台身份推出大模型评测入口,中文开发者与内容创作者由此多了一个观察模型能力的参照,也意味着模型评测的话语权正继续分散。

发布时间
B站上线AI无限竞技场测评榜:全球百大模型同场竞技
图源: bilibili.com

中文科技资讯报道,B站上线了名为“AI无限竞技场”的测评榜单,并将其描述为全球百大模型同场竞技的评测场。作为一个平台级的产品动作,它把过去散落在研究机构、海外榜单和厂商自测报告里的模型能力对比,搬进了B站自己的社区生态。

目前可确认的要点并不算多:榜单已经上线,其规模被描述为容纳上百个模型同场竞技。评测机制如何设计、参与模型的名单与版本如何确认、榜单多久更新一次,这些细节在标题与摘要层面都还没有展开。因此这条消息的新闻价值,主要落在“由谁来做评测”这一层,而不是某个模型拿到了什么新分数。

之所以值得关注,是因为评测榜单在最近两年事实上承担了选型指南的角色。开发者比较模型时,习惯先看榜单名次再做第二层筛选,榜单的口径直接决定哪些能力看起来更强。当榜单由平台自建,评测就同时是产品与运营的一部分,衡量什么、怎么衡量,都会带有平台自身的意图。

B站的身份让这件事更值得留意。它是国内规模最大的年轻用户视频社区之一,长期聚集大量技术、编程与AI相关内容的创作者和观众。对这样一个社区来说,模型评测既是内容素材,也是天然的讨论入口:榜单能带来对比、争论与二次创作,而这些内容又会回流到站内的内容循环里。

从模型厂商的角度看,多一个平台榜单就等于多一条曝光渠道;从平台角度看,把评测留在站内,能把用户对模型能力的兴趣转化成长时间停留的社区行为。两种动力叠加,也解释了为什么近一年平台型公司越来越愿意亲自下场做评测,而不是只引用第三方的结果。

接下来要看的还是方法说明。榜单是否公开评测规则、如何核验模型来源与版本、是否覆盖中文任务与多模态场景、能否保持稳定更新,这些都会决定它成为长期参考还是阶段性话题。如果口径与更新节奏都不透明,它更可能停留在传播层面。

对于中文大模型生态来说,多一个由大型内容平台维护的评测入口,意味着能力对比的参照系继续分散;对开发者而言,这是新的观察窗口,但只有等榜单方法公开之后,它才可能成为选型的依据。

为什么重要

中文大模型评测多了一个由大型内容平台维护的入口,模型厂商也多了一条曝光渠道;但在评测方法公开之前,它更像话题来源而非选型依据。

微博邮件

BilibiliAI BenchmarkLLM
返回AI日报

附近消息

全部

09/20 16:30

APUS开源Jev跨平台复现fast-browser-use:本地模型离线完成浏览器决策

9月19日,中国人工智能企业APUS旗下AI实验室公布了全球最早一批针对Jev的独立开源复现成果,并将其封装为开箱即用的Agent Skill“fast-browser-use”,支持纯本地模型离线执行。该项目以MIT协议开放,可运行在GPU服务器或无GPU的Mac与PC上,APUS公布的实测数据显示本机检索任务中位耗时约18秒、零云端调用。

09/20 14:48

前 OpenAI 研究员发布 Jev 模型,目标是让软件做快速、结构化的决策

据 OSCHINA 报道,一位前 OpenAI 研究员发布了名为 Jev 的模型,目标是帮助软件做出快速、结构化的决策。这是模型层把“决策”从通用对话中单独拎出来的一次新尝试,但公开信息目前只覆盖发布本身。

09/20 17:39

智谱ZCode上传机制被曝:用户代码库被悄然打包上传

9月20日,一则公开报道称智谱旗下编程工具ZCode的上传机制被曝光,用户的代码库会在未明确告知的情况下被打包上传。该说法来自第三方分析,目前尚无智谱方面的公开说明。

09/20 18:39

智谱披露GLM-5.3:模型开始优化承载自己的推理系统,RSI迹象初现

开源中国发布的报道显示,智谱披露了GLM-5.3的相关情况,其初步显现的RSI(递归自我改进)迹象受到关注:模型开始优化承载自身运行的推理系统。这一表述把“模型改进自己的执行环境”从概念讨论推进到了具体产品层面。