郭震 AI公众号:郭震AI

实时 AI 消息

B站上线AI无限竞技场测评榜:全球百大模型同场竞技

中文科技资讯报道,B站上线了名为“AI无限竞技场”的测评榜单,称全球百大模型将在同一场竞技中接受比较。这是这家视频社区首次以平台身份推出大模型评测入口,中文开发者与内容创作者由此多了一个观察模型能力的参照,也意味着模型评测的话语权正继续分散。

发布时间
B站上线AI无限竞技场测评榜:全球百大模型同场竞技
图源: bilibili.com

中文科技资讯报道,B站上线了名为“AI无限竞技场”的测评榜单,并将其描述为全球百大模型同场竞技的评测场。作为一个平台级的产品动作,它把过去散落在研究机构、海外榜单和厂商自测报告里的模型能力对比,搬进了B站自己的社区生态。

目前可确认的要点并不算多:榜单已经上线,其规模被描述为容纳上百个模型同场竞技。评测机制如何设计、参与模型的名单与版本如何确认、榜单多久更新一次,这些细节在标题与摘要层面都还没有展开。因此这条消息的新闻价值,主要落在“由谁来做评测”这一层,而不是某个模型拿到了什么新分数。

之所以值得关注,是因为评测榜单在最近两年事实上承担了选型指南的角色。开发者比较模型时,习惯先看榜单名次再做第二层筛选,榜单的口径直接决定哪些能力看起来更强。当榜单由平台自建,评测就同时是产品与运营的一部分,衡量什么、怎么衡量,都会带有平台自身的意图。

B站的身份让这件事更值得留意。它是国内规模最大的年轻用户视频社区之一,长期聚集大量技术、编程与AI相关内容的创作者和观众。对这样一个社区来说,模型评测既是内容素材,也是天然的讨论入口:榜单能带来对比、争论与二次创作,而这些内容又会回流到站内的内容循环里。

从模型厂商的角度看,多一个平台榜单就等于多一条曝光渠道;从平台角度看,把评测留在站内,能把用户对模型能力的兴趣转化成长时间停留的社区行为。两种动力叠加,也解释了为什么近一年平台型公司越来越愿意亲自下场做评测,而不是只引用第三方的结果。

接下来要看的还是方法说明。榜单是否公开评测规则、如何核验模型来源与版本、是否覆盖中文任务与多模态场景、能否保持稳定更新,这些都会决定它成为长期参考还是阶段性话题。如果口径与更新节奏都不透明,它更可能停留在传播层面。

对于中文大模型生态来说,多一个由大型内容平台维护的评测入口,意味着能力对比的参照系继续分散;对开发者而言,这是新的观察窗口,但只有等榜单方法公开之后,它才可能成为选型的依据。

为什么重要

中文大模型评测多了一个由大型内容平台维护的入口,模型厂商也多了一条曝光渠道;但在评测方法公开之前,它更像话题来源而非选型依据。

微博邮件

BilibiliAI BenchmarkLLM
返回实时消息

附近消息

全部