实时 AI 消息
B站上线AI无限竞技场测评榜:全球百大模型同场竞技
中文科技资讯报道,B站上线了名为“AI无限竞技场”的测评榜单,称全球百大模型将在同一场竞技中接受比较。这是这家视频社区首次以平台身份推出大模型评测入口,中文开发者与内容创作者由此多了一个观察模型能力的参照,也意味着模型评测的话语权正继续分散。

中文科技资讯报道,B站上线了名为“AI无限竞技场”的测评榜单,并将其描述为全球百大模型同场竞技的评测场。作为一个平台级的产品动作,它把过去散落在研究机构、海外榜单和厂商自测报告里的模型能力对比,搬进了B站自己的社区生态。
目前可确认的要点并不算多:榜单已经上线,其规模被描述为容纳上百个模型同场竞技。评测机制如何设计、参与模型的名单与版本如何确认、榜单多久更新一次,这些细节在标题与摘要层面都还没有展开。因此这条消息的新闻价值,主要落在“由谁来做评测”这一层,而不是某个模型拿到了什么新分数。
之所以值得关注,是因为评测榜单在最近两年事实上承担了选型指南的角色。开发者比较模型时,习惯先看榜单名次再做第二层筛选,榜单的口径直接决定哪些能力看起来更强。当榜单由平台自建,评测就同时是产品与运营的一部分,衡量什么、怎么衡量,都会带有平台自身的意图。
B站的身份让这件事更值得留意。它是国内规模最大的年轻用户视频社区之一,长期聚集大量技术、编程与AI相关内容的创作者和观众。对这样一个社区来说,模型评测既是内容素材,也是天然的讨论入口:榜单能带来对比、争论与二次创作,而这些内容又会回流到站内的内容循环里。
从模型厂商的角度看,多一个平台榜单就等于多一条曝光渠道;从平台角度看,把评测留在站内,能把用户对模型能力的兴趣转化成长时间停留的社区行为。两种动力叠加,也解释了为什么近一年平台型公司越来越愿意亲自下场做评测,而不是只引用第三方的结果。
接下来要看的还是方法说明。榜单是否公开评测规则、如何核验模型来源与版本、是否覆盖中文任务与多模态场景、能否保持稳定更新,这些都会决定它成为长期参考还是阶段性话题。如果口径与更新节奏都不透明,它更可能停留在传播层面。
对于中文大模型生态来说,多一个由大型内容平台维护的评测入口,意味着能力对比的参照系继续分散;对开发者而言,这是新的观察窗口,但只有等榜单方法公开之后,它才可能成为选型的依据。
为什么重要
中文大模型评测多了一个由大型内容平台维护的入口,模型厂商也多了一条曝光渠道;但在评测方法公开之前,它更像话题来源而非选型依据。
附近消息
全部09/20 14:48
前 OpenAI 研究员发布 Jev 模型,目标是让软件做快速、结构化的决策
据 OSCHINA 报道,一位前 OpenAI 研究员发布了名为 Jev 的模型,目标是帮助软件做出快速、结构化的决策。这是模型层把“决策”从通用对话中单独拎出来的一次新尝试,但公开信息目前只覆盖发布本身。
09/20 13:05
研究者借助Claude AI在72小时内访问OpenAI系统
据朝鲜日报报道,研究人员在72小时内借助Claude AI访问了OpenAI的系统,报道用这一时间跨度强调当前AI模型在系统探测上的效率。相关测试的具体范围、是否获得授权以及造成的影响,目前公开信息尚未给出更多细节。
09/20 13:03
夸夸菁领发布两大增收型智能体,企业级AI竞争进入“AI+数智员工”新赛道
据手机新浪网报道,夸夸菁领发布了两款面向增收场景的智能体产品,并把这一动作定位为企业级AI的“AI+数智员工”新赛道。报道认为,企业级AI的竞争重点正从通用能力展示,转向能够直接创造收入的数智员工落地。
09/20 12:50
Anthropic委托埃森哲审计前沿模型,埃森哲进入AI监督角色
据AD HOC NEWS报道,埃森哲(Accenture)正在承担一个新的AI监督角色,Anthropic已委托这家咨询公司对前沿模型进行审计。消息的关键在于,前沿模型实验室开始把外部专业机构引入模型评估环节,而不再只在内部完成安全审查。