郭震 AI公众号:郭震AI

实时 AI 消息

B站「AI无限竞技场」上线:全球百大模型同场竞技,GPT-6高居榜首

据《证券市场周刊》9月16日报道,B站当天上线「AI无限竞技场」,首期大模型测评榜单同步公布,GPT-6 Astra在10位UP主的测评中拿下榜首,前五名里国产模型占据三席。榜单汇集UP主对上百个大模型的真实场景实测,排名将实时更新并持续开放报名。

发布时间
B站「AI无限竞技场」上线:全球百大模型同场竞技,GPT-6高居榜首
图源: bilibili.com

9月16日,B站「AI无限竞技场」正式上线,首期大模型测评榜单同步公布。据《证券市场周刊》报道,GPT-6 Astra在10位UP主的测评中拿下榜首,在与GLM-5.3的竞争中成为获得榜首次数最多的模型,前五名里国产大模型占据三席。

与传统跑分评测不同,这个竞技场并没有由平台设定统一题库。它是一个汇集B站UP主AI大模型测评的广场,由各领域UP主对上百个大模型的真实场景实测构成,涵盖代码、推理、协作、知识等多种主题。UP主以真实工作流、专业应用乃至趣味脑洞自主命题,让不同模型在同题PK中呈现实际表现差异。

首期榜单已经覆盖DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、Hy、MiniMax等主流模型。换句话说,这是一张把开源与闭源、国内与海外模型放在同一张桌子上比较的榜单。

平台给出的背景数据是,过去一年B站AI知识内容消费时长同比增长72%,月均观看AI内容的用户超过1.9亿。对B站而言,直播、视频与弹幕的互动形态天然适配AI爱好者的信息获取与交流需求,大量测评内容已经在社区沉淀,「AI无限竞技场」更像是对这些内容的集合与重新组织,而不是从零搭建的评价体系。

值得注意的是,榜单排名将实时更新,并持续面向全站UP主开放报名。这意味着它不是一次性的发布,而是一个打算长期运行的评测入口,样本会随着更多真实场景的测评案例不断补充。

竞技场式榜单的价值,很大程度上取决于评测如何采样、由谁打分、结果如何聚合。目前公开的信息集中在“UP主自主命题、同题PK”这一层,完整的评分与聚合方法还没有展开。对模型厂商来说,榜单名次正在变成一种公开的营销资产,榜首位置尤其如此,这也是外界会格外盯住评测透明度的原因。

后续有三个看点:B站是否会公布更完整的评测方法与完整榜单;排名实时更新之后,头部模型的名次能否保持稳定;以及这种由创作者驱动的测评,会不会成为国内用户判断模型强弱的一个常用入口。

为什么重要

把上百个模型的实测交给社区创作者出题,B站实际上是在用内容生态做一件评测机构长期在做的事;如果公开的榜单机制足够透明并持续更新,它可能成为国内用户感知模型强弱的新入口。

微博邮件

Bilibili大模型评测GPT-6AI Arena
返回实时消息

附近消息

全部

09/16 11:40

被英伟达点名的杭州团队,把蛋白质设计搬进了Agent工作台

杭州AI蛋白质设计公司力文所近日发布Lévin™ Harness,这是一款以Agent为核心的蛋白质设计应用,已面向科研社区开放使用,目前支持搭载Apple芯片的Mac。它把数据、模型、插件工具、算力和工作流放进同一个Agent工作区,希望把模型之外的文献调研、环境配置、计算提交与结果分析串成一条可复用的科研闭环。

09/16 11:07

把记忆交给CPU,大模型会变快:英特尔给出数据中心KV Cache优化方案

量子位9月16日的文章介绍了英特尔面向数据中心的KV Cache优化思路:把推理中不断膨胀的记忆从显存下沉到CPU侧内存与存储,让GPU专注生成Token。围绕KV Shrink、KV Fuse、KV Cascade、KV Infinity四个方向,英特尔披露的测试显示,开启分层卸载后首Token时延最高加速约5倍,硬件压缩可把缓存空间缩小约20%至30%。

09/16 10:27

华为GTS让运维Agent学会「看着网络排障」,双防火墙难题几乎通关

量子位报道称,华为GTS让Agent学会「看着网络排障」,在双防火墙这类难题上几乎全部拿下。该方案使任务通过率提升24.2%,token成本最高下降45%。

09/16 09:51

前Anthropic研究员指称Anthropic加速AI自我改进竞赛

据chosun.com报道,一名前Anthropic研究员公开指称,Anthropic正在加速AI自我改进的竞赛。相关说法把这家以安全为核心定位的实验室推到舆论焦点,但报道目前只给出指称本身,尚未提供可供外部核验的具体证据。