郭震 AI公众号:郭震AI

实时 AI 消息

ECCV 2026上,MARS2 Workshop把“AI做生意”变成了一道评测题

在瑞典马尔默举行的ECCV 2026上,由中国科技公司钛动科技牵头的MARS2 Workshop聚焦Agentic Commerce,配套挑战赛设10万美元奖金池,吸引全球64支团队提交超过1060份方案。三条赛道最高分分别为86.67、62.27和63.53,赛事同时开放了包含3108支广告视频的M-CAR数据集与技术报告。

发布时间
ECCV 2026上,MARS2 Workshop把“AI做生意”变成了一道评测题
图源: qbitai.com

据量子位报道,2026年9月8日至12日,计算机视觉顶会ECCV 2026在瑞典马尔默举行。报道把焦点放在其中一个名为MARS2的Workshop上:它的全称是《大模型时代的多模态推理与慢思考:迈向System 2及以上》,主题直指一个更贴近现实世界的方向——Agentic Commerce(智能体商业)。

报道援引ECCV官网公开信息称,MARS2是本届ECCV全部Workshop中唯一一个由中国科技公司牵头举办的Agentic Commerce方向Workshop,牵头方是钛动科技。Workshop聚集了牛津大学教授Yarin Gal、MIT助理教授Paul Pu Liang,以及伦敦玛丽女王大学Shanxin Yuan、林雪平大学Fahad Shahbaz Khan等研究者,讨论的是多模态AI如何从"看见"走向"想明白"。

与Workshop配套的是MARS2 2026 Challenge。报道称挑战赛设10万美元奖金池,吸引全球64支团队参赛,累计提交超过1060份方案。赛题围绕"AI能否看懂营销视频"展开,分为三层:先看懂整条视频,再找到关键时刻,最后读懂背后的营销意图,三层分别对应三条赛道。

三条赛道共用的数据集叫M-CAR,基于钛动科技的真实商业场景构建:包含3108支广告视频,覆盖30多种语言,总计36.5小时的视频被拆分为18198个语义片段,平均约7秒就有一个独立片段。选手需要在本地让模型逐一答题,再把结果上传至EvalAI,由平台统一评分和排名。

成绩方面,报道给出三条赛道的最高分:MAC赛道86.67,VTG赛道62.27,MDC赛道63.53。在MAC赛道夺冠的是The Boys,VTG赛道冠军是Ya PTers,MDC赛道冠军同样由The Boys拿下——报道称,这支有字节跳动背景的队伍一支队伍拿到两个冠军和一个亚军。

比赛还设有硬性限制:MAC和MDC使用的模型不能超过14B,VTG不能超过8B,并且只能使用开源权重。报道认为,这排除了用巨型闭源模型硬压分数的路径,逼着选手在有限的模型体量里把数据处理和推理方法往细了做。

报道从结果里总结出三个信号。第一是能力边界:模型看懂广告的大致内容问题不大,但一旦需要跨越多个片段梳理时序关系、追溯前因后果并作出商业判断,成绩就会明显下滑。第二是优化路线:VTG赛道有团队为模型补上跨模态的"音频证据时间线",把定位精度提高了16.7分,而参数量从4B扩展到8B反而下降了0.2分。第三是落地思路:冠军方案用到Proposer-Critic双模型验证、从粗到细的两阶段定位,以及按视频时长分配模型处理的视觉信息量,核心逻辑被概括为"证据链工程"。

值得关注的是,这类顶会Workshop的角色正在变化:越来越多垂直赛道的头部技术公司不再只是派研究员投论文,而是直接下场设置研究议程,通过出题、设奖金、开放基准,把产业一线碰到的问题摆到全球研究者面前。报道也提到,本次赛事设计、评测结果和优胜方案已整理成技术报告,相关评测基准与代码将向研究社区开放。

为什么重要

这场Workshop释放的信号是,多模态AI的评测重点正在从看懂内容转向基于证据做商业判断:三条赛道最高分之间相差20多分,说明长视频中的关键时刻定位与营销意图推理仍是明显短板。对企业而言,这也提示在算力有限时,先把跨模态证据对齐做好,可能比单纯扩大参数量更划算。

微博邮件

MultimodalAgentECCV
返回实时消息

附近消息

全部