AI 学习社区

 找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 6|回复: 0

ECCV上,顶尖学者们开始研究如何让AI做生意了

[复制链接]

34

主题

0

回帖

63

积分

管理员

积分
63
发表于 前天 04:27 | 显示全部楼层 |阅读模式






AI下一步往哪儿走,顶会往往最先露出风声。

9月8日至12日,ECCV 2026正在瑞典马尔默举行。大会由欧洲计算机视觉协会主办,汇聚了Google、Meta、Apple、Amazon等全球科技巨头作为主要赞助商。

作为计算机视觉顶会的ECCV,向来是前沿学术的竞技场,但今年,一个更贴近现实世界的技术命题被摆上了桌面:

Agentic Commerce(智能体商业)。

没听错吧?在一个纯CS视觉顶会上,一帮顶尖学者开始认真研究如何让AI做生意了。

镜头拉到MARS2 Workshop,台下座位早已坐满了人。

台上星光熠熠,牛津、MIT、伦敦玛丽女王大学等机构的研究者轮番登场,聊的都是多模态AI正在攻克的前沿问题。

会场外的配套挑战赛也已决出优胜方案,10万美元奖金池,吸引64支全球团队入场,累计提交超过1060份方案。

人气、阵容、奖金、议题热度,都拉满了。

把这些要素串在一起的,是一家中国科技公司:钛动科技。

这场Workshop名叫MARS2,全称《Multimodal Reasoning and Slow Thinking in the Large Model Era: Towards System 2 and Beyond》(大模型时代的多模态推理与慢思考:迈向System 2及以上)。

它指向一个正在发生的现实:智能体商业正在改变消费者发现、比较、购买的完整交易链路。那么,当这条链路越来越多地由AI智能体参与甚至代理,多模态AI能否先看懂内容、理解意图,并据此优化商业动作?

根据ECCV官网公开信息,MARS2是本届ECCV全部Workshop中,唯一一个由中国科技公司牵头举办的Agentic Commerce方向的Workshop。

所以,全球研究者们在MARS2 Workshop上,碰撞出了哪些「让AI做生意」的解法?

首先,判断一道题的学术分量,最快的方法是看台上坐着谁。

那么,MARS2都有谁在?我看到了这4个名字:

牛津大学教授Yarin Gal,是现代贝叶斯深度学习的代表学者之一,领导牛津OATML实验室,长期研究AI给出的答案到底靠不靠谱。

MIT助理教授Paul Pu Liang,同时任教于MIT Media Lab和EECS,带队研究多感官智能,专门解决文字、语音、视频等不同信息如何被模型放在一起理解的问题。

伦敦玛丽女王大学的Shanxin Yuan主攻数字人与运动智能;林雪平大学的Fahad Shahbaz Khan长期研究视觉识别、视觉语言模型和多模态理解。

能把这样一套阵容凑到同一张议程表上,MARS2的学术号召力,已经不用多解释了。

4位嘉宾的分享,共同指向多模态AI的下一步:不再只是「看见一段视频、说出几句描述」,而是能在复杂、动态、跨模态的信息中找到证据,理解事件如何发生、意图如何形成,并把判断转化为可靠行动。

这条从「看见」到「想明白」的完整链路,恰好也是MARS2多模态AI挑战赛(MARS2 2026 Challenge)赛题设计的底层逻辑。

更具体地说,MARS2多模态AI挑战赛要回答这个问题:AI,能看懂营销视频吗?

技术拆解来看其实就三层:

先看懂整条视频,再找到关键时刻,最后读懂背后的营销意图。

这三层能力,也分别对应挑战赛设置的三条赛道。

三条赛道共用的考卷叫M-CAR。

这是一个基于钛动科技真实商业场景构建的高质量数据集,包含3108支广告视频,覆盖30多种语言。总计36.5小时的视频被精细拆分为18198个语义片段,平均约7秒就有一个独立片段。

选手需要在本地让模型逐一答题,再把结果上传至EvalAI,由平台统一评分和排名。

一番较量下来,最有意思的结果出现了。

MAC最高分达到86.67,VTG和MDC的最高分则分别为62.27和63.53。

从整体理解到精准定位和策略推理,冠军方案成绩相差20多分。

看来,看懂广告讲了什么,只是第一步;要在长视频中找准关键时刻、进一步拆解营销意图,仍是多模态AI更难啃的题。

再把不同类型的模型拉到一起比比,也能看出明显的「偏科」。

作为对照基线的商用模型,在三个赛道中表现都比较稳;通用模型和任务专用模型则各有长短,其中任务专用模型在VTG赛道尤其突出。

就是说,AI进了考场也讲究术业有专攻。

整体情况说完,再看谁把卷子答得最好。

来自中国科学技术大学、南开大学、中山大学等知名高校的学者,以及来自字节跳动、京东、小红书等知名企业的代表纷纷参赛,最终,在MAC赛道,The Boys以86.67分拿下冠军;VTG赛道冠军是Ya PTers,成绩为62.27分;MDC赛道又被The Boys以63.53分收入囊中。

字节跳动背景的团队The Boys一支队伍拿下两个冠军和一个亚军,属实有点能打。

而且这次参赛还有硬限制。

MAC和MDC使用的模型不能超过14B,VTG不能超过8B,并且只能使用开源权重。

想靠巨型闭源模型硬压分数?此路不通。

选手只能在有限的模型体量里,把数据处理和推理方法往细了做。

(是时候展现真正的技术了.jpg)

这场挑战赛给学术界和产业界留下了三个关键信号。

第一,它划清了当前多模态AI的能力边界。

前面的成绩已经说明,模型看懂广告的大致内容问题不大,可一旦需要跨越多个片段,梳理时序关系、追溯前因后果,再作出商业判断,表现就会明显下滑。

这正是从「System 1」感知走向「System 2」推理的距离。

说得更直白一点,AI已经会看广告了,但离真正看懂一门生意、参与商业决策,还有一段路要走。

第二,它给出了一条性价比更高的优化路线。

一般提到提升模型能力,大家最先想到的就是加参数,但这次的消融实验给出了一个有点反常识的结果。

VTG赛道有团队为模型补上一条跨模态「音频证据时间线」,把人声、音乐和其他声音发生的时间标出来,再与画面逐一对齐,模型定位精度直接提高了16.7分。

相比之下,参数量从4B扩展到8B反而-0.2分。

这对产业界的提示很直接:

算力有限时,与其急着换更大的模型,不如先让模型听全、看全,再把信息对准。

第三,它给出了一套清晰的落地思路。

三个赛道的冠军方案用到了Proposer-Critic双模型验证、从粗到细的两阶段定位,以及按照视频时长来灵活分配模型处理的视觉信息量,虽然听上去技术名词不少,但核心逻辑就一句话:

让AI拿着证据回答问题。

举个例子,现在要让AI判断一条广告是如何向消费者传达产品的核心卖点和实际价值,冠军方案不会让模型看完整条视频后,直接拍脑袋报一个答案。

它会先快速扫一遍,构建镜头级、带时间戳的证据表征,由主模型生成答案;最后交给另一个模型独立进行证据一致性批判,抑制无证据支撑的幻觉输出。

视频越长、问题越复杂,系统还会相应多分配一些Token,让模型有足够空间处理信息。

竞赛技术方案报告把这套思路概括为「证据链工程」。

这启发业界,模型有多大固然重要,但真正进入商业流程后,信息怎么组织、不同模态如何对齐、推理链路是否可靠,同样决定了AI到底能不能干活。

比赛结束后,这些成果也不会只停在领奖台上。

赛事设计、评测结果和优胜方案已经整理成技术报告,相关评测基准与代码也会向研究社区开放(地址放文末了)。

钛动科技CTO Tracy Chen博士认为,MARS2 Workshop的成功举办验证了一个判断——AI Agent正在从概念走向真实的商业场景,营销是少数既需要复杂智能、又能快速验证效果的领域之一。

钛动科技品牌公关VP张羽雪在闭幕致辞中也表示,MARS2 Workshop的讨论展现了前沿技术如何解决真实商业难题,而这正是钛动科技在国际顶尖学术会议组织讨论、举办挑战赛的目的。

围绕多模态AI接下来该补什么、又该怎么补,答案如今更加具象化了。

聊到这儿,还有一个问题绕不过去。

为什么钛动科技可以把Agentic Commerce的核心技术关切带进ECCV?

事实上,MARS2要回答的「AI能否看懂商业视频并理解营销意图」这个问题,钛动已经在真实业务中回答了近十年。

从覆盖全球200多个国家和地区、服务10万+品牌出海、累计管理4亿+条广告策略、1400万个SPU的业务实践中,钛动积累了一套从「看懂」到「理解」的多模态能力,MARS2是钛动长期业务积累与多模态AI布局的一次自然延伸……

查看原文

(本文转载自量子位,仅作资讯分享)
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

网站介绍
AI 学习社区(subo.qd.je)—— 一个专注 AI 学习、技术交流与资讯分享的社区平台。欢迎每一位 AI 爱好者!
快捷访问
我的帖子
我的收藏
我的好友
我的关注
附加功能
任务大厅
勋章中心
每日签到
排行榜
关于我们
举报
手机版
站点统计
注册账号

AI 学习社区

GMT+8, 2026-9-13 18:06 , Processed in 0.030262 second(s), 19 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表