ECCV 2026出现新动向:顶尖学者研究如何让AI看懂广告并参与商业决策

0 阅读

ECCV上的新议题:让AI看懂广告

9月初,瑞典马尔默,欧洲计算机视觉大会(ECCV 2026)正在举行。作为计算机视觉领域的顶级会议,ECCV历来是算法、模型和理论的竞技场。但今年,一个更贴近现实的问题被摆上台面:AI能不能做生意?

文章配图

具体来说,是AI能不能看懂一条营销视频,找出其中的关键时刻,并理解品牌想传达什么、为什么这样设计、效果可能如何。

文章配图

这个问题出现在名为 MARS2 的Workshop上。全称有点长——《大模型时代的多模态推理与慢思考:迈向System 2及以上》。名字虽学术,议题却很务实:当消费者越来越多地通过AI助手发现、比较和购买商品时,背后的AI智能体是否具备足够的商业理解力?

文章配图

这场Workshop由一家中国公司——钛动科技牵头举办,是本届ECCV唯一聚焦“智能体商业”(Agentic Commerce)的专题研讨。更引人注目的是,它配套了一场奖金10万美元的挑战赛,吸引了全球64支团队提交超过1060份方案。

学者阵容与核心问题

MARS2的讲台上,坐着几位多模态AI领域的重量级人物。

牛津大学的Yarin Gal教授长期研究AI预测的不确定性,关心模型给出的答案到底靠不靠谱;MIT的Paul Pu Liang助理教授专注多感官智能,探索文字、图像、声音如何被统一理解;伦敦玛丽女王大学的Shanxin Yuan研究数字人动作,林雪平大学的Fahad Shahbaz Khan则深耕视觉语言模型。

他们的分享指向同一个方向:AI不能只停留在“看见”,还要能“想明白”——在复杂、动态、跨模态的信息流中,梳理因果、识别意图,并转化为可靠行动。

这正是MARS2挑战赛的设计逻辑。比赛要回答一个看似简单的问题:AI能看懂营销视频吗?

技术上拆解为三层能力:

  • 先理解整条视频讲了什么(整体内容理解)
  • 再定位到影响用户决策的关键片段(关键时刻定位)
  • 最后推断背后的营销策略和商业意图(策略推理)

这三层对应三个赛道:MAC(Multimodal Advertisement Comprehension)、VTG(Video Temporal Grounding)和MDC(Marketing Decision Comprehension)。

真实广告数据集M-CAR

所有参赛队伍面对的是同一套考卷:M-CAR数据集

这个数据集由钛动科技基于真实商业场景构建,包含3108支广告视频,覆盖30多种语言,总时长36.5小时。这些视频被精细切分为18198个语义片段,平均7秒一个独立单元,每个片段都带有时间戳和标注。

选手需在本地运行模型,将结果上传至EvalAI平台统一评分。为了公平,比赛设了硬性限制:MAC和MDC赛道模型不超过14B参数,VTG不超过8B,且必须使用开源权重——闭源大模型无法参赛。

最终成绩很有意思:

  • MAC最高分86.67
  • VTG最高分62.27
  • MDC最高分63.53

从整体理解到精准定位再到策略推理,分数差距拉开了20多分。这说明,AI看懂广告“大概讲了什么”已经不是大问题,但要在几十秒的视频里准确找出“哪一帧最关键”、“为什么这样设计能促进转化”,仍是难点。

不同模型类型也表现出明显“偏科”。商用基线模型表现稳定,通用大模型在整体理解上占优,而任务专用模型在关键时刻定位(VTG)赛道尤其突出。看来,AI进考场也讲究术业有专攻。

谁答得最好?

来自中国科学技术大学、南开大学、中山大学等高校,以及字节跳动、京东、小红书等企业的团队纷纷参赛。

最终,一支名为 The Boys 的队伍表现抢眼:拿下MAC和MDC两个赛道的冠军,VTG赛道也获得亚军。这支有字节背景的团队,在有限模型规模下,靠精细的数据处理和推理架构脱颖而出。

VTG赛道冠军则是 Ya PTers,得分62.27。

值得注意的是,有团队在VTG赛道尝试为模型增加一条“音频证据时间线”——把人声、背景音乐、音效的发生时间精确标注,并与画面逐帧对齐。这一改动让定位精度提升了16.7分。相比之下,把模型参数从4B扩到8B,反而导致分数下降0.2分。

这个反常识的结果给产业界提了个醒:算力有限时,与其换更大的模型,不如先让AI“听全、看全、对准”

证据链工程:冠军方案的核心思路

三个赛道的优胜方案虽然技术细节不同,但共享一个核心理念:让AI拿着证据回答问题

比如,要判断一条广告如何传达产品价值,冠军方案不会让模型看完视频就直接输出结论。而是分几步走:

  1. 快速扫描:构建带时间戳的镜头级证据表征
  2. 主模型生成:基于证据生成初步答案
  3. 独立批判:由另一个模型验证答案与证据是否一致,抑制无依据的幻觉

视频越长、问题越复杂,系统还会动态分配更多Token,确保模型有足够空间处理信息。这种“Proposer-Critic”双模型架构,加上从粗到细的两阶段定位策略,构成了所谓的 “证据链工程”

这说明,进入真实商业流程后,模型大小固然重要,但信息如何组织、多模态如何对齐、推理链路是否可验证,同样决定AI能不能真正干活。

赛事结束后,所有评测基准、代码和优胜方案报告都将向研究社区开放,推动这一方向持续发展。

钛动科技:从商业实战到学术出题

为什么是钛动科技能把“智能体商业”带进ECCV?

答案藏在它的业务里。自2017年起,钛动服务中国品牌出海,覆盖200多个国家和地区,管理超4亿条广告策略、1400万个SPU。每天面对的问题非常具体:帮企业在不同市场找用户、做内容、投广告,再把花出去的钱赚回来

一条广告上线,用户在哪一帧划走、有没有点击下单,后台很快就有反馈。换个国家,答案可能完全不同。几十秒的视频里,画面、文案、音乐、人物情绪交织在一起,共同影响转化——这本身就是一道复杂的多模态题。

近十年反复处理这类场景,钛动积累了一套从“看懂”到“理解”的能力,并沉淀为自研的多模态大模型 钛极(Tec-Chi)

今年初,钛极问答推理模型Tec-Chi-Think-1.0-32B在SuperCLUE-Mkt广告营销专业测评中以85.82分登顶;半年后,其内容理解模型Tec-Chi-VL-1.0-27B又在SuperCLUE-AdsVU出海视频理解测评中获总榜第二。

但模型强不等于能赚钱。真正验证能力的是落地平台 Navos——一个面向跨境营销的多智能体平台。它把市场洞察、内容生成、广告投放、效果优化等环节串联起来,按企业目标调用不同专业Agent。

实际效果如何?今年7月,钛动成为ChatGPT Ads全球首批官方技术合作伙伴。在定向测试中,某出海品牌经其AI优化后,ROI提升至原来的2.5倍。

财务数据也佐证了这一点:2025年前三季度,钛动AI营销解决方案收入达1.16亿美元,同比增长68.5%,占总收入89.5%;净收入留存率132.5%,老客户不仅没走,还在追加投入。

这套“真实业务提出问题→数据反馈训练模型→Agent嵌入工作流→商业结果验证效果”的闭环,正是MARS2挑战赛的底层逻辑。钛动把已在产业跑通的技术路径开放给学术界,让研究直面真实难题。

技术公司为何扎堆当“顶会出题人”?

MARS2并非孤例。近年来,技术公司在顶会中的角色正在转变——从“交卷者”变成“出题人”。

CVPR 2025的Embodied AI Workshop由NVIDIA、Meta、Apple、Microsoft等联合组织;自动驾驶领域,Waymo持续举办基于真实道路数据的挑战赛。企业把一线遇到的难题直接抛给全球研究者,既加速技术突破,也让学术成果更快落地。

钛动的做法如出一辙。2025年前三季度营收1.30亿美元,毛利率连续三年超82%,账上现金储备4.4亿美元。这份商业成绩背后,是一个极其复杂的多模态业务现场:不同文化、语言、用户偏好叠加画面、声音、文案和商业目标,随便拎出一项,都值得深入研究。

通过MARS2,钛动把这些问题搬上国际舞台,吸引顶尖人才带来新思路,优秀方案再反哺产业。它无意中扮演了 “产学研连接器” 的角色。

更重要的是,这场活动预示了多模态AI的下一个方向:回到真实商业场景中去

过去比的是模型能不能识别图片或描述视频,接下来要比的是,它能不能在跨文化、多语言、多目标交织的环境中,真正解决问题、创造价值。

顶会讨论什么,往往预示技术走向哪里。这一次,方向明确指向了真实世界。而钛动科技,已经提前一步,把这道题摆上了桌面。