WebArena作者Shuyan Zhou加入Meta超级智能实验室,专注AI浏览器开发

0 阅读

从帮妈妈订机票的愿望出发

Shuyan Zhou最近加入了Meta的超级智能实验室(Superintelligence Labs,简称MSL),但她的目标很具体:做一款能帮妈妈订机票的AI浏览器。

文章配图

这个想法早在她申请博士时就写进了材料里。早年她给母亲买了一台中文版Alexa,能聊天气、放音乐,但一涉及订票这类复杂操作就无能为力。妈妈只能打电话让她一步步指导。这件事让她开始思考:能不能造一台仅靠自然语言对话就能自动完成任务的设备?

文章配图

2024年,她在卡内基梅隆大学完成博士论文《使用AI智能体解决现实世界任务》,算是对这个问题的阶段性回应。两年后,她带着这个方向正式加入Meta,成为MSL团队的一员。

文章配图

WebArena:让AI在真实网页环境中练手

文章配图

Shuyan Zhou最广为人知的工作是WebArena——一个用于训练和评估AI智能体在真实网页环境中执行任务的平台。

文章配图

在WebArena出现前,大多数浏览器智能体的研究都在简化或静态的网页上进行。这些环境便于实验控制,但无法反映真实网站的动态变化、权限限制和连续操作逻辑。比如,一个电商网站可能在用户登录后才显示订单页面,或者表单提交失败后需要重新填写——这些细节在简化环境中往往被忽略。

文章配图

WebArena用开源软件重建了电商、论坛、代码协作平台和内容管理系统等典型网站,形成一套可独立部署、可重复使用的交互环境。团队还设计了241类任务模板,生成812项具体测试任务,要求AI根据自然语言指令完成搜索、点击、输入、跳转甚至内容修改等操作。

这套系统的核心价值在于:它逼着AI在接近真实互联网的场景中“干活”,而不是在玩具环境里跑分。

从文字到视觉,再到整个操作系统

WebArena之后,Shuyan Zhou又参与了VisualWebArena项目。这个版本保留了原有框架,但把评测重点从纯文本扩展到了视觉元素——比如图标识别、页面布局理解和图像内容操作。项目新增了910项需要视觉感知能力的任务,比如“点击右上角的购物车图标”或“上传这张图片到个人资料”。

再往后,她与香港大学XLANG团队等合作推出了OSWorld。这一次,评测范围不再局限于浏览器,而是覆盖整个计算机操作系统。OSWorld包含369项跨应用任务,涉及文件管理、办公软件操作、多程序协同等场景。例如,“从邮件附件下载表格,在Excel中修改数据,再通过WhatsApp发送给同事”。

2024年4月公开的数据显示,人类在这些任务上的平均完成率是72.36%,而当时表现最好的AI模型只有12.24%。差距背后是多重挑战:视觉定位不准、长程规划能力弱、面对动态页面容易迷失、出错后难以恢复,还有系统权限带来的限制。

这些问题,也正是Shuyan Zhou现在在Meta要攻克的方向。

加入Meta超级智能实验室

Shuyan Zhou并非首次与Meta结缘。2024年博士毕业后,她曾短暂加入Meta的GenAI团队,在Ruslan Salakhutdinov领导下研究Llama通用计算机操作智能体。后来她去了杜克大学任教,直到今年初重返Meta,这次直接进入新成立的超级智能实验室。

MSL成立于2025年6月,是Meta整合AI业务后的核心引擎。它把基础模型研发(TBD Lab)、长期研究(FAIR)、产品落地团队和基础设施支持全部纳入统一架构,目标只有一个:打造“个人超级智能”——不是取代人类,而是通过Meta AI、WhatsApp、Instagram乃至智能眼镜等入口,真正理解并帮用户实现目标。

为实现这一愿景,Meta在过去一年高调招募顶尖人才,开出业内顶级薪酬。值得注意的是,MSL已公开的核心成员中,华裔占比接近一半。

除了Shuyan Zhou,还包括:

  • Alexandr Wang:MSL总负责人,19岁创办Scale AI,后获Meta 143亿美元投资;
  • 赵晟佳:首席科学家,清华本科,曾参与OpenAI的ChatGPT、GPT-4及推理模型研发;
  • 宋飏:首席研究员,扩散模型代表人物,曾任OpenAI战略探索团队负责人;
  • 毕树超:浙大数学系出身,曾任Google工程负责人,在OpenAI负责多模态后训练,现专注强化学习与智能体;
  • Dawn Song:清华本科、UC Berkeley教授,专注AI安全与可信智能体。

这批人构成了当前全球AI前沿研究的核心力量,而Shuyan Zhou的研究路径——从WebArena到OSWorld——恰好与MSL的产品方向高度契合。

Muse智能体:AI浏览器的雏形?

今年4月,MSL发布了首个成果:Muse Spark,一款专为个人智能体场景设计的多模态推理模型。9月,基于该模型的个人智能体“Muse”正式推出。

用户可以向Muse交代目标,比如“帮我整理上周的会议纪要并安排下周日程”,它会自动处理邮件、填写表格、比价购物,甚至制定长期计划。未来,Muse还将接入Meta的AI智能眼镜,实现更自然的交互。

虽然Meta尚未明确说明Muse是否直接使用了WebArena或OSWorld的技术,但两者在理念上高度一致:让AI在真实数字环境中替用户完成端到端任务。Shuyan Zhou的加入,很可能加速这一能力的落地。

挑战仍在,但方向清晰

目前AI在操作系统和网页环境中的表现仍远未达到实用水平。OSWorld的测试结果已经说明问题:模型在简单任务上或许能应付,但一旦涉及多步骤、跨应用、动态反馈的场景,成功率骤降。

Shuyan Zhou过去几年的工作,本质上是在搭建“考场”,逼AI暴露短板。现在她进入Meta,角色从出题人变成了答题人。她需要把学术框架转化为稳定可靠的产品功能,同时应对工程化带来的新问题:延迟、隐私、安全、用户信任……

但她始终没偏离最初的那个念头——做一个能让普通人(比如她妈妈)轻松使用的工具。没有宏大叙事,没有“重塑人类文明”的宣言,只是一个具体的需求驱动着技术往前走。

或许正是这种接地气的目标,反而更接近“超级智能”的本质:不是无所不能的神,而是懂你、帮你、不添乱的伙伴。