腾讯WorkBuddy Bench:重构编码智能体全场景评测新范式
在人工智能技术飞速迭代的当下,大型语言模型(LLM)与智能体(Agent)的能力边界正在被不断拓宽。然而,与之相伴的评测体系却长期处于一种割裂状态:代码修复能力依赖SWE-bench,前端生成看Design2Code,而涉及生产环境的安全性与复杂业务流程处理往往缺乏统一且透明的公开标准。这种碎片化的评估方式不仅难以全面反映智能体在真实工作场景中的综合效能,更因数据集的公开性导致了严重的“记忆污染”问题——模型可以通过背诵题库而非真正理解逻辑来获取高分。针对这一行业痛点,腾讯联合优图实验室、科恩安全实验室等多个顶尖团队,正式推出了WorkBuddy Bench。这不仅是一套多领域评测套件,更是一次对AI能力评估范式的深刻重构,旨在将“真实工作分布”完整映射到考场之中。
WorkBuddy Bench的核心创新在于其任务构建的逻辑底层。传统的评测基准往往直接引用开源代码库或公开竞赛题目,这使得具备强大检索能力的模型能够轻易通过互联网搜索找到原题及其标准答案。为了彻底阻断这条捷径,WorkBuddy Bench采用了“逆向工程”的策略。研究团队从真实的代码提交记录、拉取请求(Pull Request)以及企业内部的业务场景中提取原始素材,将其改写为简短、口语化且带有特定角色扮演的自然语言请求。这种处理方式使得任务提示词与原始的PR或提交线索之间失去了直接的文本对应关系,即便模型拥有全网搜索能力,也无法通过关键词匹配找到现成的解决方案。更重要的是,整个数据集包括任务目录、环境镜像、评估工具、测试用例及参考方案全部公开发布,其抗污染能力不依赖于数据的保密,而是依赖于这种独特的构造方式与严格的版本管理机制。这种“阳光下的防伪”思路,为后续开源评测基准的设计提供了极具价值的参考路径。
该评测套件横跨四个关键工作领域,共计包含260个独立任务,分别是代码工程(80题)、网页前端(70题)、办公自动化(50题)以及网络安全(60题)。这四个子集并非简单堆砌,而是各自代表了智能体在不同维度上的核心能力挑战。在代码子集中,任务聚焦于仓库级的软件工程问题,涵盖开发者、算法工程师、产品经理、QA及运维五种角色视角,要求智能体在处理信息不充分的情况下,自主找回上下文并完成修复或开发任务。网页子集则关注前端制品的生成,强调视觉还原与代码规范的统一。办公子集模拟了多文件处理的业务流程,考验智能体在复杂文档间的逻辑跳转与信息整合能力。而安全子集最为特殊,引入了红蓝队对抗机制,其中红队任务38题,蓝队任务22题,直接锚定binutils、curl、nginx等真实软件的历史CVE漏洞,要求智能体进行白盒审计与漏洞挖掘。
为了确保评分的客观性与科学性,WorkBuddy Bench为不同子集设计了差异化的验证与评分机制,并明确拒绝报告套件的平均分,以避免不同维度能力的相互掩盖。代码类任务采用隐藏测试用例通过率作为唯一指标,杜绝了主观评判的偏差。网页类任务则构建了混合评判体系,结合规则检查、大型视觉语言模型(VLM)评判以及智能体自我评判,且强制要求交付声明路径上的制品,同时禁止连接实时互联网,以纯粹考察模型的生成与推理能力。办公类任务偏向确定性规则检查,辅以基于证据的LLM评判,权重设置在0.70至0.95之间,体现了对执行结果准确性的极高要求。安全子集则完全摒弃了大模型裁判,转而使用确定性的scoring.py脚本运行三次取平均值,并部署了五层反作弊机制,包括禁字面量扫描、重命名输入、覆盖篡改测试、编码依赖分析以及低权重诱饵陷阱,极大地提升了作弊难度。
在具体的评测执行环节,WorkBuddy Bench展现了极高的工程严谨性。所有测试均在隔离容器中运行,实现了模型推理环境与沙箱执行环境的物理分离。评测框架主要支持CodeBuddy Code(默认)和Claude Code两种主流Agent框架,并将推理努力程度调至最高,上下文窗口扩展至200k token,同时严格禁用WebSearch与AskUserQuestion功能。这一设置至关重要,它不仅验证了模型在无外部辅助下的独立解决问题的能力,也进一步确认了前述“抗污染”设计的有效性。如果模型在无法联网搜索的情况下依然能高质量完成任务,则证明其真正具备了相应的逻辑推理与代码生成能力,而非仅仅是记忆力的体现。
从已公布的排行榜数据来看,不同模型家族在WorkBuddy Bench上的表现呈现出显著的差异性,这也反映了当前AI技术在各个细分领域的成熟度不均。Claude Opus 4.8凭借其在代码、网页、办公及安全多数子项中的优异表现,拿下了五个第一,显示出其在通用智能体任务中的强大综合实力。GLM-5.2则在安全领域的两个榜单中登顶,表明其在代码安全审计与漏洞识别方面具有独特的技术优势。GPT-5.5则在办公自动化子集(Office CC)中拔得头筹,体现了其在处理复杂文档流与业务逻辑时的精准度。值得注意的是,框架的选择对最终成绩有着不可忽视的影响。数据显示,安全子集的排名对框架最为敏感,平均绝对变动达到8.6个点。例如,Claude Opus 4.8在CC框架下出现了13次拒答,而在CBC框架下仅拒答2次,这提示我们在评估模型能力时,必须将底层Agent框架的调度策略与容错机制纳入考量范围。
效率与成本的平衡也是此次评测关注的一个重点。GPT-5.5在保持高分的同时,输出的Token数量最少,展现了极高的推理效率与经济性。相比之下,DeepSeek-V4-Pro虽然在代码任务上表现不俗,但需要经历44轮交互,输入输出Token消耗巨大,显得更为“费劲”。这种差异对于企业级应用而言具有明确的指导意义:在选择智能体底座时,不仅要关注其最终任务的完成率,还需综合评估其交互轮次、Token消耗以及响应延迟,以实现性能与成本的最优解。
尽管WorkBuddy Bench在多方面取得了突破,但研发团队也坦诚地指出了当前的局限性。首先,代码子集目前仍以Python语言为主,跨语言的支持相对较少,这在一定程度上限制了对多语言全栈开发能力的评估。其次,虽然通过版本管理缓解了污染风险,但开源发布本身仍面临被大规模爬取并用于训练的风险,这需要社区共同维护与持续迭代。此外,评判器本身的偏差尚未得到量化,尤其是在涉及主观性较强的网页设计与办公文档排版时,LLM评判器的稳定性仍需进一步验证。最后,办公类任务目前偏重于文本处理,暂不支持OCR(光学字符识别)与GUI(图形用户界面)交互,这与现实中高度可视化的办公场景存在一定差距。
展望未来,WorkBuddy Bench的计划包括校准网页评分标准、扩充公开榜单以及增加更多编程语言的支持。对于一个致力于将“真实工作分布”搬进考场的评测体系来说,WorkBuddy Bench已经敞开了大门。它不再仅仅是一个分数的排行榜,而是一个推动AI智能体从“玩具”走向“工具”,从“演示”走向“生产”的基础设施。随着更多开发者和研究机构的加入,这一基准有望成为衡量编码智能体综合实力的行业金标准,倒逼模型厂商在提升单一技能的同时,更加注重智能体在复杂、动态、真实工作环境中的鲁棒性与适应性。对于从业者而言,深入理解这一评测体系背后的逻辑,将有助于更准确地定位自身产品的技术短板,从而在激烈的AI竞争中占据有利位置。