超越模型本身:WorkBuddy如何构建Agent稳定落地的Harness工程体系

0 阅读

在人工智能应用落地的深水区,一个普遍的误区正在被现实打破:许多团队认为,只要接入最先进的大语言模型,或者编写出极其详尽的提示词,就能获得一个全能的智能助手。然而,当我们将视角从实验室转向真实的生产环境,尤其是像WorkBuddy这样面向复杂办公与研发场景的企业级产品时,会发现模型能力仅仅是起点,而非终点。

photoLink

Agent能否稳定、可靠地完成既定任务,本质上取决于它如何被引导、上下文如何被组织、工具和权限如何接入、结果如何被验证,以及最重要的——Harness( harness原意为马具,此处指控制与约束系统)如何将一次次充满不确定性的模型输出,转化为稳定、可控的执行过程。这不仅是技术的堆叠,更是产品哲学的重构。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

重新定义模型:从无状态函数到系统组件

从模型到Harness:WorkBuddy如何把Agent做成可用产品

要构建可靠的Agent,首先需要对大语言模型进行去魅。在产品架构层面,我们不需要深入Transformer的底层数学原理,只需建立一个核心抽象:模型是一个根据输入产生后续文字的无状态函数。

这个函数的输出取决于系统提示词、可用工具、会话历史、其他上下文以及用户指令的组合。这一抽象揭示了两个关键约束,它们构成了上层所有工程设计的基石。首先,模型是无状态的。它不会自动保留上一次调用的记忆,所有的对话连续性、工作进度和记忆存储,都必须由产品在模型外部维护,并在需要时注入本次请求中。其次,模型的知识具有截止性。对于训练数据之后的实时信息,或者读取文件、查询数据库等外部动作,模型本身无能为力,必须依赖外部工具的介入。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

因此,Agent的核心机制在于工具调用。这不是简单的API对接,而是一套结构化的协议。模型负责生成调用请求,而Agent框架负责执行、校验权限并返回结果。在这个过程中,持有API Key、发起请求、修改数据的主体是Agent而非模型。这意味着,所有的权限控制、参数校验和审计日志,必须在模型外部的工程层严格执行,这是防止高风险操作失控的前提。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

能力组织的四层架构:从工具到插件

从模型到Harness:WorkBuddy如何把Agent做成可用产品

为了让模型能够有效地与外部世界交互,我们需要建立一套清晰的能力组织层级。在WorkBuddy的实践中,这一层级被划分为工具调用、MCP、Skill和Plugin四个概念,它们分别解决了不同维度的问题。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

工具调用是基础,它定义了模型如何请求执行一个具体的动作。而模型上下文协议(MCP)则解决了外部系统标准化接入的问题。MCP不仅仅是一组工具接口,它提供了资源、工具和提示模板三种原语。资源是只读的内容,由Agent驱动读取;工具是可执行的动作,由模型驱动调用;提示模板则是预组织的消息包,由用户驱动触发。这种分层使得Agent无需适配每个外部系统的底层差异,实现了能力的解耦与标准化。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

然而,真实的业务任务往往不是单次工具调用就能完成的。例如,提交一个代码PR涉及读取规范、检查状态、运行测试、生成描述等多个步骤。这时,Skill应运而生。Skill沉淀了一类任务的标准化执行流程,包含步骤、脚本、判断标准和失败处理机制。它将“怎么做”从隐性的专家知识转化为显性的可执行文档,指导模型按部就班地完成任务。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

当我们需要将一组相关的MCP连接、Skills流程、规则规范和模板打包分发给特定团队或项目时,Plugin便成为了最佳的载体。Plugin解决了能力组合的安装与分发问题,使得复杂的业务能力可以像安装软件一样便捷地部署到不同的工作空间中。

上下文工程:决定模型视野的关键

在明确了能力层之后,接下来的挑战是如何让模型在有限的上下文窗口中,看到最关键的信息。这就是上下文工程(Context Engineering)的核心使命。它不是简单地堆砌Token,而是通过写入、选择、检索、压缩和隔离五个动作,精确控制进入模型视野的信息。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

写入是将目标、规则和当前状态显式地放入上下文,避免模型猜测;选择是从海量候选信息中筛选出当前步骤所需的内容;检索是从历史会话或知识库中按需拉取缺失信息;压缩是将长内容外置或总结,清理过期信息;隔离则是通过子Agent处理旁支任务,防止主上下文被污染。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

为了优化性能,Prompt Cache技术被广泛应用。通过保持System Prompt和基础工具定义的稳定性,利用前缀复用机制,可以大幅降低计算成本。同时,渐进式加载策略被引入以应对工具集膨胀的问题。系统不再一次性暴露所有工具定义,而是先提供名称和简介,待意图识别确认方向后,再按需加载详细的Schema。这种“先选对方向,再按需展开”的策略,有效降低了模型的选择干扰和上下文占用。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

记忆系统:让正确的过去重现

从模型到Harness:WorkBuddy如何把Agent做成可用产品

记忆功能是Agent具备长期智能的关键,但也是极易产生偏见的区域。WorkBuddy将记忆严格区分为陈述性记忆和程序性记忆,并采取不同的处理策略。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

陈述性记忆包括稳定事实、用户背景、行为信号、表达偏好和会话延续信息。这些信息描述了“用户是谁”和“发生过什么”,作为推理的前提被注入上下文。而程序性记忆,即“做事的方法”,则不被直接存入长期记忆。这是因为局部有效的操作步骤若被泛化为通用策略,会干扰模型的推理路径,导致其陷入局部最优甚至积累偏见。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

相反,经过验证的工作方法被保存为Skill。Skill具备版本控制、评审、测试和回滚机制,确保了执行流程的可控性。记忆的作用域也被精细分层,从当前轮的临时上下文到用户级的长期记忆,不同层级的记忆拥有不同的生效范围和晋升门槛,确保只有高置信度、高相关的信息才能影响未来的决策。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

Harness工程:构建可信的控制闭环

如果说上下文和记忆解决了“Agent知道什么”的问题,那么Harness工程则解决了“Agent如何行动”的问题。Harness由驾驭、约束和整合三类能力构成,旨在将不确定的模型输出纳入可控的系统轨道。

驾驭侧重于引导执行方向。通过System Prompt、规则文件和Task清单,明确Agent的工作方式和目标拆解。约束侧重于安全边界,通过权限控制、沙箱隔离、审批网关和白名单机制,防止Agent执行危险操作。整合则侧重于协同,将工具、记忆、子Agent和自动化流程有机串联。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

在WorkBuddy的五层Harness架构中,运行环境层提供基础执行空间;引导层通过前馈机制提供初始信息和约束;反馈层通过确定性程序(如Lint、测试)和推断型程序(如Review Agent)验证执行结果,并将错误信息返回给Agent进行自我纠正;编排层负责多能力的调度与路由;迭代层则确保持续优化。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

这种前馈与反馈相结合的闭环,使得Agent能够在首次执行时就具备较高的正确率,并在出错时具备自我修复的能力。特别是将确定性检查左移,将高成本的语义判断后置,实现了效率与安全性的平衡。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

循环工程:跨越时间的任务执行

从模型到Harness:WorkBuddy如何把Agent做成可用产品

最后,Loop Engineering将上述机制扩展到时间维度。它关注任务如何被触发、流转、验收和停止。一个完整的Loop包含触发器、独立执行环境、技能工具、子Agent、持久化记忆、传感器评估和停止条件。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

以依赖安全更新为例,定时触发器启动任务,创建独立工作区,读取规则,执行更新,运行测试,若失败则反馈修正,若成功则生成PR并等待人工审批。整个过程无需人工干预,但每一步都有明确的验证点和退出机制。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

值得注意的是,Loop并不能自动解决业务正确性的验证缺口。对于核心业务逻辑,由于缺乏可计算的判定标准,AI的自治度必须受到严格限制。此外,老旧代码库的低“Harnessability”也增加了实施难度,需要先治理结构、补齐测试,再引入Agent。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

综上所述,将Agent从模型能力转化为可用产品,是一场涉及上下文管理、记忆设计、控制工程和流程编排的系统性工程。模型决定了能力的上限,而Harness工程决定了这一上限能否稳定落地。在未来,随着AI原生应用的普及,构建高效、可信的Harness体系,将成为企业智能化转型的核心竞争力。人依然负责定义方向、设定标准和承担责任,而Agent则专注于执行、验证和加速迭代,二者协同,共同开启智能办公的新篇章。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

从模型到Harness:WorkBuddy如何把Agent做成可用产品

从模型到Harness:WorkBuddy如何把Agent做成可用产品

从模型到Harness:WorkBuddy如何把Agent做成可用产品

从模型到Harness:WorkBuddy如何把Agent做成可用产品

photoLink