Agent落地深水区:WorkBuddy如何用Harness工程将模型转化为可靠产品

4 阅读

模型能力的边界与产品化的起点

在AI Agent的构建过程中,一个常见的认知误区是认为只要拥有更强的基础模型或更精细的提示词,就能实现稳定可靠的自动化执行。然而,深入一线生产环境后会发现,模型本身仅提供了语言理解、推理和生成的基础能力,它本质上是一个无状态的函数。模型无法自动保留上一次调用的上下文,也无法感知训练截止日期之后的实时信息,更不具备直接操作外部系统(如读写文件、查询数据库、执行API)的能力。

因此,将Agent从“模型能力”推进到“可用产品能力”,核心在于构建一套完整的工程体系。这套体系需要解决如何引导模型、如何组织上下文、如何接入工具与权限、如何验证结果,以及如何通过Harness(驾驭机制)将不确定的模型输出转化为可控的执行过程。WorkBuddy团队通过策略产品经理Anne的视角,从产品工程角度拆解了这一转化路径,重点探讨了Context Engineering(上下文工程)与Harness Engineering(驾驭工程)在提升Agent可靠性中的关键作用。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

基础概念重构:从工具调用到能力打包

从模型到Harness:WorkBuddy如何把Agent做成可用产品

要理解Agent的产品化逻辑,首先需厘清几个核心概念及其在产品架构中的定位。模型通过Function Call(工具调用)与外部系统交互,但这仅是动作请求的协议层。真正决定Agent能力边界的,是外部系统的接入方式、任务流程的沉淀以及能力的分发机制。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

工具调用与MCP协议

从模型到Harness:WorkBuddy如何把Agent做成可用产品

工具调用是模型请求执行动作的基础协议。模型生成结构化请求,Agent负责校验参数、检查权限并执行外部操作。然而,随着Agent需要接入GitHub、内部知识库、网盘等大量外部系统,若每接入一个系统都单独适配,维护成本将呈指数级上升。Model Context Protocol (MCP) 应运而生,它提供了一套标准化协议,统一连接AI应用与外部数据源、工具。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

MCP不仅提供Tools(模型驱动的动作),还提供Resources(应用/Agent驱动的只读内容)和Prompts(用户驱动的提示模板)。这种分层设计使得Agent能够更灵活地处理信息流:部分数据直接注入上下文供模型推理,部分数据则直接渲染在UI上供用户交互,从而优化上下文占用与用户体验。

Skill与Plugin:流程与分发的标准化

仅有工具调用不足以应对复杂任务。Skill(技能)解决的是“一类任务应该怎么做”的问题,它将经过验证的工作方法、步骤、脚本和验收标准沉淀下来。例如,创建一个Pull Request不仅涉及API调用,还包括读取仓库规范、运行测试、生成描述等完整流程。

Plugin(插件)则是能力的打包与分发单位。它将MCP连接、Skill流程、Rules规则、Hooks钩子和Assets模板组合成一个可安装、可分发的单元。这种分层架构使得Agent产品能够像操作系统一样,通过安装不同的Plugin来扩展能力,同时保持核心架构的稳定性。

Context Engineering:精准的信息注入策略

Context Engineering(上下文工程)的核心目标是在模型决策前,设计哪些信息进入上下文、以何种形式进入、何时更新或移出,以提高模型做出正确决策的概率。这并非简单的信息堆砌,而是一套精密的信息筛选与组织机制。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

五类核心动作

上下文工程包含写入、选择、检索、压缩和隔离五类动作。写入是将目标、规则和环境显式化;选择是从候选信息中过滤出当前步骤所需内容;检索是从历史或资料库中按需拉取;压缩是将长内容外置或清理过期信息;隔离则是通过独立会话或子智能体处理旁支任务,避免污染主上下文。

渐进式加载与Prompt Cache

随着工具数量的增加,全量加载工具定义会导致上下文膨胀和模型选择困难。WorkBuddy采用渐进式加载策略:默认只暴露工具名称和简介,根据任务意图识别结果,按需加载详细Schema。同时,为了优化成本与延迟,系统利用Prompt Cache机制,保持System Prompt和基础规则的前缀稳定,仅对动态变化的当前任务内容进行追加计算,从而显著提升缓存命中率。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

Memory系统:陈述性与程序性的分离

从模型到Harness:WorkBuddy如何把Agent做成可用产品

记忆系统是Agent实现“越用越懂你”的关键,但WorkBuddy对记忆的设计持谨慎态度,严格区分了陈述性记忆与程序性记忆。

五类长期记忆

WorkBuddy的长期记忆包括稳定事实、用户知识背景、行为信号、表达偏好和会话延续信息。这些记忆作为推理前提,帮助Agent减少重复背景交代,调节解释深度和交互风格。例如,记录用户的常用工作语言或表达偏好,可以显著提升交互效率。

为何排除程序性记忆

WorkBuddy未将程序性记忆(Procedural Memory,即“做事方法”)纳入长期记忆。因为程序性策略一旦注入,会直接改变Agent的推理路径,可能导致局部经验被误升为通用策略,干扰模型根据当前证据进行判断。相反,经过验证的工作方法被保存为Skill,通过版本化、可评审、可回滚的机制按需加载,既保证了灵活性,又维持了系统的可控性。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

Harness Engineering:构建可信执行环境

Harness Engineering(驾驭工程)是Agent产品化的核心,旨在解决执行方向、安全约束和系统整合问题。它通过前馈(Feedforward)和反馈(Feedback)机制,构建一个闭环的控制系统。

驾驭、约束与整合

Harness包含三类能力:驾驭(Steer)控制执行方向与速度,通过System Prompt、Rules和Task拆解引导Agent;约束(Constrain)防止越权与误操作,通过权限边界、沙箱、审批流和Allowlist/Denylist确保安全;整合(Integrate)将工具、状态、协作机制和自动化流程协同工作,确保长任务稳定完成。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

五层Harness架构

从模型到Harness:WorkBuddy如何把Agent做成可用产品

WorkBuddy的Harness架构分为五层:

  1. 运行环境层:提供文件系统、Shell、沙箱等基础执行环境。
  2. 引导层:在执行前注入项目上下文、环境信息和规则,提高首次正确率。
  3. 反馈层:通过Lint、类型检查、单元测试等确定性信号,以及架构审查等推断型信号,实时验证执行结果并返回修正信息。
  4. 编排层:管理多Agent协作、工具并行调用和意图路由。
  5. 迭代层:根据模型能力提升和新出现的问题,持续调整Harness配置,如精简上下文或增加新约束。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

业界实践对比

从模型到Harness:WorkBuddy如何把Agent做成可用产品

OpenAI、Anthropic和LangChain在Harness设计上各有侧重。OpenAI强调代码内部质量与自动化重构;Anthropic通过Planner/Generator/Evaluator角色分离,解决长任务中的状态管理与验收问题;LangChain则提出“Agent = Model + Harness”的宽泛定义,强调持久状态与自我验证。WorkBuddy借鉴了这些实践,特别注重计算型控制(确定性程序)与推断型控制(模型语义判断)的结合,优先使用低成本、高确定性的程序检查,仅在必要时调用高成本的模型审查。

Loop Engineering:跨时间的任务持续

Loop Engineering关注任务如何被触发、流转、验证和停止,将Agent从单次交互扩展为长期运行的自动化循环。一个完整的Loop包含触发器、独立执行环境、工具、验证信号和停止条件。

目标与循环的区别

需明确Goal(目标)不等于Loop。Goal仅定义方向,而Loop提供执行路径与反馈机制。例如,每日检查依赖安全更新的Loop,通过定时触发、独立工作树、Skill执行、自动化测试和人工审批,形成闭环。但Loop不会自动产生正确目标或可信验收标准,仍需人类设定边界与承担责任。

挑战与未来:业务正确性与可治理性

尽管Harness工程显著提升了Agent的可靠性,但仍面临诸多挑战。首先是功能与业务正确性的验证缺口。现有Harness多关注代码质量与架构规范,难以规模化验证业务逻辑的正确性,尤其是当需求本身模糊或实现与测试共享同一误解时。

从模型到Harness:WorkBuddy如何把Agent做成可用产品

其次是代码库的Harnessability(可治理性)。老旧系统往往结构混乱、缺乏测试和可观测性,导致Harness难以有效部署。建议优先在结构清晰、可观测性好的子模块验证方案,逐步扩展。

最后,AI可能推动技术方案的标准化。未来,团队在选择技术栈时,除了性能与生态,还将考虑其是否便于AI理解与验证,从而形成“Harness模板”,减少维护成本,提升整体工程效率。

结语

从模型到产品,Agent的落地依赖于Context Engineering与Harness Engineering的深度结合。模型决定能力上限,而上下文组织与驾驭机制决定这一上限能否稳定落地。人负责定义标准、选择方向并承担最终责任,Agent则负责执行、验证与加速迭代。随着技术的演进,Harness工程将成为AI原生应用的核心基础设施,推动软件工程向更自动化、更可控的方向发展。