黄仁勋力推Harness:为何下一代软件公司的核心是Agent工程栈而非模型?

0 阅读

范式转移:从算力崇拜到工程实效

在人工智能技术飞速迭代的当下,公众与行业的目光往往聚焦于底层算力的军备竞赛与模型参数的数量级增长。然而,在黄仁勋最新的一次深度访谈中,一个显著的变化引起了业界的警觉:这位向来以硬件生态掌控者著称的科技领袖,在长达26分钟的对话中,全程未提及GPU架构、集群规模或新模型的底层参数。相反,他将聚光灯打在了一个更为隐蔽却至关重要的概念上——Harness(调度器/执行框架)。

英伟达CEO黄仁勋接受采访的现场照片

这场访谈的核心逻辑清晰地指向了一个趋势:软件公司的未来操作系统不再是传统的ERP或CRM,而是基于Agent(智能体)的工程调度层。黄仁勋明确指出,程序员的角色正在发生本质跃迁,从单纯“写代码”转向“造Agent”。这一判断并非简单的口号,而是基于对软件生产边际成本急剧下降后的深刻洞察。当代码生成的门槛被AI大幅降低,工程的重心必然从“如何写出代码”迁移至“如何确保代码代表的智能体能正确、安全、高效地完成业务闭环”。

Harness:被忽视的模型外围“工作台”

要理解Harness的重要性,必须首先解构当前AI应用的现实困境。大语言模型(LLM)虽然具备强大的推理能力,但它们本质上是无状态或弱状态的概率生成器。要让模型真正解决复杂的商业问题,需要一套精密的外部系统来约束、引导和执行其输出。这就是Harness所扮演的角色。

Harness涵盖了Prompt工程、工具说明、记忆管理、上下文窗口控制、任务拆分、失败重试机制、自动化评测以及严格的权限控制。如果说模型是大脑,负责推理与决策,那么Harness就是小脑与前庭系统,负责将决策组织成可执行、可验收、可追溯的工作流。黄仁勋的类比极具洞察力:写代码如同打字,打字技能重要,但作家的工作远不止于打字;同样,生成Python代码重要,但这远不等于构建了一个可用的Agent系统。

工程团队面临的挑战在于,Agent必须明确自身能看到什么数据、能调用哪些API、在失败时如何优雅恢复,以及最终的输出由谁来验收。生成式AI解决了“写出来”的问题,而Harness工程解决了“跑得动、做得对、出错能停、过程可追溯”的系统性问题。这种区分标志着AI应用开发从“模型驱动”向“系统驱动”的根本性转变。

数据实证:系统优化带来的十倍成本效能

理论层面的推演需要数据实证的支持。在LangChain与Nemotron 3 Ultra的合作案例中,Harness的工程价值得到了量化呈现。研究人员并未对模型本身进行重新训练或微调权重,而是通过优化系统Prompt、重构工具描述接口以及调整中间件逻辑,极大地释放了模型的潜力。

在Deep Agents评测中,经过Harness优化的配置将模型得分从原始状态提升至0.86,仅以微弱劣势(0.01)落后于最高分的闭源模型0.87。然而,更具颠覆性的是成本的骤降:单次评测成本从43.48美元暴跌至4.48美元,降幅近十倍。这一数据有力地证明,模型榜单上的排名已不足以全面评估AI系统的价值,模型周围的工程环境——即Harness的质量,才是决定最终效能与成本的关键变量。

AI Agent 系统架构分层示意图,展示了评测层、Harn

对于开发团队而言,执行轨迹(Execution Trajectory)的重要性日益凸显。它如同测试日志一般,不仅揭示了分数丢失的具体环节,更能将偶然的失败转化为新的回归测试用例。长期积累下的Prompt模板、工具接口定义、任务轨迹和评测数据集,将逐渐沉淀为企业核心的Agent工程资产。这种资产的可复用性与迭代性,构成了企业区别于单纯模型调用者的竞争壁垒。

展示用户任务处理流程的示意图,包含模型推理、执行轨迹等步骤,

成本下降引发的开发方法变革

黄仁勋进一步指出,成本的降低不仅仅是财务报表上的数字变化,它将直接重塑团队的开发方法论。Agent完成一个复杂任务通常涉及多轮推理、多个工具的链式调用以及并行路径的探索。当每一次试验的成本高昂时,团队往往会倾向于保守,减少评测次数与探索范围。

当Harness将成本压降至原来的十分之一,开发方法将发生三重进化:首先是“多试”,团队可以同时比较不同的模型版本、Prompt策略、工具组合及重试机制,通过大规模并行实验寻找最优解;其次是“常测”,自动化评测被深度集成到日常开发与生产监控中,形成持续验证的闭环;最后才是“多部署”,Agent得以从少数高价值场景扩展至海量细分流程。

这种成本结构的变化促使企业采取更灵活的策略:在边界模糊、需求初现阶段,利用前沿模型进行上限探索;在任务稳定、验收标准明确后,将高频任务收敛为成本更低的专用Agent。这种“专门化”不仅体现在模型权重的精简上,更体现在企业独有的业务词汇、权限边界、历史轨迹和验收数据与Harness的深度融合中。正是这些私有数据与工程逻辑,决定了Agent是否真正“理解”这家公司。

安全边界:Harness作为新的企业容器

随着Agent从辅助工具演变为具备行动能力的软件进程,安全与治理成为了Harness设计的核心维度。黄仁勋提出了一个激进且必要的判断:未来的公司将把核心能力构建在Harness之上。过去,业务逻辑固化在ERP和CRM的流程规则中;未来,业务流程将转化为“给定目标、工具、权限和验收标准,由系统自主规划路径”的指令。

NemoClaw架构蓝图展示了这一愿景的实现路径:Deep Agents Code负责逻辑规划,Nemotron 3 Ultra提供推理能力,OpenShell运行时负责隔离执行。在这个体系中,Harness不仅是调度器,更是策略执行器。它必须解决Agent如何获取临时权限、如何访问内部API、如何在失败时回滚等关键问题。

黄仁勋设定了清晰的安全底线:Agent不应持有长期有效的密钥。合理的架构是由运行时环境根据当前任务上下文和预设策略,动态注入临时权限,确保Agent仅在必要的时间、必要的范围内访问必要的资源。落实到工程细节,企业必须回答四个核心问题:Agent以何种身份行动?允许执行哪些命令?失败后如何停止或回滚?谁来复盘完整的执行轨迹?缺乏这些边界控制,Agent能力越强,企业面临的风险敞口也就越大。

去人格化:回归工程理性的必要性

在访谈中,关于“拟人化”的讨论触及了AI伦理与工程管理的深层矛盾。当Agent使用自然语言协作,表现得愈发像人类同事时,团队容易产生认知偏差,默认其输出的正确性。黄仁勋的回应冷静而理性:自然语言旨在降低交互门槛,但不应模糊责任边界。

Agent可以拥有角色设定与交互界面,但绝不能因为语气自信就跳过权限验证与结果验收。判断Agent任务完成度的标准必须是外部证据:单元测试是否通过、代码Diff是否符合预期、数据是否准确写入指定位置、审批流程是否完整留痕。它所说的“已完成”,仅是一个待验证的假设输出。

这种“去人格化”的工程管理思维至关重要。每一次工具调用都应有明确的身份标识,每一次高风险操作都需触发特定的策略检查,每一个最终结果都需经过独立的验证器。尽管市场上已有企业尝试赋予Agent“虚拟员工编号”或构建汇报关系,但这目前仍属于实验性做法。行业共识正在形成:Agent首先是受控的软件进程,其次才是协作对象。拟人化有助于理解协作关系,但工程控制必须保持绝对的理性与刚性。

职业重构与未来栈的构建

从宏观视角看,黄仁勋对就业市场的判断遵循其一贯的供给逻辑:当数字服务的生产边际成本趋近于零,社会需求不会止步,而是会涌现出更多此前因成本过高而无法实现的复杂需求。对于程序员而言,工作清单的重排是不可避免的。样板代码生成、格式转换、重复性调试将大量由Agent接管,而任务定义、系统架构设计、评测体系构建、权限治理及异常处理将成为核心价值点。

这一转变并不意味着岗位的消失,而是职责的迁移。软件供给的扩大将促使从业者从“亲手完成每一步”的执行者,转变为“设计可持续完成任务系统”的架构师。个人的职业韧性,取决于能否跨越这一职责迁移的鸿沟。

综合来看,构建下一代软件公司的完整栈需要层层递进:模型负责推理,Harness负责计划、记忆与工具调度,运行时负责隔离与安全执行,Evals与Guardrails负责结果判断。缺一不可。团队实施路径应遵循:以真实任务建立评测基线 -> 启动模型与Harness迭代 -> 补足沙箱、身份认证、日志追踪与人工接管机制 -> 最终实现规模化部署与成本优化。

模型本身会继续进化,但企业真正需要长期经营与深耕的,是围绕模型构建的、与自身数据资产、业务工具及责任边界深度绑定的工程环境。Harness,这一被重新定义的操作系统层,正是承载这一愿景的核心基石。谁率先建立起高效、安全、可迭代的Harness体系,谁就能让Agent从演示Demo真正转化为企业的生产力核心,而非仅仅停留在聊天窗口的辅助工具。这场从算力到算力的回归,正是软件行业迈向成熟智能时代的必经之路。