黄仁勋26分钟访谈:AI时代软件公司的核心是Harness而非GPU
在2026年的AI技术版图中,NVIDIA创始人黄仁勋的一次公开访谈成为了行业观察的风向标。与以往聚焦于算力堆叠、芯片制程或大模型参数规模不同,这次长达26分钟的对话中,黄仁勋全程未提GPU,也未渲染新模型的性能突破,而是抛出了一个极具颠覆性的观点:下一代软件公司的操作系统是Harness。这一论述不仅重新定义了开发者在AI时代的角色,更揭示了企业级人工智能落地的核心痛点——模型不再是唯一的竞争高地,模型周围的系统工程能力才是决定Agent(智能体)能否真正投入生产的关键。
从“写代码”到“造Agent”:工程师角色的根本性迁移
黄仁勋在访谈中用一个生动的类比阐释了当前技术范式的转变:写代码之于工程师,如同打字之于作家。虽然掌握打字技能依然重要,但它远不足以定义一位作家的创作能力。同理,编写Python代码或生成代码片段,仅仅是构建智能体系统的基础步骤,而非全部。
当Agent开始具备自主调用工具、执行复杂流程的能力时,工程师的工作重心必须从“如何写出这段代码”转向“如何设计能让Agent把事情做完的系统”。这不仅仅是技术动作的转换,更是思维模式的重构。工程师需要决定Agent具备何种感知能力,能够调用哪些外部工具,在失败时如何恢复状态,以及最终的输出结果由谁来进行验收。
生成代码仅解决了“写出来”的问题,而Agent工程还需要解决“跑得动、做得对、出错能停、过程可追溯”等一系列系统工程挑战。这意味着,未来的软件工程将不再局限于代码本身的优劣,而是更多地关注系统整体的鲁棒性、可解释性和可控性。这种转变要求开发者具备更宏观的系统视野,从单一的功能实现者转变为复杂任务流的架构师。
Harness:被低估的AI“工作台”与核心竞争力
黄仁勋反复强调的“Harness”,并非一个陌生的技术名词,但它长期以来被企业忽视。在传统的AI应用开发中,注意力往往集中在模型本身的精度上,而忽略了模型运行时的环境配置。实际上,Harness涵盖了Prompt工程、工具说明编写、记忆机制管理、上下文处理、任务拆分、重试策略、评测体系以及权限控制等关键环节。模型负责底层的逻辑推理,而Harness负责将这些推理组织成符合业务逻辑、可被验收的具体工作流。
这一观点在LangChain与Nemotron 3 Ultra的合作案例中得到了有力的数据佐证。在该案例中,开发团队并未对模型权重进行重新训练,而是仅通过调整系统Prompt、优化工具描述和中间件配置,就显著提升了Deep Agents的评测表现。结果显示,该系统的评测得分从原始状态攀升至0.86,仅以0.01之差追平了当时最高分的闭源模型(0.87)。
更具冲击力的是成本的变化。在相同的任务负载下,经过Harness优化的单次评测成本从43.48美元骤降至4.48美元,实现了近10倍的降本效果。这一数据清晰地表明,同一个基础模型,在不同的Harness配置下,其实际产出能力和经济效益可能存在巨大差异。对于开发团队而言,执行轨迹的数据价值开始超越模型本身的指标,它不仅能揭示分数流失的具体环节,还能将偶然的失败转化为宝贵的回归测试用例。长期积累的Prompt库、工具接口定义、交互轨迹和评测数据集,将逐渐演变为公司的核心数字资产,构成难以复制的竞争壁垒。
成本下降引发的开发方法论革命
黄仁勋指出,成本的降低不仅仅是财务账面上的优化,更是开发方法论变革的催化剂。Agent完成任务通常涉及多轮推理、多个工具的串行或并行调用,以及多种路径的尝试。当每一次实验都极其昂贵时,团队自然会倾向于保守,减少评测频率和探索范围。
当Harness将单次试错成本压缩至十分之一以下时,开发方法将发生质变。首先,团队获得了“多试”的能力,可以并行比较不同的模型版本、Prompt模板、工具组合及重试策略,从而快速找到最优解。其次,成本的可控性使得“常测”成为可能,评测环节被无缝集成到日常开发与生产监控中,形成闭环反馈。最后,随着探索成本的降低,“多部署”成为现实,过去仅服务于少数高价值核心业务的Agent,如今可以扩展到更多细分、低频的业务流程中。
这种演变推动了一种新的技术选型策略:在任务边界不清、需求尚未明确时,利用前沿模型进行上限探索;一旦任务高频出现且验收标准稳定,再通过Harness将其收敛为成本更低的专用Agent。值得注意的是,这种“专门化”不仅体现在模型权重的微调上,更体现在公司对自身业务数据的深度打磨上。独特的业务词汇、严格的权限边界、丰富的历史轨迹数据,才是决定Agent是否真正理解并融入特定企业文化的决定性因素。
安全边界与责任归属:Agent首先是受控软件
随着Agent能力的增强,其对企业内部系统的访问权限也日益敏感。黄仁勋在访谈中提出了一个激进而必要的判断:未来的公司基础设施将大量构建于Harness之上,但密钥和核心权限绝不能直接暴露给Agent。
传统的企业流程固化在ERP、CRM等系统的固定规则中,而在Agent时代,部分流程将转变为“给定目标、工具、权限和验收标准,由系统自主规划路径”。Harness成为了承载这些动态业务规则的新容器。然而,当Agent能够调用终端、访问数据库或执行内部API时,它已超越了简单的聊天机器人范畴,成为拥有行动能力的软件进程。
为此,NVIDIA提出了NemoClaw蓝图,旨在将Deep Agents Code、Nemotron 3 Ultra与OpenShell运行时相结合。在这一架构中,模型负责推理,Harness负责任务编排,而OpenShell则提供隔离的执行环境,对网络访问、凭证管理、文件读写及日志记录实施严格的策略控制。黄仁勋设定的底线非常明确:Agent不应持有长期有效的密钥,而应由运行时根据当前任务需求和安全策略,临时注入最小必要权限。
这一设计逻辑要求企业在工程实现上必须回答四个核心问题:Agent以何种身份行动?允许执行哪些具体命令?在失败时如何停止或回滚?谁来复盘完整的执行轨迹?缺乏这些边界控制,Agent能力越强,企业面临的风险敞口反而越大。
拒绝拟人化陷阱:工程管理的去人格化原则
访谈中,LangChain创始人Harrison Chase提出了一个颇具争议的问题:当Agent表现出越来越像人类的协作能力时,我们是否应该将其拟人化?黄仁勋的回答冷静而务实:自然语言的优势在于降低交互门槛,但不应模糊责任边界。
Agent可以被赋予角色和名称,但这不应成为默认其正确的理由,也不能成为跳过权限审核和结果验收的借口。判断Agent工作质量的标准,必须建立在外部客观证据之上:测试用例是否通过?代码差异是否符合预期?数据是否写入正确位置?审批记录是否完整?Agent声称“已完成”,仅仅是一个需要验证的输出信号。
虽然社区中已出现赋予Agent“虚拟员工编号”甚至建立“汇报关系”的实验性做法,但这目前仅停留在探索阶段。行业共识正在形成:在工程管理层面,必须保持“去人格化”。每一次工具调用都必须有明确的身份标识,每一次高风险操作都必须有严格的安全策略,每一个最终结果都必须经过独立的验证器校验。拟人化仅有助于团队理解协作逻辑,而不能替代严谨的工程规范。
重塑软件基础设施:从模型竞争到系统竞争
回顾黄仁勋的访谈,其核心逻辑在于揭示AI时代软件基础设施的重构。未来的软件栈将由四层构成:底层模型负责推理,中间层Harness负责计划、记忆与工具调度,运行时负责隔离与执行,顶层Evals和Guardrails负责结果验证与安全管控。缺失任何一层,Agent都可能停留在演示阶段,无法真正进入生产环境。
对于企业团队而言,实施路径应遵循以下顺序:首先利用真实业务任务建立基础评测体系,让模型与Harness跑通核心流程;随后补足沙箱环境、身份认证、日志追踪及人工接管机制;最后再考虑规模化部署与成本优化。模型性能的迭代将持续进行,但企业真正需要长期经营和沉淀的,是与自身数据、工具链和责任边界深度绑定的工程环境。
黄仁勋所言的Harness,实质上是将AI从“技术工具”升级为“企业操作系统”的关键一环。它标志着AI竞争的核心已从“拥有更强的模型”转向“构建更稳的系统”。谁能够率先建立起一套可迭代、可评测、可追责的Harness平台,谁就能让AI智能体真正从聊天窗口走向核心业务流,成为企业稳定、高效且安全的数字员工。这一转变,不仅是技术的演进,更是企业管理哲学与工程范式的深刻革命。