GPU利用率:AI时代的下一个竞争瓶颈与应对策略

0 阅读

从飞机到GPU:一个关于利用率的启示

航空业有一个长期被验证的规律:决定一家航空公司能否生存的关键指标,不是机队规模,而是飞机每天有多少时间在飞行。这个规律背后是深刻的经济学逻辑——飞机的成本(融资、折旧、保险、维护、机组)按日历时间累积,而收入只在飞行时产生。地面上的每一小时都在侵蚀利润,而利用率这个数字,实际上反映了航空公司运营能力的全部:周转效率、航线设计、维护计划、机组排班、备件库存,任何环节的失误最终都会体现在这个数字上。

企业AI正在经历同样的结构,只是硬件从飞机换成了GPU。GPU的成本同样按日历时间累积——融资、折旧、电力、冷却,无论它是否在计算。而它的产出只在计算时产生。两家拥有相似GPU预算的公司,其AI竞争力的差距,越来越取决于硬件在任意时刻是否在干正事,而不是取决于谁拥有的GPU更多。这个数字——GPU利用率——同样位于几乎所有基础设施决策的下游。

瓶颈转移:从模型到算力

AI的稀缺性并没有消失,而是沿着产业链上移,落在了不同的资源上。

第一波企业AI的竞争焦点是模型质量。更大的模型、更多的训练计算、更高的基准分数,参数数量和排行榜位置主导了讨论。这场竞赛确实产生了足够好的模型,足以支撑真实的企业工作负载。但能力总是伴随着依赖——生产级AI运行在专用硬件上,而今天这个硬件几乎全是GPU。

GPU昂贵、供应受限、需求远超供给,即使在市场顶端也是如此。2020年,微软为OpenAI建造了一台专用超级计算机:超过1万块GPU和28.5万个CPU核心,当时报道称其为全球最大的五个系统之一,用于训练GPT-3。当时,这看起来是几乎难以想象的硬件集中度,让算力看起来对任何能获得访问权的人来说都是个已解决的问题。六年后的今天,这个数字更像是一个起点而非天花板。到2026年,即使是地球上资金最雄厚的实验室也在将算力获取视为一个活生生的战略约束,而非已解决的问题。Anthropic一家公司就在亚马逊、谷歌、微软和AMD四个硬件平台上同时进行多吉瓦级的算力承诺,而Meta也签署了类似规模的协议。同时分散在四个供应商之间,这就是算力稀缺在买家拥有无限资本但仍无法从任何单一来源获得足够算力时的样子。

同样的模式在实验室下游以不同形式出现。通过API消费这些模型的企业面临的是定价问题而非硬件问题。成本随token使用量线性增长,这一事实将概念验证的经济性与生产环境的经济性完全分开。一个每月处理几千个请求的PoC看起来负担得起,同样的工作负载在量产规模下可能变成一个永远无法清除的成本线。正在获得关注的替代方案很直接:企业自购GPU并在本地运行模型,用固定的资本支出换取可变的、线性增长的成本。

忙碌的集群为何仍在浪费算力

一个充满忙碌GPU的集群可能仍然在浪费大部分潜力,原因几乎总是同一个:GPU全天候运行,而需求并非如此。基础设施必须按峰值规模设计——训练任务、批处理作业和实时流量同时到达的时刻——这导致在峰值之外,有相当一部分算力被预留却未被使用。更好的预测可以单独解决这个问题,如果每个GPU都能同样好地吸收每种工作负载的话。但很少有GPU能做到,而这正是问题更难的一半。

不匹配始于更深一层。在企业AI的第一代,GPU的工作很大程度上是单一的:运行推理。今天,同一硬件支持训练、微调、量化、实时推理、批处理推理、嵌入生成和模型评估,通常为同一组织,有时为同一模型,在同一个集群上。每种工作负载对硬件的要求不同,且差异深远。实时推理几乎把低延迟放在首位,因为响应慢就等于失败。批处理工作关心吞吐量,可以容忍延迟,有时长达数小时。训练可以连续占用GPU数小时或数天。量化需要大量容量,但时间很短。为其中一种调优的调度器几乎默认会错误分配其他三种。失败并不总是显示在利用率仪表板上。一个集群可能报告高平均占用率,而几个排队作业却在等待一个恰好被其他任务占用的GPU形状。

具体的工作负载组合因组织而异,但问题的形状不变。这也是飞机类比遇到极限的地方,而这个极限教会了我们一些东西。闲置的飞机通常可以重新部署到机队中的任何航线:一架在芝加哥的737可以飞往丹佛而不是达拉斯,几乎没有惩罚。而闲置的GPU只能吸收其内存、延迟和持续时间配置能够服务的工作负载。这种差异使得编排比机队调度更难,也解释了为什么问题不再是GPU是否被占用,而是哪个工作负载应该在哪个GPU上运行,在什么时间,以什么优先级。再买一机架GPU增加了容量和成本,而不是解决不匹配问题,新容量可能和已安装的容量一样,在错误的时间以错误的形状闲置。

智能进入基础设施

最大化GPU投资回报需要的不仅仅是一次性的配置决策。它需要对基础设施本身进行持续、主动的管理,每小时运行,而不仅仅在采购时。正在出现的应对措施是一个独特的学科——GPU管理——一个位于工作负载、模型和硬件之间的编排层。它的工作是持续决定:哪个工作负载运行,何时运行,如何运行,以及在集群中的哪个特定GPU上运行。这些概念上并不新奇,更接近一个好的运维团队凭直觉已经做的事情,只是被形式化并持续运行,而不是依赖某人注意到问题。

智能曾经几乎完全存在于模型中:更大、更好训练、更有能力,这曾是游戏的大部分。现在,智能也必须存在于基础设施中,存在于那个决定哪个竞争工作负载获得刚释放的GPU,以及相对于队列中其他等待者的优先级的层。让GPU保持忙碌不再是目标本身,因为忙碌很容易通过运行可以等待的低优先级工作来伪造。最大化每个已安装GPU产生的回报成为实际目标,而这被证明是一个比之前的配置问题更持续的问题。

配置得当并不能让这个问题消失,而是改变了它的形状。配置决策在购买时做一次,而分配决策不断做出:每次作业完成,每个新请求到达,客户面向服务与内部训练运行之间优先级的每次变化。这种频率解释了为什么决策已经从人工逐案处理转变为必须自动运行。没有工程师会在凌晨三点盯着仪表板,决定一个完成的训练运行是否应该将其GPU交给排队的批处理作业,还是为即将到来的客户流量突发保留。必须有其他东西持续做出这个决定,并且足够频繁地正确做出,以至于没有人需要检查。

这个学科足够新,其工具和惯例仍在形成中,对于成熟的GPU管理实践应该是什么样子,还没有单一的剧本出现。但至少已经确定的是约束移动到了哪里。

专业化释放算力,编排消耗算力

专业化和编排解决了同一问题的不同部分。

专门的、更小的模型可以以大型通用模型所需资源成本的一小部分执行特定任务,而不牺牲任务所需的质量。这对利用率有直接影响。曾经需要单个大型模型、在作业期间占用集群容量很大一部分的工作负载,现在可以在更小、任务特定的模型上运行,占用一小部分足迹。曾经完全被占用的容量突然空闲了。

专业化释放多少容量因工作负载和模型而异,但释放的容量仍然必须去某个地方,否则它只会闲置。一个更小的专门模型只有在有东西积极决定如何处理它释放的空间时,才能转化为GPU投资回报——将其重新分配给另一个工作负载、另一个模型、另一个在它后面等待的队列。如果不加管理,释放的容量变成另一种形式的闲置,而不是胜利,以不同于明显未使用的GPU的方式不可见,但同样没有生产力。

没有编排的专业化释放了无人认领的容量。没有专业化的编排可认领的容量更少,因为模型仍然很大,留下的足迹很小。两个杠杆都不能单独完成整个工作;每一个都提高了另一个杠杆可以达到的上限。如果目标是真正缩小已安装容量与有用输出之间的差距,而不是转移浪费所在的位置,那么两者都不是可选的。

这就是为什么模型架构和GPU管理是解决同一问题的两种方式,从两个不同的方向接近,最终相互依赖。一个缩小每个工作负载的需求,另一个持续决定差异的去向。

未来:利用率决定胜负

更大的机队一直是一个真正的优势,这里没有反对这一点。在拥有可比机队的航空公司中,有时甚至是面对更大竞争对手的较小机队,赢家通常是那个更完整地飞行其拥有飞机的一方,承载着航空公司所做一切好的重量。企业AI正从不同的方向到达同样的纪律。GPU已经安装,已经在折旧,已经承诺。专门模型和GPU管理是平行的解决方案,或双价策略。专业化缩小每个工作负载的需求,管理最大化基础设施的回报。掌握两者的企业将在未来十年设定AI竞争的节奏。

进一步阅读

dharma_fig1_cost_curve (1)

dharma_fig2_gpu_orchestration_v2_radial

dharma_fig3_specialization_matrix