谷歌Frozen v2芯片曝光:将模型架构硬连线硅片,能效碾压TPU十倍的豪赌
从通用计算到专用硬件的范式转移
人工智能基础设施正在经历一场前所未有的底层重构。长期以来,GPU和TPU等通用加速器被视为AI计算的基石,它们凭借强大的并行处理能力,成功承载了从训练到推理的全流程需求。然而,随着大语言模型参数规模的指数级增长,通用芯片在能效比和数据搬运上的瓶颈日益凸显。在这种背景下,谷歌近期曝光的Frozen v2项目,标志着一场激进的技术实验正式浮出水面。
据内部消息及行业披露,谷歌正在研发一款代号为Frozen v2的神秘服务器芯片。与传统芯片不同,这款芯片并非仅仅具备运行模型的能力,而是将Gemini模型的部分底层架构永久蚀刻进硅片之中。这种“长在芯片里”而非“跑在芯片上”的设计理念,旨在通过硬件层面的定制化,彻底消除软件运行时的大量冗余决策。初步数据显示,按每瓦特处理Token的数量计算,Frozen v2的效率有望比谷歌最新一代TPU高出6到10倍。若该项目能按计划在2028年左右部署,这将是AI硬件领域一次具有里程碑意义的飞跃。
硬件固化:重塑计算效率的底层逻辑
要理解Frozen v2的革命性,首先需要厘清通用芯片的局限性。无论是英伟达的CUDA生态还是谷歌自研的TPU,本质上都是通用计算单元。它们像是一个全能的厨房,什么菜都能做,但每道菜的烹饪流程、工具选择、火候控制都需要在运行时动态决定。这种灵活性带来了广泛的兼容性,却也导致了巨大的能源浪费。芯片在运行时不得不进行海量的实时数据搬运和逻辑判断,这些被称为“指令开销”的隐性成本,在大规模并发推理中被无限放大。
Frozen v2的核心思路是“冻结”模型的关键决策路径。它不再让芯片在运行时思考“该怎么走”,而是将Gemini模型的关键计算蓝图直接铸入电路。这就好比为一道招牌菜专门砌砌了一个定制灶台,灶眼大小、锅具位置、火力档位全部固定。在这种架构下,芯片无需再进行复杂的指令解码和数据路由,每一步计算都沿着预定义的物理路径流动。这种极致的专用化设计,大幅减少了数据搬运次数和逻辑决策环节,从而释放出惊人的能效潜力。
此前,Google DeepMind首席科学家Jeff Dean曾提出过一个更为激进的想法:直接将模型权重烧录进芯片。虽然这一方案因生命周期过短——模型一旦更新,芯片即沦为废铁——而被搁置,但其核心逻辑被Frozen v2继承并改良。Frozen v2采取了折中策略:不固化易变的权重参数,而是固化相对稳定的底层计算架构。这意味着,只要Gemini的基础架构不发生根本性颠覆,芯片即可持续服役,新版本的参数依然可以动态灌入。这种在效率与灵活性之间的微妙平衡,是整个项目工程实现的关键难点。

算力荒下的被迫创新
谷歌之所以愿意承担研发专用芯片的高昂风险,根本驱动力在于日益严峻的算力短缺。这已不仅仅是资源紧张的问题,而是直接影响了商业变现能力。近期,谷歌Cloud业务被迫开始拒绝部分外部客户的订单,这一信号在云计算行业极为罕见,反映出底层算力供给的极度枯竭。
为了填补巨大的算力缺口,谷歌不得不采取极端措施。今年6月,谷歌签署了一份巨额合同,每月向SpaceX支付9.2亿美元,租用11万张英伟达GPU的算力,租期长达三年。一家全球领先的云服务提供商,竟需向一家火箭公司租赁算力,这一幕深刻揭示了AI军备竞赛的疯狂程度。全行业都在陷入同一困境:现有的通用硬件架构已逼近物理极限,继续堆砌GPU的成本收益比急剧下降。
在这种背景下,将每一瓦特电力榨取更多Token成为行业共识。从SambaNova、d-Matrix等初创公司,到OpenAI、微软等科技巨头,再到英伟达自身通过收购Groq布局推理芯片,所有玩家都在寻找突破能效瓶颈的出路。加拿大初创公司Taalas此前已在“硬连线”模型到芯片的道路上融资超2亿美元,而谷歌的入局,则标志着这一技术路线从边缘尝试走向主流视野。谷歌试图通过软硬件的深度融合,重建其在AI基础设施领域的护城河。

效率与灵活性的终极博弈
然而,Frozen v2的高能效并非没有代价,其核心风险在于“僵化”。专用硬件的生命力完全依赖于目标模型的稳定性。只有当后续世代的Gemini模型继续沿用芯片设计时的同一底层架构,Frozen v2才能发挥其全部威力。反之,如果Gemini的架构发生剧烈迭代,这款芯片将面临迅速过时甚至报废的风险。
纵观AI模型的发展史,架构迭代的速度堪比消费电子行业。从传统的纯Transformer结构,到MoE(混合专家)架构的兴起;从单一文本处理到多模态原生支持;从密集推理到稀疏激活机制,模型的每一次进化都可能意味着底层计算逻辑的根本改变。谷歌深知这一风险,因此Frozen v2最初可能不会追求TPU那样的大规模量产,而是作为一次有限度的试验。赌对了,数据中心将节省巨额电费,算力成本大幅下降;赌错了,则转化为技术积累,为下一代更智能的专用芯片设计提供经验。

值得注意的是,该项目的披露时机颇具意味。就在近期,彭博社报道Gemini 3.5 Pro因编程能力等指标不达标而三次延期。在模型侧遭遇挑战之际,谷歌选择将更多资源投入到芯片端的突破,这反映出其战略重心的微妙转移。从当年自研TPU以摆脱对英伟达的依赖,到如今将模型直接嵌入硅片,谷歌始终走在软硬件协同深化的前沿。这表明,AI竞争的下一个阶段,将不再是单纯的算法比拼,而是对物理层极限的探索。通过将软件逻辑硬件化,谷歌试图在能效比的竞赛中建立难以逾越的技术壁垒,这不仅是对现有算力危机的一种回应,更是对未来AI基础设施形态的一次重新定义。随着技术的逐步成熟,我们或许将迎来一个“模型即硬件”的新时代,其中软件与硬件的界限将彻底消融,算力将变得如同电力般高效且廉价。