Alphabet自研芯片Frozen v2:将Gemini架构固化硅片,推理效率跃升10倍

0 阅读

在人工智能基础设施的演进历程中,我们正见证一个关键转折点的到来。长期以来,AI芯片的设计逻辑遵循着通用计算的原则,即通过强大的通用处理单元来适应不断变化的软件模型。然而,Alphabet最新披露的内部项目Frozen v2正在颠覆这一传统范式。这款预计于2028年量产的芯片,并非仅仅是对现有TPU性能的线性升级,而是尝试将Gemini大模型的核心神经网络架构直接“冻结”并固化到硅片的物理电路中。这种从“软件定义硬件”到“硬件固化软件”的转变,预示着AI竞争已进入深度垂直整合的新阶段。

传统AI推理过程本质上是一个数据搬运的游戏。在现有的通用GPU或TPU架构中,模型权重和架构参数存储在内存中,计算单元需要频繁地从内存抓取数据进行运算,再将结果写回。这一过程中,大量的能耗和时间消耗在了数据搬运而非实际计算上。Frozen v2的创新之处在于,它将Gemini模型的层级结构、注意力机制以及残差连接等固定不变的架构信息,在芯片设计阶段就转化为物理电路的一部分。这意味着,那些在传统推理中需要反复运算和搬移的结构信息,现在变成了电流可以直接通过的固定路径。据知情工程师透露,这种设计使得单位功耗下的Token处理量相比现有TPU提升了6至10倍。这不仅是效率的提升,更是能源经济学的重构。

值得注意的是,Frozen v2并非试图固化模型的所有内容。早期的Frozen v1方案曾尝试连模型权重一起固化,但因无法适应模型快速迭代而被放弃。目前的V2版本采取了一种折中策略:只锁住“骨架”,即相对稳定的底层架构,而保留“血肉”,即可更新的模型权重。这一决策基于一个核心判断:Gemini的底层Transformer架构已经足够稳定。从2023年底发布的Gemini 1.0到后续的3.5 Flash版本,其核心的多头注意力、前馈网络和层归一化组件并未发生根本性变革。真正的迭代主要集中在规模扩大、训练数据优化和后训练调整上。因此,将架构固化在硅片中,是在模型稳定性与硬件专用性之间找到的最佳平衡点。

这种定制化ASIC(专用集成电路)的思路在半导体行业并不新鲜,比特币矿机和手机ISP都是典型案例。但在大模型领域,此前鲜有巨头敢冒此风险,主要原因在于模型迭代速度远快于芯片设计周期。通常一颗高端芯片从设计到流片需要两到三年时间,而大模型可能在几个月内就会发生架构突变。如果芯片出炉时模型架构已变,数十亿美元的投资将瞬间化为沉没成本。Alphabet敢于下注Frozen v2,表明其内部对Gemini架构的长期稳定性拥有极高信心,同时也反映出其对算力成本控制的迫切需求。

支撑这一大胆技术赌注的,是Alphabet雄厚的财务底气与紧迫的市场压力。2026年第一季度,Alphabet营收同比增长22%,Google Cloud营收首次突破200亿美元,合同积压飙升至4620亿美元。然而,光鲜的收入背后是惊人的资本支出。仅Q1资本支出就达到357亿美元,全年指引上调至1800亿至1900亿美元,几乎是2025年的两倍。自由现金流同比大幅下滑,迫使公司通过大规模股权融资来补充弹药,甚至吸引了伯克希尔·哈撒韦的巨额认购。这些资金主要流向当下的数据中心建设和第七代Ironwood TPU部署,以解决迫在眉睫的算力短缺问题。管理层明确表示,如果产能充足,云收入本可以更高。Frozen v2正是为了解决这一长期瓶颈,旨在让成本增长慢于收入增长,构建自我强化的经济护城河。

与此同时,AI行业的竞争格局正在发生深刻变化。英伟达虽然在云端AI训练和推理市场占据主导地位,拥有超过600万开发者的CUDA生态壁垒,但其通用GPU的模式正面临挑战。英伟达无法为每个客户的特定模型定制硅片,而Alphabet、OpenAI、Anthropic和Meta等头部玩家却可以。OpenAI与博通合作研发Jalapeño芯片,Meta推进Iris芯片投产,这些动作都指向同一个趋势:AI模型实验室正在演变为半个半导体公司。当每家巨头都使用为自己模型量身定制的芯片时,通用GPU市场的边际效应将递减,留给第三方供应商的空间将被压缩。这并非意味着英伟达的立即衰落,而是标志着AI算力市场从“通用垄断”向“专用分化”的结构性转变。

当然,Frozen v2之路并非坦途,其面临的风险不容忽视。首先是架构突变风险。尽管目前Transformer架构占据主导,但混合专家模型(MoE)、状态空间模型(SSM)等新范式正在学术界和工业界积蓄势能。如果Gemini 4.0或后续版本转向与Frozen v2硬编码方向冲突的架构,这颗芯片将面临巨大的贬值风险。其次是规模经济问题。作为小批量内部使用的芯片,Frozen v2的产销量远低于通用TPU,高昂的研发和流片成本摊销可能导致其总拥有成本(TCO)未必优于通用方案。最后是算法优化的不确定性。如果通过模型蒸馏、量化、投机解码等纯软件手段能大幅降低推理成本,那么硬件固化的相对优势将被削弱。芯片与算法始终是两条平行的效率曲线,Frozen v2押注的是硬件优化的上限更高。

尽管存在风险,Frozen v2向行业传递的信号依然清晰且强烈。AI竞争的重心正从训练速度转向推理成本。训练是一次性的资本开支,决定了谁有资格上牌桌;而推理是持续的运营开支,决定了谁能在桌上坐多久。随着AI应用从探索期进入普及期,推理成本的敏感度将远超训练速度。Alphabet通过Frozen v2展示了一种新的战略思路:不再仅仅作为AI容量的买家,而是成为AI成本曲线的设计者。这种全栈式的垂直整合,从模型算法到芯片架构,再到云端基础设施,正在形成一种难以复制的竞争壁垒。

对于整个科技行业而言,这一趋势意味着未来的AI基础设施将更加碎片化和专用化。通用算力依然重要,但在特定高负载场景下,专用芯片将凭借极致的能效比占据主导。这也要求企业在技术路线选择上具备更强的前瞻性和定力。Alphabet的尝试不仅是为了自身的成本控制,更是在探索后摩尔定律时代,如何通过软硬协同设计来突破物理极限。如果Frozen v2成功量产并验证其经济性,它将成为AI硬件发展史上的一个里程碑,证明在特定的超大规模应用场景下,专用性终将战胜通用性。这场关于硅片与代码深度融合的实验,才刚刚拉开序幕,其结果将深刻影响未来十年全球AI产业的权力版图。