国产算力效率革命:是石科技拓元如何实现千亿Token吞吐?

0 阅读

AI基础设施的发展逻辑正在发生根本性的范式转移。过去几年,行业竞争的焦点主要集中在算力规模的扩张上,谁拥有的智能芯片数量更多,谁似乎就占据了优势。然而,随着中国50多个智算中心的建成,智能算力总规模突破1000 EFLOPS,一个严峻的问题浮出水面:大量的算力资源并未转化为实际的生产力。算不快、长上下文响应延迟以及多模态处理效率低下,已成为制约AI应用落地的瓶颈。在此背景下,清华系团队是石科技在WAIC 2026上发布的“拓元”(Vectron),试图通过重构算力与Token的转化效率,重新定义AI基础设施的竞争规则。

从“拼卡量”到“拼效率”的战略转折

中国算力产业在“十五五”期间预计将迎来7万亿元的投资热潮。如果算力利用效率能够提升10%至20%,将释放出万亿级的价值空间。这一数据背后的逻辑十分清晰:单纯的硬件堆砌已无法带来边际效益的线性增长,唯有通过软件栈与底层硬件的深度协同,才能真正释放算力潜能。

是石科技的核心观点在于,AI基础设施的竞争下半场,不再是简单的“谁卡多”,而是“谁用得好”。拓元作为一座国产Token优化工厂,其核心使命是将庞大的国产算力转化为稳定、高效、可度量的Token输出。这不仅仅是技术的优化,更是对算力经济学的重新解构。通过打通从底层芯片到上层应用的全链路,是石科技致力于解决国产大集群从“点亮”到“跑满”之间的最后一公里问题。

拓元:构建统一的异构算力调度引擎

面对市面上纷繁复杂的国产芯片生态,拓元展现出了极高的兼容性与整合能力。目前,该产品已全面兼容昇腾、昆仑芯、天数智芯、太初、瀚博半导体、摩尔线程、沐曦、燧原等10余种主流国产算力芯片,并适配20余个主流大模型。这种广泛的兼容性并非简单的驱动支持,而是基于对硬件底层架构的深刻理解,实现了对异构算力资源的统一纳管与调度。

在传统部署模式中,不同品牌的芯片往往形成数据孤岛,调度难度大,资源利用率低。拓元通过异构集群调度技术,打破了跨地域、多芯片的算力壁垒。它不再依赖“一把抓”的粗放式分配,而是采用任务自适应优化策略。系统会根据请求画像,自动匹配最优的计算链路。例如,对于计算密集型任务,系统会优先分配浮点运算能力强的芯片;对于内存密集型任务,则选择显存带宽更高的资源。这种精细化的算力按需分配,显著减少了资源闲置与浪费,使得每一颗国产芯片都能在其擅长的工作负载中被“榨”出极限性能。

核心技术突破:破解长文本与多模态难题

在具体的技术实现上,拓元针对大模型推理中的几个关键痛点进行了深度优化,其中最具代表性的是KV Cache压缩技术与全模态Token压缩方案。

长上下文推理一直是企业应用中的成本黑洞。随着输入序列的增长,KV Cache的显存占用呈线性甚至超线性增长,导致推理速度下降且成本飙升。传统方法多依赖输入阶段的静态判断来筛选信息,但在动态业务场景中,模型关注点往往随上下文变化而迁移。拓元提出了“结果感知驱动”的KV Cache压缩技术,这种机制不预设静态规则,而是根据模型生成过程中的动态反馈,实时评估Token的信息价值。在不牺牲模型输出质量的前提下,显著压缩了显存占用,使得长文本、大规模AI应用在经济上变得可行。

此外,在多模态场景下,视频、语音等非结构化数据产生的Token量远超文本,带来了巨大的计算冗余。拓元设计了基于模态自适应的免训练Token压缩方法。这种方法无需对模型进行额外的微调训练,即可针对文本、视频、语音等不同输入模态,精准筛选关键信息,剔除无效计算。这不仅降低了单轮推理的计算量,更提升了模型在处理复杂多模态任务时的响应速度,为未来多模态AI的广泛应用铺平了道路。

智能体与长期记忆:让AI具备自我进化能力

除了推理效率,AI系统的可靠性与长期任务执行能力也是企业关注的焦点。拓元在“可靠深度推理”与“智能体长程任务记忆”方面取得了突破性进展。

传统的大模型部署后,往往需要大量的人工反馈 RLHF(人类反馈强化学习)来维持输出质量,这不仅成本高昂,且难以规模化。拓元引入了“基于元奖励的可扩展奖励建模方法”,使AI系统具备了自我优化的能力。通过元奖励机制,模型能够在复杂业务场景中自主理解企业标准,持续调整输出策略,从而从“需要不断投喂调教”转变为“部署即稳定运行”。

在智能体(Agent)场景下,长程任务执行面临着信息丢失与注意力分散的挑战。拓元提出了“以目标导向的信息记忆策略”,突破了稀疏信息监测难、长程建模资源受限以及注意力机制二次复杂度开销大的技术瓶颈。这一机制确保了智能体在执行长时间、多步骤的检索与分析任务时,能够准确判断哪些信息是已丢弃的冗余,哪些是缺失的关键,从而保持任务执行的连贯性与准确性。

产业价值:从技术护城河到商业闭环

是石科技成立于2021年,其创始团队源自清华大学计算机系,具备深厚的国家级计算中心工程化经验。这种“学院派”的技术底蕴与“产业派”的工程能力相结合,使得拓元不仅仅是一个实验室原型,而是一个经过大规模集群验证的商业化产品。

数据显示,拓元在万卡级国产大集群中实现了每日千亿级别的Token吞吐量。对于互联网大厂、头部大模型公司以及航空航天、生物制药等垂直行业客户而言,这意味着他们可以摆脱对单一芯片供应商的依赖,灵活构建异构算力池,并通过统一的软件栈降低运维复杂度与推理成本。

拓元的发布,标志着国产AI基础设施进入了一个新的阶段:从单纯的硬件国产化迈向软件生态的自主可控。作为一个关键的中间件,拓元屏蔽了底层芯片的差异,为上层应用提供了统一、高效的标准接口。这种“去耦合”的设计思路,不仅提升了现有算力的利用率,更为未来国产芯片生态的迭代升级预留了空间。

结语:算力轰鸣背后的理性思考

在WAIC 2026的喧嚣中,是石科技选择了一条看似低调却极具远见的道路。他们不讲芯片参数,不秀绝对算力,而是聚焦于“效率”这一核心指标。闫博文所言的“万卡集群的轰鸣声”与“客户的高度评价”,实际上是算力价值转化的最终度量衡。

随着AI应用从探索期走向深水区,企业关心的不再是“模型有多强”,而是“调用成本有多低”、“响应速度有多快”、“服务有多稳”。拓元通过技术手段,将抽象的算力转化为可量化、可优化、可信任的Token服务,正在悄然改变中国AI产业的底层逻辑。在这场从规模到效率的竞赛中,谁能率先建立起高效、稳定、通用的Token优化体系,谁就能在未来的AI基础设施格局中占据主导地位。这不仅是技术的胜利,更是产业理性回归的标志。