国产算力突围:清华系拓元如何日吞千亿Token破解异构调度难题?

0 阅读

算力竞赛下半场:从“拼数量”到“榨干性能”

中国人工智能基础设施的建设进程正经历一场深刻的范式转移。过去几年,业界关注的焦点主要集中在芯片数量的堆叠与算力规模的扩张上,各地智算中心拔地而起,智能算力总规模已突破1000 EFLOPS的大关。然而,这一繁荣景象背后隐藏着巨大的效率黑洞:50多个智算中心中,实际算力利用效率远低于预期,“算不快”、“长上下文响应迟滞”成为普遍痛点。

在WAIC 2026上海世界人工智能大会的喧嚣中,大多数厂商仍在展示硬件参数,而清华系团队创立的是石科技却另辟蹊径,将焦点锁定在“效率”二字。其核心逻辑在于,若能将现有算力的利用效率提升10%至20%,将释放出万亿级的产业价值空间。这种从“拥有算力”到“用好算力”的思维转变,标志着AI基础设施建设进入了深水区。对于企业而言,不再仅仅是购买算力资源,而是追求每一分算力都能转化为稳定、高效的生产力Token。

拓元架构:定义国产Token优化工厂

面对异构算力难以统一调度、大模型推理缺乏深度优化、长上下文导致显存压力激增以及国产芯片生态适配成本高昂等行业共性难题,是石科技推出了“拓元(Vectron)”——一座专为国产环境打造的Token优化工厂。这并非单一的模型或工具,而是一套完整的AI基础设施优化体系。

拓元的核心价值在于其强大的兼容性与统一调度能力。它全面兼容昇腾、昆仑芯、天数智芯、太初、瀚博半导体、摩尔线程、沐曦、燧原等十余种国产主流算力芯片,并适配20余个主流大模型。通过打破跨地域、多芯片的算力孤岛,拓元实现了对异构算力池的统一纳管。这意味着,无论底层硬件为何种架构,企业均可通过拓元实现资源的自动化匹配与优化调度,最终达到每日千亿Token的稳定吞吐量。这种“屏蔽底层差异、释放上层价值”的设计理念,正是国产算力生态走向成熟的关键拼图。

核心技术突破:解决长文本与多模态痛点

拓元的技术壁垒并非凭空构建,而是针对大模型应用中的真实痛点进行了精准打击。其中,KV Cache(键值缓存)压缩技术是其亮点之一。在传统大模型部署中,随着上下文长度的增加,显存占用呈线性甚至指数级增长,导致推理成本急剧攀升。拓元提出的“结果感知驱动KV Cache压缩技术”,摒弃了传统仅依赖输入阶段判断信息价值的方法,转而基于模型运行时的动态关注点,在不牺牲生成效果的前提下,显著压缩KV Cache体积。这一突破让长文本处理、大规模AI应用在成本可控的前提下成为可能。

此外,针对全模态推理场景,拓元引入了基于模态自适应的免训练Token压缩方法。在多模态数据中,文本、视频、语音的信息密度与价值分布截然不同。该机制能够精准筛选关键Token,减少无效计算,使AI在处理复杂多模态任务时更加高效。对于需要百万级上下文的企业知识库、智能助手等场景,拓元通过混合位置索引合成的长上下文偏好训练方法,以及记忆引导的重读机制,在大幅减少训练数据量的同时,实现了上下文理解能力的显著提升。

智能体进化:从被动响应到自我优化

随着AI智能体(Agent)在复杂业务场景中的深入应用,传统模型部署后依赖大量人工反馈进行优化的模式已难以为继。拓元提出了“基于元奖励的可扩展奖励建模方法”,旨在构建能够持续自我优化的AI系统。这一技术突破将AI从“需要不断调教的系统”转变为“具备自我进化能力的智能体”。

在长程任务执行中,智能体往往面临信息缺失或记忆断裂的挑战,导致任务执行不稳定。拓元设计的“目标导向的信息记忆策略”,有效解决了稀疏信息监测难、长程建模资源受限以及注意力机制二次复杂度开销大的问题。通过明确的目标导向记忆,智能体能够更准确地判断哪些信息已被处理、哪些信息缺失或不存在,从而确保长程Agent任务的稳定执行。这不仅降低了企业的运维成本,更提升了AI在复杂现实场景中的可靠性与适用性。

产业落地:从实验室到规模化商用

是石科技成立于2021年,其创始团队源自清华大学计算机系,具备深厚的国家级计算中心工程化经验。这种学术与产业的双重基因,使其在并行优化、算力调度等领域形成了独特的技术护城河。截至目前,公司已服务超过200家重点客户,涵盖互联网大厂、头部大模型公司、航空航天、生物制药、新能源等多个关键行业。

拓元的发布,标志着是石科技将其领先的集群运营经验凝结为标准化、商业化的产品。在“十五五”期间,中国算力产业预计将迎来7万亿元的投资热潮。在此背景下,拓元所代表的“算力效率优化”赛道,将成为连接底层硬件与上层应用的关键桥梁。通过提供统一异构资源管理、消除底层硬件差异,拓元不仅加速了国产芯片生态的成熟,也为中国AI产业构建自主可控的技术体系提供了基础设施级的支持。

结语:聆听万卡集群的轰鸣

技术创新的最终归宿是创造产业价值。对于是石科技而言,最激动人心的时刻并非实验室里的突破,而是每次交付给客户的万卡集群满负荷运行时发出的轰鸣声,以及通过优化技术帮助用户实现终极效果后获得的高度评价。

在算力效率这一命题上,当行业仍在争论技术路线时,拓元已经通过WAIC展示了其商业化落地能力。这不仅打开了从算力服务向Token服务转型的新空间,更预示着中国AI产业正从规模的粗放增长转向质量的精细运营。未来,谁能更高效地将每一份算力转化为有价值的Token,谁就能在AI基础设施的竞争中立于不败之地,推动中国AI技术走得更稳、更远。