字节拒绝蒸馏捷径:张一鸣的长期主义如何重塑AI竞争格局?
字节的AI豪赌:拒绝蒸馏,张一鸣的长期主义有多坚决?
在AI大模型竞赛进入白热化的2026年,字节跳动做出了一项令业界侧目的战略决策:拒绝使用蒸馏技术来快速追赶前沿模型。这一决策背后,是创始人张一鸣对技术主权的执着追求,以及对AI发展规律的深刻理解。当其他中国科技公司通过蒸馏迅速提升模型排名时,字节选择了一条更艰难但可能更可持续的道路。
三次路线之争:张一鸣的坚持
字节内部关于是否采用蒸馏技术的争论,至少经历了三次关键节点。第一次发生在2025年1月,DeepSeek-R1的推理风格席卷全球,Seed团队部分研究员提议跟进蒸馏,但张一鸣明确拒绝。他认为,字节需要的是让模型像人类一样"学习如何思考",而非模仿R1的"碎碎念"。
第二次冲突出现在英伟达Blackwell芯片部署后。算力差距拉大,对手获得最新硬件,字节只能依赖性能受限的H20芯片。蒸馏呼声再起,但张一鸣再次否决,转而增资2000亿元在乌兰察布和怀来建设智算中心。
第三次压力来自Kimi K3跻身全球顶尖模型榜单。每次国内开源新模型发布,都成为字节内部的压力测试。但张一鸣始终认为,榜单排名是虚的,商业主权才是实的。据接近Seed团队的人士透露,字节早在2023年4月就明令禁止将GPT生成数据混入训练集,并通过API检测等技术手段硬性执行。
蒸馏的诱惑与陷阱
蒸馏技术之所以被广泛采用,在于其高效性。通过使用其他大模型的输出作为训练数据,模型可以在几周内快速提升基准测试分数,逼近被蒸馏模型的水平。在大模型竞赛早期,几乎所有玩家都尝试过这条捷径。
然而,蒸馏的代价同样显著。2024年7月,牛津、剑桥等机构的联合研究登上《Nature》封面,首次系统证实了"模型坍缩"现象:当模型反复使用AI生成的数据训练时,原始数据分布中的尾部信息会逐渐消失,导致不可逆的能力退化。ICLR 2025的Meta研究进一步表明,训练数据中即使只掺入千分之一的合成数据,也足以触发模型坍缩,且模型参数量越大,坍缩效应越明显。
尾部信息的重要性在于,真实世界的知识分布极不均匀。常见问题只占头部,而罕见场景、反常识提问、方言俚语、小众专业知识都藏在长尾中。这些长尾信息决定了模型处理未知问题的能力上限。AI生成的"标准答案"会天然抹平长尾,使模型变得越来越自信,也越来越狭隘。
数据优势:字节的底气
字节拒绝蒸馏的底气,首先来自其独特的数据优势。抖音日均产出超8000万条短视频,头条推荐内容以亿计,TikTok覆盖150多个国家和地区,构成全球最庞大的原生人类内容池。从这些PB级真实数据中清洗降噪,远比使用几百万条GPT生成的干净指令困难,但只有原生数据才能完整保留现实世界的分布,包括那些鲜活、不可预测的长尾。
Scaling Law的本质,是用更多高质量真实数据推高智能天花板。合成数据只能在已有边界内平滑,无法突破边界。字节选择的,是一条自己定义天花板的路。
技术主权:从词表到多模态
蒸馏的另一个隐性代价,是失去技术主权。词表是模型的"眼睛",决定了文本切分方式和语义颗粒度。使用别人的词表,等于接受别人的语言偏好和认知框架。例如,Llama的词表针对英语优化,处理中文成语、网络热梗时效率低下,语义关联被切碎。
在多模态领域,这一影响更为致命。字节Seed系列的核心战场是原生多模态,Seedance 2.0已实现原生音画同步的视频生成,支持60秒2K分辨率视频和8种语言唇形对齐。这种能力要求模型在底层实现文本、视频帧、音频信号的原子级映射。如果蒸馏别人的模型,继承的就是别人的编码地基,无法自主定义视频Token粒度、音频编码方式、多模态联合注意力机制。
不蒸馏,意味着字节可以从零定义规则,所有底层决策握在自己手中。对要做视频生成、多模态交互的字节来说,地基的自主权比短期文本榜单排名重要得多。
工程内功:算力限制下的突围
蒸馏是轻量级"微创新",几百张GPU跑几周就能见效。但字节选择的从头训练路线,是真正的AI"重工业"。从零训练200B以上参数的MoE大模型,比拼的是整套工程体系的硬实力。
超大规模预训练中最致命的指标是MTBF(平均无故障时间)。一次完整预训练周期长达数月,调动数万张GPU并行计算,任何一张显卡故障、链路闪断、算子溢出都可能导致训练中断。集群规模越大,故障概率越高。假设单张GPU平均无故障时间10万小时,一万张卡的集群平均每10小时就会遭遇一次硬件故障。没有毫秒级故障检测、精准断点续训和完备容错机制,大规模从头训练无从谈起。
字节面临的挑战更为严峻。受美国芯片出口管制限制,无法采购Blackwell旗舰芯片,只能使用H20,单卡训练效率与海外顶尖平台差距显著。这反而倒逼字节将基础设施能力推到行业极限。字节训练集群已布局乌兰察布、大同、怀来、张北、芜湖等多个智算中心,搭建起数万张卡规模的分布式算力网络。2026年AI基础设施资本开支上调至超2000亿元,净利润明显下滑,核心原因正是算力采购与数据中心建设的集中投入。
张一鸣本人将一半精力倾注在Seed团队。这笔千亿级投入,加上创始人级别的注意力倾斜,押注的是一整套能稳定支撑超大规模训练的全栈工程体系:从底层算子优化、集群通信调度,到训练故障恢复、算力资源管理,全部自主研发。这套能稳稳撑起"万亿参数从零训练"的基建能力,才是字节真正的技术护城河。
奖励模型的灵魂归属
蒸馏学的是"答案",从头训练学的是"思维"。用别人模型的输出训练,学到的是对方的输出分布,包括语气、套路、甚至RLHF阶段注入的价值观偏好。模型知道什么问题该说什么话,但不知道为什么这么说;模仿得了结果,模仿不了推理链路。
更关键的是,模型的"灵魂"会打上别人的烙印。什么是好回答、什么该拒绝、什么场景用什么风格,这些底层偏好会在蒸馏中被一并继承。后续再做RLHF、调奖励模型,也只是在别人的地基上装修。
字节需要的是完全对齐自身业务逻辑的奖励模型。抖音推荐讲完播率和互动率,电商讲转化效率,短视频讲节奏感和视觉冲击力。这些独特商业逻辑必须深度植入Reward Model,让模型在RLHF阶段就和字节系产品目标对齐。只有从头训练,从预训练到RLHF全链路自主,才能让模型真正对齐到字节那套极致的商业逻辑中。这不仅关乎效果,更关乎可控性。
10万亿参数的豪赌
拒绝了捷径,字节的追赶路径是什么?据《金融时报》报道,字节跳动正在讨论训练一个参数规模10万亿的大模型,显著超过阿里Qwen 3.8-Max的2.4万亿和月之暗面K3的2.8万亿,是目前国内已知参数规模最大的模型计划。项目由Seed Foundation负责人项亮主导,与预训练数据负责人沈科协同推进,仍处于早期探索阶段。
这是一个非常"字节"的选择:与其在同尺寸参数上苦苦追赶,不如直接把规模拉到同行的数倍,用一次量级跃迁争取领先位置。Scaling Law依然是当前大模型最可靠的进阶路径。当主流玩家还在2-3万亿参数区间内卷时,字节直接冲击10万亿,本质是用规模换时间,跳过中间追赶步骤,直接摸到下一个梯队的门槛。
但这同样是一场豪赌。参数规模翻倍,训练难度指数级上升。数据供给、算力稳定性、对齐难度、推理成本,每一项都是巨大挑战。2000亿资本开支、70%的利润下滑、创始人一半的精力,所有筹码都压在了这条"更慢更难"的路上。
战略意义:提前避险
这条路的价值,不止于技术本身。当DeepSeek被OpenAI正式指控蒸馏,当美国立法将模型数据窃取纳入国家安全范畴,字节的选择突然有了提前避险的战略意味。全链路自研的模型,没有知识产权争议,没有合规包袱,无论是全球化布局还是长期技术竞争,都站在更安全的位置。
未来3年,大模型的技术范式窗口期正在急剧收窄。头部玩家今天的技术路线选择,会决定未来十年甚至更久的竞争格局。蒸馏的诱惑在于确定性:你知道终点在哪里,知道怎么走最快,投入产出清晰可见。但它的代价,是永远失去定义终点的资格。
张一鸣在会议上明确希望团队以追求智能上限为目标,期待Seed模型能力跻身世界第一梯队。技术主权,真正参与定义智能上限的机会,正是这条更难走的路的回报。