月之暗面K3开源:401人极客天团如何重塑万亿参数大模型底层逻辑

1 阅读

极客天团的集体亮相:K3背后的技术版图

2026年7月,月之暗面(Moonshot AI)正式开源了满血版2.8T参数模型Kimi K3。这一举动不仅标志着国产大模型在技术透明度上的重大突破,更通过首次公开401位贡献者名单,向全球展示了其背后这支极具战斗力的极客军团。在估值飙升至315亿美元的背景下,这支平均年龄不到30岁、80%为内向型人格(I人)的团队,正以人均扛起7亿人民币估值的惊人效率,重塑全球大模型竞争的格局。

月之暗面的组织文化极具特色,摒弃了传统的职级与KPI束缚,推崇“无部门墙”的扁平化管理。创始人杨植麟将摇滚乐队的自由精神融入公司基因,会议室以传奇乐队命名,会员套餐采用音乐术语。这种对“品味”的极致追求,不仅体现在产品体验上,更深刻映射在人才选拔与技术路线的选择上。他们倾向于招募具有“创业者光环”或“赌徒基因”的人才,内部超过50人拥有创业经历,这种文化催生了从K1到K3的快速迭代与底层创新。

顶层基石:从算法量产到系统架构的奠基者

Kimi K3的强大并非偶然,而是建立在几位核心联合创始人深厚的技术积淀之上。周昕宇作为算法团队负责人,擅长将实验室算法转化为大规模生产线系统。他主导的KDA混合架构结合NoPE MLA技术,在预训练和强化学习中显著降低了算力消耗,提升了推理速度。周昕宇与杨植麟在清华Splay乐队的渊源,也象征着两人从音乐到代码的跨界默契。

吴育昕则负责大模型的底层工程架构与基础设施。作为Detectron2的主要创建者之一,他在计算机视觉领域的贡献重塑了全球视觉大模型的底座。他与何恺明共同发表的Group Normalization论文,打破了小样本训练的瓶颈。在月之暗面,吴育昕专注于高性能深度学习系统优化,解决了万亿参数模型在长文本和高并发下的稳定性问题,为Kimi的多模态能力奠定了坚实基础。

CTO张宇韬在知识图谱与异构数据融合领域拥有深厚造诣,他主导研发的AMiner平台为Kimi的超长文本处理能力提供了技术底座。张宇韬精准预判了AI从“能对话”向“能干活”的转变,推动长上下文窗口技术和动态扩展网络架构的发展,带领团队攻克Agent终极战局,使Kimi在复杂推理任务中保持“清醒”。

工程突破:用系统设计换取极致效率

在模型能力之外,工程效率是Kimi K3区别于其他竞品的重要壁垒。许欣然作为工程副总裁兼AI基础设施负责人,设计了以KV Cache为中心的分离式推理架构Mooncake。该架构彻底分离了预填充与解码阶段,缓解了百万级超长上下文的显存和I/O压力,荣获存储顶会FAST 2025最佳论文奖。同时,作为MoBA混合块注意力机制的核心作者之一,许欣然通过块级别注意力切分,实现了训练和推理两端的大幅降本增效。

何蔚然作为推理系统负责人,其技术路径从芯片布线延伸至万亿大模型推理服务。他主导的Mooncake架构在Kimi生产环境数千个节点上稳定运行,每天处理上千亿token的用户请求,使推理集群单位成本一年下降超20倍。针对K3的KDA+MLA混合架构,团队向vLLM社区贡献了官方适配实现,通过缓存感知的路由调度策略,最大化缓存复用效率,最终使K3的推理成本仅为Claude Fable 5的38%。

秦若愚作为清华大学MADSys实验室的在读博士生,与月之暗面紧密合作研发Mooncake。他的研究直接面向生产场景,Mooncake系统使Kimi的请求处理量提升75%,长上下文场景中有效请求处理能力提升59%至498%。此外,他参与的Seer论文针对强化学习中的rollout性能瓶颈,实现了端到端rollout吞吐最高提升2.04倍,进一步巩固了Kimi在推理效率上的领先地位。

架构创新:重塑注意力机制与训练范式

Kimi K3在架构层面的创新同样令人瞩目。杜羽伦负责预训练与规模化方向,他是《Attention Residuals》、《MoBA》以及预训练优化器《Muon is Scalable for LLM Training》的共同作者。其工作通过块级别注意力切分与训练流重构,缓解了超深网络中的信号衰减问题,显著提升了万亿大模型的分布式训练效率。

张宇作为非Transformer与线性注意力路线的开拓者,主导开源了Kimi Linear模型,首次将线性注意力机制成功应用于超长上下文任务。他通过重构底层残差流,从根本上解决了大模型中PreNorm导致的梯度稀释与隐状态爆炸问题,实现了颠覆性的效率跃升。赖国堃作为Kimi团队论文数量最多的研究者之一,其擅长的机器阅读理解能力直接构成了Kimi长文本能力的核心技术底座,其本科时期发表的推荐算法论文在十年后仍获SIGIR时间检验奖,展现了其前瞻性的技术洞察力。

陈广宇,这位17岁的年轻研究员,作为《Attention Residuals》的共同第一作者,用“可学习的深度注意力”重构了深度学习领域沿用了近十年的标准残差连接。这一底层创新直接将模型的扩展效率拉高了1.25倍,让中国公司在万亿规模的顶级算力战局中,能够以更低的开销跑得更快。他的加入打破了常规,展现了月之暗面不拘一格降人才的独特文化。

多模态与智能体:从视觉理解到自主决策

在多模态领域,杜昂昂作为核心骨干,深耕视觉编码器设计、多模态对齐与视觉智能体技术。他发布的Kimi-VL开源多模态模型,自研MoonViT视觉编码器原生支持超高分辨率输入,搭配128K长上下文能力,使Kimi首次具备了通读长视频、长文档的多模态长文本理解能力。在K3阶段,他主导的智能体数据合成流水线,让模型可以自主生成高质量训练数据,为K3在编程、智能体等硬核任务上跻身全球第一梯队提供了关键的数据支撑。

瞿博文隶属于模型后训练团队,负责原生多模态强化学习体系。他提出从零视觉监督微调的纯文本推理模型出发,直接通过视觉强化学习获取视觉推理能力的训练方案,避免低质量视觉数据对模型原生语言推理能力造成干扰。这一创新路径跳出了传统多模态模型的常规套路,提升了模型在复杂视觉任务中的表现。

毛绍光作为Kimi Agent技术线的核心骨干,全程参与K2至K3四代旗舰研发。他亲历了Agent行业从“框架时代”向“模型即Agent”的范式转换。在月之暗面,他参与交付了Kimi首款Agent产品Kimi Researcher,该产品不靠任何流程预设,完全通过端到端强化学习训练而成,单任务平均完成23步推理,自主扫描206个网页,可产出带规范引用的万字调研报告,在HLE基准上达到26.9%,刷新了当时全球最高水平。

全栈协同:构建大模型竞争的护城河

Kimi K3的成功,是月之暗面全栈技术协同的结果。从许伟欣在Muon优化器、Kimi Linear线性注意力、Attention Residuals注意力残差三大核心技术论文中的持续贡献,到刘少伟在极致量化艺术上的死磕,再到陈冠多在计算高效型LoRA微调方法《Ce-lora》上的突破,每一位贡献者都在自己的领域做到了极致。

刘少伟作为核心基础设施团队的领军专家,深度参与了原生INT4原生量化格式的研发,使Kimi在拥有万亿参数的同时,API价格保持极低。陈冠多则通过研发《Oasis》和《Gar》,解决了底层数据库在大规模范围查询时的索引瓶颈,并提升了大模型精准理解人类复杂意图并转化为SQL数据库查询语句的准确率。这些底层技术的突破,共同构成了Kimi K3在算力经济学上的核心壁垒。

杨植麟曾言,在算力和数据日益同质化的今天,“品味”才是建立差异化壁垒的核心驱动力。这种品味体现在对技术细节的极致追求,对工程效率的不懈优化,以及对人才潜力的充分释放。Kimi K3的开源,不仅是技术的展示,更是月之暗面团队文化与技术哲学的集中体现。从周昕宇、吴育昕等创始人的技术积淀,到何蔚然、秦若愚在推理系统上的突破,再到陈广宇等新生代研究员的架构重构,这支极客军团正以惊人的速度,推动中国大模型走向全球舞台的中心。

随着K3的发布,月之暗面不仅展示了其在长文本处理、多模态融合及Agent智能体领域的硬核实力,更通过开源贡献,推动了整个AI社区的进步。Mooncake、MoBA、Muon等关键技术的开源,降低了行业门槛,促进了技术创新。Kimi K3的401位贡献者名单,不仅是一份技术档案,更是一份中国AI人才崛起的宣言。在“黄金时代”的轰鸣声中,月之暗面正以其独特的“品味”与实力,定义着大模型的未来形态。