开源模型新格局:2026年夏季生态观察与趋势解析
开源模型生态的夏季观察:2026年1月至8月
在AI领域,时间仿佛被压缩。距离我们春季报告发布仅数月,开源模型生态又发生了诸多显著变化。本报告基于2026年1月至8月的数据,梳理了六大关键观察,并附上数据支撑。
模型与数据集持续增长,但分布极不均衡
Hugging Face Hub上的模型和数据集数量持续攀升。公开模型仓库从243万增长至296万,数据集从71.1万增至100万,Spaces从100万增至144万。然而,分布依然极端:约85.6%的模型累计下载量不足200次,而1.5%的仓库占据了99.2%的下载量。所有趋势都发生在这种极度不均衡的背景下。

前沿模型竞争加速,中国实验室领跑超大模型

过去,实验室通常先发布小模型,再逐步向大模型迈进。但2026年,多家中国实验室直接跳过这一路径,直接发布超大模型。数据显示,在2026年的几乎每个月,中国实验室发布的最大开源模型都大于美国实验室的同期产品。中国月度最大模型参数在7540亿至2.78万亿之间,而美国除NVIDIA的Nemotron 3 Ultra(5610亿)和Thinking Machines的Inkling(9520亿)外,多数月份最大模型低于1300亿。
这种策略分化明显:Moonshot、MiniMax、Xiaomi和Z.ai几乎不发布70B以下模型,而腾讯和阿里Qwen则覆盖从1B到超大模型的全谱系。前者押注前沿模型和API需求,后者则希望成为开发者默认选择的模型家族。
值得注意的是,美国并未缺席开源。AMD和NVIDIA成为发布新模型最多的机构,各自超过200个模型仓库,远超其他机构。硬件公司意识到,开源模型是销售芯片的有效方式:针对自家硬件优化的免费模型,是硬件能力的最佳证明。
然而,美国在前沿模型规模上落后。多数超过100B参数的美国发布并非全新模型,而是基于中国模型的二次开发。美国原创大模型仅有Thinking Machines的Inkling、NVIDIA的Nemotron系列和Arcee AI的Trinity-Large等少数几个。AMD虽贡献了大量转换模型,但无原创大模型。这反映出美国在模型创造层面让位于中国,但在硬件和基础设施层面依然活跃。

关注度不等于采用度:下载量与点赞的背离
我们对比了2026年累计下载量前25的模型和点赞数前25的模型,发现仅有一个仓库同时出现在两个榜单中。下载量统计的是窗口期内数据,而非终身数据,因此排除了老模型的时间优势。结果令人惊讶:2026年发布的模型无一进入下载量前25,而前25中有13个来自2022年。例如,all-MiniLM-L6-v2在七个月内被下载15.5亿次,但仅获得5156个赞;而Kimi-K3每获得一个赞,大约对应60次下载。
点赞反映的是社区对发布的兴奋度,通常集中在发布后几周的前沿模型上;下载则反映模型被集成到实际工作流中的程度,往往属于稳定的小模型,且随时间累积。两者代表不同的行为,不能互相替代。
这种分化在机构层面同样明显。中国前沿实验室是唯一在Hub上大模型下载量占主导的账户:MiniMax 2026年下载量几乎全部来自70B以上模型,Moonshot为88%,DeepSeek为55%,Z.ai为39%。而美国大型账户中,Google、Microsoft、IBM Granite的70B以上模型下载量几乎为零,NVIDIA和Meta也仅占14%和9%。

总下载量差异更为显著:Moonshot全年下载量3700万,而Qwen凭借全谱系策略达到20.45亿,相差约55倍。时间因素也很关键:多数模型发布后使用量急剧下降,随后进入长期稳定期。模型的采用度在发布后几个月内基本定型。
开源权重改变价值积累方式
如果前沿模型是授权业务,那么最大型的发布应带有最严格的条款。但数据显示相反:2026年中国发布的178个20B以上模型中,59%采用Apache 2.0,22%采用MIT,且没有任何一个带有非商业限制。DeepSeek和Z.ai在7000亿至1.65万亿参数模型上使用纯MIT许可。中国实验室对其最大模型的许可与其最小模型一样宽松,甚至比美国实验室更宽松:美国同规模模型中,仅29%采用Apache或MIT,41%为自定义条款,30%未声明。

显然,这些发布并非为了许可收入。权重以最宽松的条款免费提供,回报必然来自其他渠道:API和云业务、硬件和平台定位,或生态位本身。例如,Z.ai和Kimi的估值表明,有效的开源策略能带来社区关注和增长机会。未来,行业可能转向更清晰的开源变现路径。
Qwen成为社区基础模型
一个模型的生态位不仅由其自身发布决定,更取决于社区在其上的构建。Qwen已成为开源生态中最大的基础模型之一:基于Qwen的衍生模型在Hub上达到151,448个,是Meta总足迹的2.6倍,是Llama仓库的4.7倍。Google以82,506个衍生模型位居第二。第三大来源是Unsloth,一个社区账户,发布量化和微调就绪版本,其中许多进一步扩展了Qwen生态。
Qwen衍生模型在2026年前七个月以每天约180-210个新仓库的速度增长,表明采用并非仅由个别发布驱动。Qwen已成为开发者决定微调和部署模型时的默认工作流的一部分。
这一地位源于几个因素:一是发布节奏稳定,持续更新模型家族;二是覆盖广泛,从小于1B到2.4T参数,满足不同需求;三是Apache 2.0许可,减少修改、再分发和商业使用的摩擦。这些因素相互强化:广泛的模型家族吸引更多开发者,更多开发者创造更多衍生模型,衍生模型又吸引未来用户。
值得注意的是,这一地位主要由社区构建:151,448个衍生模型是其他开发者的下游工作,而非Qwen自身发布。即使在Hub上28,531个Qwen的GGUF转换中,Qwen官方仅发布了54个。
小模型仍是实际应用主力
在声明参数数量的模型中,1B以下模型占所有时间下载量的83%,而100B以上仅占1%。2026年下载量中,70B以上模型仅占3%。这一发现与春季报告一致,原因相同:小模型是唯一能在大多数开发者实际拥有的硬件上运行的模型。
那么,万亿参数模型如何触达用户?答案是llama.cpp。2026年2月,ggml团队加入Hugging Face,项目保持完全开源、社区治理。llama.cpp的Hub增长显著:7月快照包含DeepSeek-V4-Flash约284B参数和Kimi-K3约2.8万亿参数的GGUF构建。本地推理从笔记本电脑上的8B模型,扩展到跨多台消费级机器的万亿参数混合专家模型。

本地推理的路径也以Qwen为主:每月GGUF下载量达3960万,几乎是Gemma(2080万)的两倍,是Llama(750万)的五倍多。Llama的差距并非供应问题:Llama衍生的GGUF仓库数量略多于Qwen,但流量仅为五分之一。

模型仓库在七个月内增长21.5%,但周边层增长更快:声明gguf库的仓库增长464%,lerobot增长194%,Apple的mlx增长148%,而transformers和peft仅增长16%,diffusers增长21%。模型核心层增长与平台平均水平相当,但决定模型物理运行位置的层(本地推理格式、Apple芯片、机器人控制栈)增长速度为前者的三到七倍。

在十大模型家族中,实验室官方发布的GGUF转换很少,但GGUF版本往往是开发者本地运行模型时使用的。官方在发布时提供转换、记录量化选择并签名工件,所需额外努力有限。实验室可与Unsloth等社区贡献者合作,缩小模型创建者测试的权重与社区采用版本之间的差距。

智能体成为新用户

2026年3月,我们无法撰写这一节,因为工具尚不存在。7月发布的agent-usage数据集记录了编码智能体通过huggingface_hub或hf CLI调用Hub时发送的agent/

7月,Claude Code以44.4%的流量领先,但单月数据掩盖了真实发现:4月其份额为67.8%,5月骤降至6.4%,而Codex从10.4%稳步攀升至20.8%。这是一个没有固定领导者的市场,一次发布或一个默认设置的变化就能在一个月内移动一半流量。
第二个发现是未注册行:7月近四分之一的智能体流量来自数据集中未命名的工具,5月这一比例高达59.8%。4月至7月间,出现了十多个新的客户端标识符。新进入者的速度超过了任何注册表的命名能力——这本身就是发现。
我们今年大部分时间都在为这一读者构建,而不仅仅是人类浏览器。3月,论文开始提供机器可读的Markdown;4月,引入智能体轨迹作为一等数据集类型,并在每个Gradio Space上提供agents.md端点;7月,在MCP服务器上推出hf_fs工具,通过单一接口暴露仓库、存储、文档和论文,仅需约一千个令牌,同时提供可附加的沙箱用于安全执行。协议层也发生整合,MCP进入Linux基金会的Agentic AI Foundation。

7月,一个智能体从读者变成了入侵者。我们遭遇了首例有记录的自主智能体主动发起持续入侵的事件。当我们团队试图使用前沿闭源模型分析捕获的攻击代码时,其安全护栏拒绝了工作。最终,分析由运行在我们自有基础设施上的量化开源模型GLM-5.2完成。我们发布了披露和完整技术时间线。

展望未来
与春季报告相比,地理权力再平衡持续加速。美国开源模型仍在发展,但中国多个前沿模型之间的竞争吸引了社区强烈关注。这些前沿模型获得的点赞反映了社区的兴奋点,也为利用关注度提升估值的公司提供了增长机会。
然而,AI竞赛不仅是短跑,更是马拉松。llama.cpp等工具帮助大型模型本地部署,但广泛的模型家族及其采用仍是关键,以建立开发者、发布者和未来用户之间的正反馈循环。嵌入基础设施并成为生态一部分的模型,最终可能带来商业上合理的退出。
最后,智能体首次成为Hub上的头号用户,下一份报告可能也会大不相同。在AI领域,几个月就能重塑生态。
方法说明
本分析基于2026年前七个月Hugging Face Hub上的活动。使用的指标包括下载量、点赞、衍生模型和模型发布,它们代表生态活动的不同方面,不应直接解释为模型质量、商业采用或整体市场份额的衡量标准。下载量反映Hub生态内的使用情况,但不包括API使用、私有部署或其他渠道分发。点赞反映社区关注和兴趣,衍生模型则显示开发者基于现有模型构建的程度。由于开源AI采用发生在多个渠道,Hub活动应被视为生态发展的一个视角,而非AI市场的完整测量。