IBM 发布 Granite Time Series PatchTST-FM-r2:支持商用的零样本时序预测模型
IBM 推出新一代时序基础模型 PatchTST-FM-r2
时序预测正在从“一数据一模型”的定制模式,转向使用通用预训练模型进行零样本推理的新范式。IBM 最近发布了 Granite Time Series PatchTST-FM-r2,这是其 Granite TSFM 系列的最新成员,主打高性能、开箱即用和商业友好。
这款模型的核心卖点很直接:你不需要为自己的销售数据、服务器指标或电网负荷单独训练模型,只需把最近的历史序列喂给它,它就能直接输出未来预测,甚至包括不确定性区间。更重要的是,它的许可证(Apache 2.0 或 OpenMDW 1.0)明确允许你在商业产品中使用,这在当前的大模型生态里并非理所当然。
截至 2026 年 9 月,PatchTST-FM-r2 在权威时序基准 GIFT-Eval 的“可复现、零样本”类别中,综合性能排名第二。而在同样允许商业使用的模型里,它就是第一。
在 GIFT-Eval 上的硬核表现
GIFT-Eval 是一个设计严谨的时序预测评测平台,汇集了来自能源、交通、零售等多个领域的异构数据集。评估分为两类:严格的“零样本”(模型预训练时完全没见过这些数据)和相对宽松的“预训练”(允许使用评测集的训练部分)。
在最能体现泛化能力的零样本赛道,PatchTST-FM-r2 的表现相当亮眼:
- CRPS(连续排序概率评分):几何平均得分为 0.467,仅次于 Google 的 TimesFM-3。
- MASE(平均绝对缩放误差):几何平均得分为 0.6846,稳居前列。
更让人意外的是,即使把那些“见过考题”的预训练模型也拉进来同台竞技,PatchTST-FM-r2 依然能排到 CRPS 第三、MASE 第四。这意味着它击败了包括 Chronos-2、Timer-S1 在内的一众对手,而其中不少模型的体量比它大得多。
架构升级:从 Transformer 到 Conformer
PatchTST-FM-r2 并非凭空而来,它是对前代 r1 版本的深度迭代。最大的变化在于内部骨干网络——从标准的 Transformer 层换成了 Conformer 层。

Conformer 最初用于语音识别,它巧妙地将 多头自注意力(Multi-head Self-Attention)和 时间卷积(Temporal Convolution)融合在一个模块里。这个改动解决了时序建模中的一个经典矛盾:

- 自注意力 擅长捕捉长距离依赖,比如季度性或年度周期,但它对局部细节不够敏感。
- 卷积 则天然带有局部归纳偏置,能高效学习短期模式,比如日内的波动规律。
在 r2 模型中,卷积层负责处理“眼前”的细节,让自注意力机制可以更专注于“远方”的关联。可视化注意力图可以清晰看到这种分工:r1 的注意力权重大多集中在对角线附近(关注邻近点),而 r2 的注意力则能有效扩散到远离对角线的位置(关注远距离点)。
除此之外,r2 还做了几项关键优化:
- 重叠分块(Overlapping Patches):使用 50% 重叠的窗口,并配合汉明窗(Hamming window)加权,再通过“重叠相加”(overlap-and-add)的方式合成最终预测,有效平滑了分块边界带来的不连续性。
- 更深的网络:模型层数从 20 层增加到 30 层,参数量达到约 3.85 亿。
- 更强的输出:新增了一个能预测 99 个分位数 的头部,不仅能给出点预测,还能完整描述预测分布,方便计算任意置信区间的上下限。
这些改进共同支撑了模型长达 8192 步 的上下文长度,使其能处理非常长的历史序列。
训练数据:透明而非黑盒
对于企业用户来说,模型跑分高只是入场券,训练数据的来源和构成才是能否放心部署的关键。IBM 在这一点上做得比较坦诚。
PatchTST-FM-r2 的预训练语料库由四个部分组成:
- GiftEvalPretrain 中的部分数据集。
- 自定义合成数据:基于 KernelSynth 方法生成,但修改了周期性核函数,并限制了数据增强的强度。
- TSMixup 语料库:采用了类似 Chronos 的混合策略,但严格避开了 GIFT-Eval 的评测集。
- 约 50 万条 CauKer 合成序列,每条长度为 4096。

这种透明度虽然不能替代企业自身的合规审查,但至少给了开发者一个清晰的起点,知道模型“吃过什么”,从而更好地评估潜在风险。

商业友好的开源许可

这是 PatchTST-FM-r2 区别于许多竞品的核心优势。它采用 双许可 模式:
- Apache 2.0:广为人知的宽松开源许可证。
- OpenMDW 1.0:由 Linux 基金会推出的、专门为 AI 模型设计的许可证。

用户可以任选其一。两者都允许自由地使用、修改和分发模型,不会对你的商业应用设限。模型权重、架构代码和完整的推理流水线都已在 Hugging Face 和 GitHub 上公开,确保结果可复现。
几行代码快速上手
想试试效果?过程比想象中简单。首先安装官方库:
pip install "granite-tsfm>=0.3.9"然后加载模型并进行预测:
import pandas as pd
from tsfm_public import PatchTSTFMForPrediction, TimeSeriesForecastingPipeline
# 从 Hugging Face 加载预训练权重
model = PatchTSTFMForPrediction.from_pretrained(
"ibm-granite/granite-timeseries-patchtst-fm-r2"
)
# 读取示例数据(这里用的是电力变压器数据集 ETTh1)
df = pd.read_csv(
"https://raw.githubusercontent.com/zhouhaoyi/ETDataset/main/ETT-small/ETTh1.csv",
parse_dates=["date"],
)
# 配置预测流水线
pipe = TimeSeriesForecastingPipeline(
model=model,
id_columns=[],
timestamp_column="date",
target_columns=["HUFL"], # 预测高用电负荷
context_length=512, # 使用过去 512 小时的数据
prediction_length=64, # 预测未来 64 小时
quantile_levels=[0.1, 0.5, 0.9], # 输出 10%, 50%, 90% 分位数
freq="1h",
)
# 对数据集最后 512 个点进行预测
forecast = pipe(df.iloc[-512:])整个过程无需任何微调或额外训练。你可以轻松地将 df 替换成你自己的数据,无论是网站流量、CPU 使用率还是商品销量,只要它是规则采样的时间序列即可。
从离线分析走向实时流处理
对于很多应用场景,数据是源源不断地产生的,而不是静态的 CSV 文件。为此,IBM 与 Confluent(Apache Kafka 的商业公司)合作,将 Granite Time Series 系列模型(包括 r1 和最新的 r2)集成到了 Confluent Cloud 的流处理平台中。
通过这个早期访问计划,开发者可以直接在 Apache Flink 作业里调用这些模型。这意味着,来自传感器或交易系统的实时数据流,可以在毫秒级延迟内得到预测或异常检测结果,而无需再搭建一套独立的机器学习服务来搬运和处理数据。这对于需要实时决策的场景,比如金融风控或工业设备预警,价值巨大。
总的来说,PatchTST-FM-r2 不仅仅是一个分数更高的模型,它代表了一种更务实、更开放的 AI 落地思路:提供强大性能的同时,也把选择权和控制权交还给开发者。