迪卡侬在 AWS 上部署 Chronos-2 预测数万个 SKU 需求,精度提升 11-15 个百分点,每周 CPU 推理成本约 0.03 美元。
Decathlon 是全球最大的体育用品零售商之一,拥有超过 10万名员工和 4亿用户。该公司依赖大规模的高精度需求预测,以确保在客户需要时各门店有合适的商品供应。在评估了多个时间序列基础模型(TSFM)后,Decathlon 选择 Chronos-2 作为其预测体系的核心组件。
本文将分享 Decathlon 如何在 AWS 上大规模运行 Chronos-2 的架构设计、对供应链业务的影响,以及其他企业采用基础模型进行预测的实践经验。
精准的需求预测是零售供应链运营的基石。对 Decathlon 而言,这一挑战因业务的规模和多样性而更加突出:数万种产品覆盖 80多项体育项目,销售网络横跨多个大洲,需求模式具有强烈的季节性。一双滑雪手套和一块冲浪板的基本需求信号截然不同,但两者都必须被准确预测,以避免缺货或积压。
Decathlon 的预测系统用于预测所有产品在未来两个关键周期的每周销售量。第一个是 12 周补货窗口,供采购计划员向合作伙伴订货使用。第二个是 52 周战略周期,用于长期库存预测和产能规划。预测系统每周在这两个周期上运行,部署覆盖多个供应区域,包括欧洲、印度、中国、东南亚(SEA)、拉丁美洲(LATAM),以及即将拓展的中东和非洲。每个区域覆盖最多 2.5 万种产品。
Decathlon 的需求预测系统历经多年演进:
2021–2024:采用混合方案,使用 Amazon SageMaker AI DeepAR 处理短期预测周期(第 1–16 周),Holt-Winters 指数平滑处理长期周期(第 17–52 周)。DeepAR 每周重新训练以适应近期趋势变化。
2024 至今:引入带协变量的 Temporal Fusion Transformer(TFT),在长期预测精度上有所提升。
虽然这些方案运作良好,但存在运维负担:系统需要每周重新训练,且在拓展新区域时无法轻松扩展,需要额外的工程工作。团队需要一个能在更低运维复杂度下实现更高精度的解决方案。
时间序列基础模型(FMs)的兴起带来了预训练模型的承诺——无需在领域数据上从头训练就能超越经典方法。但一个关键问题仍然存在:这些模型在 Decathlon 特定的零售数据集上表现如何?
为此,Decathlon 在其自有零售数据上设计了严格的、大规模基准测试,对多个 TSFM 与其生产基线进行评估。
评估设计:
完整的基准测试结果(包括多款 TSFM 的对比),请参阅 Decathlon 在 Medium 上发布的详细分析。
Decathlon 对多款 TSFM 进行了零样本(zero-shot)和微调两种配置的评估。在 Decathlon 发布的基准测试结果中,微调后的 Chronos-2 在两个预测周期上一致地超越了所有其他被评估的模型。即使在零样本模式下,它也能匹配或超越完全训练的生产基线。微调进一步将预测误差降低了数个百分点。
零样本的可行性:多款 TSFM 达到或接近 Decathlon 现有生产模型(每周重新训练)的性能,无需任何领域特定的训练。
微调带来显著收益:即使采用低频微调策略(每 6 个月一次),微调也能显著提升性能。微调后的 Chronos-2 在短期(12 周)和长期(52 周)两个预测周期上都展现了最低误差。
计算效率:Chronos-2 可以在 CPU 和 GPU 上运行,满足基准测试的效率要求——每个截断点对 2.5 万种产品的推理时间在 2 分钟以内。
除了原始精度之外,Chronos-2 通过其分组注意力机制原生支持协变量是一个关键差异化特性。与大多数需要变通方案的 TSFM 不同,Chronos-2 原生整合协变量。领先一筹的精度、优雅的协变量处理架构,以及高效的微调机制,使 Chronos-2 成为 Decathlon 生产体系的不二之选。
Decathlon 在 AWS 上生产部署 Chronos-2 的设计追求高效、成本经济和可靠。
下图展示了需求预测流水线的高层架构。PySpark 数据准备流水线负责组装输入时间序列。每 6 个月,一个基于 AutoGluon 构建的微调任务将 Chronos-2 适配到最新数据,并将生成的模型注册到 MLflow 模型注册表。在间隔的几周内,这一步会被跳过。推理流水线获取最新注册的模型并运行每周批量预测,PySpark 展示流水线将预测结果交付给下游消费者。

该架构使用 Amazon EC2 实例进行批量推理,由 Databricks 任务触发。数据流水线通过 Decathlon 现有数据平台上的 Airflow 进行编排。微调过程使用 Low-Rank Adaptation(LoRA),通过 AutoGluon Chronos 集成实现高效适配,无需全量模型重新训练。模型每 6 个月在最新数据上自动微调一次,不同供应区域的模型通过 MLflow 记录和版本化管理,并配有特定的超参数。
Chronos-2 是一款纯编码器 transformer,紧密遵循 T5 编码器设计。它有多个变体,包括基础模型(amazon/chronos-2)——拥有 1.2 亿参数,以及小型模型(autogluon/chronos-2-small)——拥有 2800 万参数。与原始 Chronos 将数值量化为离散 token 不同,Chronos-2 对每个序列应用鲁棒缩放,然后将每个序列分割为不重叠的 patch,通过残差网络映射为实值嵌入。预测由分位数头生成连续分位数结果。关键的架构创新在于交替注意力模式。每个 transformer block 在时间注意力(沿单个序列的时间轴)和分组注意力(在同一 patch 索引上跨组内各序列)之间交替。
下图阐释了此设计。相关时间序列及其协变量被归为一组。信息在同一序列内沿时间维度以及同一组内各序列之间交换,从而实现原生多变量预测与协变量支持。

截至本文撰写时,Chronos-2 模型已在 Hugging Face 上被下载超过 1.2 亿次,并通过 AutoGluon-Cloud 或 Amazon SageMaker JumpStart 向 Amazon SageMaker AI 客户开放。
以下代码改编自 GitHub 上的 Chronos-2 快速入门 notebook,演示如何运行带协变量支持的推理。在生产环境中,Decathlon 使用 AutoGluon Chronos 集成进行微调和推理编排,API 略有不同:
import pandas as pd
from chronos import BaseChronosPipeline, Chronos2Pipeline
# Load the Chronos-2 pipeline
pipeline: Chronos2Pipeline = BaseChronosPipeline.from_pretrained(
"amazon/chronos-2",
device_map="cpu"
)
# Historical data
df = pd.read_csv("sales.csv") # columns: item_id, timestamp, sales, price, store_count
# Data available during the forecast horizon
future_df = pd.read_csv("future.csv") # columns: item_id, timestamp, price, store_count
prediction_length = 52
forecast = pipeline.predict_df(df, future_df, target="sales", prediction_length=prediction_length)
Decathlon 使用 AutoGluon-TimeSeries 来微调和部署 Chronos-2。通过 AutoGluon,您可以简化端到端的机器学习工作流,从数据准备到模型训练和部署。使用其 TimeSeries 模块的高级 API,只需几行代码即可完成数据格式化、协变量管理和 LoRA 微调:
# pip install autogluon.timeseries
from autogluon.timeseries import TimeSeriesDataFrame, TimeSeriesPredictor
tsdf = TimeSeriesDataFrame.from_data_frame(df, id_column="item_id", timestamp_column="timestamp")
future_tsdf = TimeSeriesDataFrame.from_data_frame(future_df, id_column="item_id", timestamp_column="timestamp")
predictor = TimeSeriesPredictor(
prediction_length=52, # forecast horizon
target="sales", # column to forecast
known_covariates_names=["price", "store_count"], # features known in the future
)
predictor.fit(
tsdf,
hyperparameters={
"Chronos2": {
"model_path": "amazon/chronos-2",
"fine_tune": True, # Turn on fine-tuning; if False the model is used in zero-shot mode
}
},
)
predictor.predict(tsdf, known_covariates=future_tsdf)
Decathlon 从三个维度衡量 Chronos-2 部署的影响:预测精度、业务成果和运维效率。
Decathlon 部署的微调版 Chronos-2 在各区域和两个预测周期上均实现了显著的精度提升,与此前使用的旧预测工具相比:
pp = 百分点
在 12 周预测周期上,WAPE 每改善 1 个百分点,意味着:
在补货周期上实现 11–15 个百分点的 WAPE 改善,对库存效率、可获得性和收入的复合效应是相当可观的。
除了精度提升之外,迁移到 Chronos-2 还从多个维度降低了运维负担:
将部署时间从 6 个月缩短至 2–3 个月,对 Decathlon 拓展新市场的能力影响尤为显著。使用 Chronos-2,团队只需在本地历史数据上运行微调,即可将预测能力部署到新区域,无需重新设计架构。
Chronos-2 已投入生产,用于东南亚和拉丁美洲供应区域,上述结果也来自这两个区域。Decathlon 现正将方案扩展到其余供应区域,目标在 2026 年实现全区域生产部署,中东和非洲为下一批拓展目标。
Decathlon 的实践表明,时间序列基础模型,尤其是 Chronos-2,已经准备好用于生产级别的零售需求预测。通过将严格的模型评估流程与高效的 LoRA 微调相结合,Decathlon 在 12 周预测周期上实现了 11–15 个百分点的 WAPE 改善。与此同时,团队将每个区域的部署时间从 6 个月缩短至 2–3 个月。对于正在评估将基础模型用于预测的零售商而言,Decathlon 的经验提供了一个可操作的参考模板。
基于自有数据进行基准测试:全球排行榜有助于筛选候选模型,但模型排名在特定领域数据上可能差异显著。在 Decathlon 的案例中,某些在全球排名较高的模型在零售分布数据集上表现更差。在 2.5 万种产品和 101 个截断点上进行的测试还发现,Chronos-2 配合 AutoGluon 的简洁微调流程是一个决定性优势,将一个强大的零样本模型转变为明确的领先者。
微调释放全部潜力:即使低频微调(每 6 个月一次)配合 Low-Rank Adaptation(LoRA)也比零样本推理有可衡量的精度提升。强大的预训练基础与领域自适应相结合,才是制胜之道。
从小处着手,迭代推进:Decathlon 从单一微调模型的生产部署起步,逐步添加协变量。这种务实的方法降低了风险,同时尽早交付价值。
基础模型让预测民主化:Chronos-2 在单个 m6i.8xlarge CPU 实例上运行,对 7000–15000 条时间序列的推理时间为 40–75 秒,使得在此规模上实现预测无需 GPU 基础设施成为可能。每周推理运行成本约 0.03 美元,计算成本几乎可以忽略不计。
展望未来,Decathlon 计划在生产中部署 Mixture of Experts(MoE)集成方法。基准测试表明,组合多个 TSFM 一致性地超越了单一最佳模型——在其他模型仍在约 40% 的产品上胜出。团队还将拓展至中东和非洲区域,并整合价格、天气等外部数据作为协变量。此外,他们正在探索 Chronos-2 的跨学习能力,用于冷启动产品。
如需探索 Chronos-2 在您自有预测用例中的应用,或了解更多关于 Chronos-2 的信息,请访问 Amazon Science 博客文章、研究论文,或尝试快速入门 notebook。如需使用 AutoGluon 进行微调,请参阅 AutoGluon Chronos 教程。