Cómo Decathlon escaló su forecasting con Chronos-2 en AWS

Decathlon adoptó Chronos-2 para su sistema de forecasting global, mejorando precisión en horizontes de 12 y 52 semanas y reduciendo la necesidad de retrainings semanales. Aquí explicamos la evaluación, la arquitectura en AWS y lecciones prácticas para empresas en LATAM.

Por Redaccion TD
Cómo Decathlon escaló su forecasting con Chronos-2 en AWS

Introducción

La previsión de demanda es crítica para la operación eficiente de cualquier minorista, y aún más para empresas de gran escala como Decathlon. Con más de 100,000 colaboradores y 400 millones de usuarios, la compañía necesita predecir ventas semanales de decenas de miles de productos en múltiples zonas geográficas. Para afrontar este reto a escala, Decathlon evaluó modelos de series temporales de nueva generación y eligió Chronos-2 como componente central de su stack de forecasting desplegado sobre AWS.

En este artículo desglosamos por qué Chronos-2 destacó frente a otras alternativas, cómo se diseñó la evaluación a gran escala, la arquitectura de producción que implementaron en AWS y las lecciones prácticas para otras organizaciones, en especial aquellas en América Latina que enfrentan demandas estacionales y complejidades logísticas similares.

El desafío de Decathlon

Decathlon predice la cantidad semanal vendida de cada producto para dos horizontes críticos: un horizonte de reposición de 12 semanas, utilizado por los planificadores de compras, y un horizonte estratégico de 52 semanas para proyecciones de inventario y planificación de capacidad. El sistema corre semanalmente y cubre múltiples zonas: Europa, India, China, Sudeste Asiático, LATAM y próximamente Medio Oriente y África. Cada zona puede abarcar hasta 25,000 productos.

La variedad de productos —desde guantes de esquí hasta tablas de surf— implica señales de demanda muy distintas y patrones estacionales fuertes. Además, el sistema previo requería reentrenamiento semanal y tenía altos costos operativos para escalar a nuevas regiones.

Enfoque previo y sus limitaciones

Entre 2021 y 2024 Decathlon usó un enfoque híbrido: Amazon SageMaker DeepAR para horizonte corto (semanas 1–16) y Holt-Winters para el largo (17–52). DeepAR se reentrenaba semanalmente para captar cambios recientes. En 2024 introdujeron el Temporal Fusion Transformer (TFT) con covariables, lo que mejoró la precisión a largo plazo.

Si bien efectivas, estas soluciones generaban sobrecarga operativa: reentrenamientos frecuentes y esfuerzo de ingeniería para desplegar en nuevas regiones. La meta fue encontrar una alternativa con mejor precisión y menor complejidad operativa.

Evaluación y selección de Chronos-2

Decathlon planteó una benchmark rigurosa usando sus propios datos para comprobar si los modelos foundation para series temporales funcionaban en su dominio retail.

  • Diseño del benchmark:

    • 101 cortes rolling que cubren casi dos años (semana 48 de 2022 a semana 44 de 2024).
    • Escala: ~25,000 productos únicos por corte; 39,000 series de producto únicas en el periodo completo.
    • Horizontes: 12 semanas y 52 semanas con frecuencia semanal.
    • Métrica principal: WAPE (Weighted Absolute Percentage Error), acompañada de RMSE, bias y tasas de victoria por pares.
  • Resultados clave:

    • Chronos-2, afinado (fine-tuned), superó consistentemente a los demás modelos evaluados en ambos horizontes.
    • En modo zero-shot, Chronos-2 igualó o superó la línea base de producción que se reentrenaba semanalmente.
    • El fine-tuning, incluso con una cadencia baja (cada 6 meses), redujo el error de pronóstico varios puntos porcentuales.
    • Chronos-2 cumplió el requisito de eficiencia del benchmark: inferencia por debajo de 2 minutos por corte para 25,000 productos.

Un aspecto diferencial fue la capacidad nativa de Chronos-2 para manejar covariables mediante su mecanismo de group attention, evitando los workarounds que otros TSFM suelen requerir.

Arquitectura de producción en AWS

La implementación de Decathlon combina eficiencia, coste y fiabilidad. Los componentes principales son:

  • Preparación de datos con PySpark: arma las series temporales de entrada y las covariables necesarias.
  • Fine-tuning semestral: cada 6 meses se lanza un job de fine-tuning basado en AutoGluon que adapta Chronos-2 a los datos más recientes. El modelo resultante se registra en un MLflow model registry. En las semanas intermedias esta etapa se omite.
  • Inference semanal por lotes: el pipeline de inferencia obtiene el último modelo registrado y ejecuta los pronósticos semanalmente.
  • Exposición de resultados con PySpark: una pipeline adicional entrega los pronósticos a los consumidores downstream.

Infraestructura:

  • Compute: Amazon EC2 m6i.8xlarge para inferencia basada en CPU y g5.4xlarge para cargas GPU cuando corresponde.

Este patrón híbrido de fine-tuning periódico e inferencia frecuente logra un equilibrio entre precisión y costos operativos al evitar reentrenamientos constantes.

Impacto en la cadena de suministro

Adoptar Chronos-2 permitió a Decathlon mejorar la precisión en horizontes cortos y largos, reducir la complejidad operativa y escalar más fácilmente a nuevas zonas. La posibilidad de operar en modo zero-shot con buen desempeño y de obtener mejoras adicionales con fine-tuning espaciado reduce la presión sobre pipelines de entrenamiento y facilita despliegues regionales.

Para Latinoamérica, donde las variaciones estacionales, festividades locales y la heterogeneidad logística influyen fuertemente en la demanda, un enfoque que combine modelos foundation robustos y fine-tuning periódico puede simplificar la expansión y la localización de predicciones sin incurrir en reentrenamientos costosos por campaña o por región.

Lecciones prácticas para adoptar TSFMs en forecasting

  1. Validar con datos propios a escala: los modelos foundation pueden comportarse muy distinto según el dominio; una benchmark interna es esencial.
  2. Evaluar zero-shot y fine-tuning: medir ambos modos ayuda a equilibrar precisión y costos operativos.
  3. Aprovechar soporte nativo de covariables: modelos que integran covariables de forma elegante reducen ingeniería adicional y mejoran resultados.
  4. Patrones de despliegue híbridos: fine-tuning periódico más inferencia frecuente suele ser suficiente y más eficiente que reentrenamientos semanales.
  5. Automatizar registro y despliegue: usar herramientas como MLflow y pipelines reproducibles con PySpark facilita operaciones y gobernanza del modelo.

Conclusión

La experiencia de Decathlon demuestra que los time series foundation models, cuando se evalúan y adaptan correctamente, pueden ofrecer ganancias substanciales en precisión y reducir la complejidad operativa de la previsión de demanda a escala. Chronos-2 destacó por su precisión en modos zero-shot y fine-tuned, su soporte nativo de covariables y su eficiencia computacional, lo que permitió a Decathlon mantener un ciclo de inferencia semanal y un fine-tuning semestral manejable.

Para minoristas y tomadores de decisión en América Latina, esta trayectoria ofrece un caso práctico: combinar modelos foundation probados con pipelines de datos y gobernanza robustos puede acelerar la mejora en la disponibilidad de stock y la eficiencia operativa sin inflar costos de ingeniería ni de infraestructura.

Fuente original: AWS ML Blog