Cómo Decathlon escaló su forecasting con Chronos-2 en AWS
Decathlon adoptó Chronos-2 para su sistema de forecasting global, mejorando precisión en horizontes de 12 y 52 semanas y reduciendo la necesidad de retrainings semanales. Aquí explicamos la evaluación, la arquitectura en AWS y lecciones prácticas para empresas en LATAM.
Introducción
La previsión de demanda es crítica para la operación eficiente de cualquier minorista, y aún más para empresas de gran escala como Decathlon. Con más de 100,000 colaboradores y 400 millones de usuarios, la compañía necesita predecir ventas semanales de decenas de miles de productos en múltiples zonas geográficas. Para afrontar este reto a escala, Decathlon evaluó modelos de series temporales de nueva generación y eligió Chronos-2 como componente central de su stack de forecasting desplegado sobre AWS.
En este artículo desglosamos por qué Chronos-2 destacó frente a otras alternativas, cómo se diseñó la evaluación a gran escala, la arquitectura de producción que implementaron en AWS y las lecciones prácticas para otras organizaciones, en especial aquellas en América Latina que enfrentan demandas estacionales y complejidades logísticas similares.
El desafío de Decathlon
Decathlon predice la cantidad semanal vendida de cada producto para dos horizontes críticos: un horizonte de reposición de 12 semanas, utilizado por los planificadores de compras, y un horizonte estratégico de 52 semanas para proyecciones de inventario y planificación de capacidad. El sistema corre semanalmente y cubre múltiples zonas: Europa, India, China, Sudeste Asiático, LATAM y próximamente Medio Oriente y África. Cada zona puede abarcar hasta 25,000 productos.
La variedad de productos —desde guantes de esquí hasta tablas de surf— implica señales de demanda muy distintas y patrones estacionales fuertes. Además, el sistema previo requería reentrenamiento semanal y tenía altos costos operativos para escalar a nuevas regiones.
Enfoque previo y sus limitaciones
Entre 2021 y 2024 Decathlon usó un enfoque híbrido: Amazon SageMaker DeepAR para horizonte corto (semanas 1–16) y Holt-Winters para el largo (17–52). DeepAR se reentrenaba semanalmente para captar cambios recientes. En 2024 introdujeron el Temporal Fusion Transformer (TFT) con covariables, lo que mejoró la precisión a largo plazo.
Si bien efectivas, estas soluciones generaban sobrecarga operativa: reentrenamientos frecuentes y esfuerzo de ingeniería para desplegar en nuevas regiones. La meta fue encontrar una alternativa con mejor precisión y menor complejidad operativa.
Evaluación y selección de Chronos-2
Decathlon planteó una benchmark rigurosa usando sus propios datos para comprobar si los modelos foundation para series temporales funcionaban en su dominio retail.
-
Diseño del benchmark:
- 101 cortes rolling que cubren casi dos años (semana 48 de 2022 a semana 44 de 2024).
- Escala: ~25,000 productos únicos por corte; 39,000 series de producto únicas en el periodo completo.
- Horizontes: 12 semanas y 52 semanas con frecuencia semanal.
- Métrica principal: WAPE (Weighted Absolute Percentage Error), acompañada de RMSE, bias y tasas de victoria por pares.
-
Resultados clave:
- Chronos-2, afinado (fine-tuned), superó consistentemente a los demás modelos evaluados en ambos horizontes.
- En modo zero-shot, Chronos-2 igualó o superó la línea base de producción que se reentrenaba semanalmente.
- El fine-tuning, incluso con una cadencia baja (cada 6 meses), redujo el error de pronóstico varios puntos porcentuales.
- Chronos-2 cumplió el requisito de eficiencia del benchmark: inferencia por debajo de 2 minutos por corte para 25,000 productos.
Un aspecto diferencial fue la capacidad nativa de Chronos-2 para manejar covariables mediante su mecanismo de group attention, evitando los workarounds que otros TSFM suelen requerir.
Arquitectura de producción en AWS
La implementación de Decathlon combina eficiencia, coste y fiabilidad. Los componentes principales son:
- Preparación de datos con PySpark: arma las series temporales de entrada y las covariables necesarias.
- Fine-tuning semestral: cada 6 meses se lanza un job de fine-tuning basado en AutoGluon que adapta Chronos-2 a los datos más recientes. El modelo resultante se registra en un MLflow model registry. En las semanas intermedias esta etapa se omite.
- Inference semanal por lotes: el pipeline de inferencia obtiene el último modelo registrado y ejecuta los pronósticos semanalmente.
- Exposición de resultados con PySpark: una pipeline adicional entrega los pronósticos a los consumidores downstream.
Infraestructura:
- Compute: Amazon EC2 m6i.8xlarge para inferencia basada en CPU y g5.4xlarge para cargas GPU cuando corresponde.
Este patrón híbrido de fine-tuning periódico e inferencia frecuente logra un equilibrio entre precisión y costos operativos al evitar reentrenamientos constantes.
Impacto en la cadena de suministro
Adoptar Chronos-2 permitió a Decathlon mejorar la precisión en horizontes cortos y largos, reducir la complejidad operativa y escalar más fácilmente a nuevas zonas. La posibilidad de operar en modo zero-shot con buen desempeño y de obtener mejoras adicionales con fine-tuning espaciado reduce la presión sobre pipelines de entrenamiento y facilita despliegues regionales.
Para Latinoamérica, donde las variaciones estacionales, festividades locales y la heterogeneidad logística influyen fuertemente en la demanda, un enfoque que combine modelos foundation robustos y fine-tuning periódico puede simplificar la expansión y la localización de predicciones sin incurrir en reentrenamientos costosos por campaña o por región.
Lecciones prácticas para adoptar TSFMs en forecasting
- Validar con datos propios a escala: los modelos foundation pueden comportarse muy distinto según el dominio; una benchmark interna es esencial.
- Evaluar zero-shot y fine-tuning: medir ambos modos ayuda a equilibrar precisión y costos operativos.
- Aprovechar soporte nativo de covariables: modelos que integran covariables de forma elegante reducen ingeniería adicional y mejoran resultados.
- Patrones de despliegue híbridos: fine-tuning periódico más inferencia frecuente suele ser suficiente y más eficiente que reentrenamientos semanales.
- Automatizar registro y despliegue: usar herramientas como MLflow y pipelines reproducibles con PySpark facilita operaciones y gobernanza del modelo.
Conclusión
La experiencia de Decathlon demuestra que los time series foundation models, cuando se evalúan y adaptan correctamente, pueden ofrecer ganancias substanciales en precisión y reducir la complejidad operativa de la previsión de demanda a escala. Chronos-2 destacó por su precisión en modos zero-shot y fine-tuned, su soporte nativo de covariables y su eficiencia computacional, lo que permitió a Decathlon mantener un ciclo de inferencia semanal y un fine-tuning semestral manejable.
Para minoristas y tomadores de decisión en América Latina, esta trayectoria ofrece un caso práctico: combinar modelos foundation probados con pipelines de datos y gobernanza robustos puede acelerar la mejora en la disponibilidad de stock y la eficiencia operativa sin inflar costos de ingeniería ni de infraestructura.
Fuente original: AWS ML Blog