Machine Learning 5 min lectura

PatchTST-FM-r2: el nuevo modelo de Granite para forecasting zero-shot con licencia comercial

IBM presentó Granite Time Series PatchTST-FM-r2, un modelo foundation para series temporales diseñado para forecasting zero-shot con soporte probabilístico e imputación. Con cerca de 385M de parámetros y licencia comercial-friendly, destaca en el benchmark GIFT-Eval.

Por Redaccion TD
PatchTST-FM-r2: el nuevo modelo de Granite para forecasting zero-shot con licencia comercial

Introducción

Los modelos foundation para series temporales están cambiando cómo se construyen los sistemas de forecasting: en vez de entrenar un modelo por cada dataset, se puede utilizar un modelo preentrenado y generar predicciones zero-shot para nuevos series. IBM lanzó Granite Time Series PatchTST-FM-r2, la evolución de la familia Granite TSFM, que propone mejoras arquitectónicas, un corpus de preentrenamiento mayor y soporte para pronósticos probabilísticos e imputación de valores faltantes.

PatchTST-FM-r2 es un modelo de aproximadamente 385 millones de parámetros, con capacidad de contexto de hasta 8.192 pasos temporales y una cabeza de salida que puede producir hasta 99 cuantiles para estimaciones probabilísticas. El código, pesos y la canalización de inferencia están disponibles públicamente, y el modelo está dual-licenciado bajo Apache-2.0 y OpenMDW-1.0, opciones permisivas aptas para uso comercial.

Rendimiento zero-shot en GIFT-Eval

GIFT-Eval es un benchmark amplio para forecasting que evalúa modelos en escenarios heterogéneos y datasets diversos. En la categoría de modelos replicables, zero-shot y evaluados sin fuga de test, PatchTST-FM-r2 alcanzó la segunda posición global en la tabla de GIFT-Eval al 8 de septiembre de 2026. En particular, obtuvo un CRPS geométrico medio de 0.467 y un MASE geométrico medio de 0.6846.

Es importante subrayar que, dentro de los modelos que además ofrecen licencias permisivas y amigables para uso comercial, PatchTST-FM-r2 es el mejor calificado en su categoría. Cuando se amplía la comparación para incluir modelos marcados como “pretrained” (es decir, que pudieron usar las porciones de entrenamiento de los datasets de evaluación en su preentrenamiento), PatchTST-FM-r2 se mantiene competitivo: se posiciona tercero en CRPS y cuarto en MASE entre los modelos replicables.

Estos resultados señalan que el modelo generaliza bien a series temporales no vistas, un atributo clave para aplicaciones prácticas en entornos comerciales y de producción.

¿Qué cambió respecto a PatchTST-FM-r1?

PatchTST-FM-r2 conserva la representación basada en parches (patch-based) que hizo efectiva a la familia PatchTST, pero introduce cambios internos importantes para capturar relaciones de corto y largo plazo y para suavizar las predicciones entre parches.

La modificación principal es el reemplazo de las capas estándar de transformer por bloques conformer. Los conformer combinan multi-head self-attention con convoluciones temporales, una idea originada en procesamiento de voz. En r2, cada bloque incorpora dos medias etapas de feed-forward que rodean la atención multi-cabeza y una capa de convolución temporal. De esta forma, el modelo obtiene dos mecanismos complementarios: la atención modela relaciones de largo alcance entre parches, mientras la convolución aporta un sesgo inductivo hacia estructura local y captura interacciones de corto plazo.

Este diseño ayuda a que la atención se enfoque mejor en dependencias temporales largas sin perder la capacidad de modelar patrones locales, lo que se traduce en mejoras medibles en los errores de forecasting.

Características técnicas clave

  • Tamaño: ~385 millones de parámetros.
  • Longitud de contexto: hasta 8.192 pasos temporales, lo que facilita modelar dependencias de largo horizonte.
  • Predicciones probabilísticas: salida de hasta 99 cuantiles (99-quantile head), útil para estimar incertidumbre y riesgos.
  • Imputación: soporte nativo para tratar valores faltantes en series temporales.
  • Arquitectura: bloques conformer que combinan atención y convolución temporal.
  • Disponibilidad: pesos, arquitectura y pipeline de inferencia abiertos; código para reproducir los resultados del benchmark.

Licencia y acceso

IBM distribuye PatchTST-FM-r2 bajo una doble licencia permisiva: Apache-2.0 y OpenMDW-1.0. Los usuarios pueden elegir la que mejor se ajuste a sus necesidades legales y comerciales. Además, el modelo está disponible en Hugging Face, incluyendo los artefactos necesarios para ejecutar inferencia y replicar benchmarks.

Esta consideración de licencia es relevante para equipos y empresas en Latinoamérica que buscan integrar modelos avanzados en productos comerciales sin restricciones de uso estrictas.

Aplicaciones y despliegue en Latinoamérica

Las características del modelo lo hacen aplicable a una amplia gama de problemas relevantes para la región:

  • Demanda y precios: forecasting de demanda en retail, estimación de precios y dinámicas de mercado para optimizar inventarios y estrategias comerciales.
  • Energía: pronóstico de cargas en redes eléctricas y gestión de generación renovable, útil para mercados con alta penetración de energía solar y eólica.
  • Transporte y tráfico: predicción de flujos vehiculares y pasajeros para planificación urbana y logística.
  • Telemetría y operaciones industriales: monitoreo predictivo de maquinaria, detección de anomalías y mantenimiento preventivo.
  • Agricultura y clima: estimaciones temporales de variables meteorológicas o de rendimiento que pueden ayudar a la toma de decisiones agrícolas.

Para entornos de producción que requieren inferencia en streaming, IBM y la documentación relacionada muestran cómo integrar modelos de la familia Granite con plataformas de streaming como Confluent. Esto permite alimentar pipelines en tiempo real, aplicar imputación y generar pronósticos probabilísticos con latencias compatibles con operaciones críticas.

Consideraciones prácticas

Aunque PatchTST-FM-r2 ofrece strong zero-shot performance, los equipos deben evaluar el trade-off entre usar el modelo tal cual (zero-shot) o adaptar y afinar pesos para datasets específicos. En muchos casos, el fine-tuning con datos locales y la calibración de cuantiles puede mejorar resultados para nichos particulares.

La disponibilidad de pesos y código facilita auditoría, reproducibilidad e integración, aspectos importantes para equipos de datos en empresas y entes públicos latinoamericanos que buscan transparencia y control sobre modelos de forecasting.

Conclusión

PatchTST-FM-r2 es un avance notable dentro de los modelos foundation para series temporales: combina una arquitectura renovada (conformers), capacidades probabilísticas y de imputación, y un rendimiento competitivo en el benchmark GIFT-Eval. Su licencia permisiva y la apertura de pesos y código lo convierten en una opción atractiva para organizaciones en Latinoamérica que requieren forecasting robusto y desplegable en contexto comercial.

Si su organización trabaja con demanda, energía, logística o telemetría, PatchTST-FM-r2 merece una evaluación práctica como punto de partida para soluciones de forecasting de próxima generación. El modelo está disponible en Hugging Face para pruebas e integración.

Fuente original: Hugging Face Blog