Granite 4.2: cómo se construyeron estos LLMs de razonamiento

Granite 4.2 es la familia de modelos de razonamiento densa y decoder-only de Hugging Face, disponible en 3B, 8B y 30B parámetros. Su entrenamiento combina pre-entrenamiento desde cero, fine-tuning supervisado con cadenas de pensamiento y una etapa final de aprendizaje por refuerzo con capacidad agentica.

Por Redaccion TD
Granite 4.2: cómo se construyeron estos LLMs de razonamiento

Qué es Granite 4.2

Granite 4.2 es la entrega centrada en razonamiento de la familia Granite de Hugging Face e IBM. A diferencia de ediciones previas más enfocadas en seguir instrucciones, esta versión añade explícitamente capacidad para generar cadenas de pensamiento (chain-of-thought) y operar como agente: puede invocar herramientas, editar y ejecutar código, interactuar con terminales y buscar en la web dentro de entornos aislados. Está disponible en tres tamaños —3B, 8B y 30B parámetros— y se publica bajo licencia Apache 2.0.

Diseño y arquitectura

Todos los modelos Granite 4.2 comparten una arquitectura decoder-only densa basada en transformadores. Sus componentes clave son:

  • Atención: Grouped Query Attention (GQA) con 40 cabezas de atención y 8 cabezas KV.
  • Posicional: Rotary Position Embedding (RoPE) con θ = 10,000,000.
  • Feed-forward: MLP con activación SwiGLU.
  • Normalización: RMSNorm (ε = 1e-5).
  • Embeddings: embeddings de entrada y salida separados (no tied).
  • Precisión: bfloat16.

Configuración por tamaño:

  • 3B: embedding size 2560, 40 capas, 40 attention heads (head size 64), MLP hidden 8192, secuencia hasta 131072 tokens.
  • 8B: embedding size 4096, 40 capas, 32 attention heads (head size 128), MLP hidden 12800, secuencia 131072.
  • 30B: embedding size 4096, 64 capas, 32 attention heads (head size 128), MLP hidden 32768, secuencia 131072.

Estas cifras muestran que la misma topología básica escala en profundidad y capacidad entre los tamaños, manteniendo componentes homogéneos que facilitan despliegues y optimizaciones compartidas.

Pre-entrenamiento: cinco fases y contexto largo

Granite 4.2 se pre-entrena desde cero en aproximadamente 15 billones (15T) de tokens mediante una estrategia en cinco fases:

  1. Fases 1–2: pre-entrenamiento fundacional con mezclas amplias de datos web-scale para aprender representaciones generales.
  2. Fases 3–4: entrenamiento intermedio con un annealing hacia fuentes de mayor calidad.
  3. Fase 5: entrenamiento de contexto largo que extiende la ventana de contexto hasta 512K tokens.

Cada fase emplea mezclas y calendarios de tasa de aprendizaje distintos, desplazando progresivamente el foco desde datos masivos hacia corpus más curados. El enfoque de extender el contexto es clave para tareas que requieren mantener información extensa o trabajar con documentos largos.

Fine-tuning supervisado (SFT): datos y control de calidad

El SFT convierte al modelo base en un asistente confiable para instrucciones, razonamiento y uso de herramientas. La mezcla de datos de SFT suma cerca de 7.2 millones de muestras, equivalentes a ~100B de tokens, de los cuales ~65B son efectivamente entrenables. El conjunto se compone de:

  • Datos agenticos: 31.6% del total, con dominios dominados por ingeniería de software (69%), llamadas a herramientas (12.1%), uso de terminal (8.0%), matemáticas (3.5%), búsqueda (0.8%) y acciones (0.2%).
  • Datos no-agenticos: 68.4%, incluyendo seguimiento de instrucciones (18.8%), código (18.8%), matemáticas (14.6%), multilingüe (7.0%), ciencia (5.4%), razonamiento (3.0%) y seguridad (0.8%).

Las trayectorias agenticas provienen de múltiples scaffolds y harnesses (por ejemplo, OpenHands, OpenCode, Terminus-2, SWE-agent, OpenResearcher, entre otros), combinando datasets abiertos y entornos sintéticos de RL.

Control de calidad de datos

Antes de entrar al entrenamiento, las muestras pasan por varias etapas de limpieza:

  • Normalización al formato de chat compatible con OpenAI para uniformar estructura conversacional y llamadas a herramientas.
  • Evaluación automática por modelos juez (GPT-OSS-120B y Gemma 4). Se descartan muestras de baja puntuación, respuestas fabricadas, interacciones inválidas con herramientas o llamadas a funciones no definidas.
  • Aplicación de reglas heurísticas específicas para datasets con ruido conocido.
  • Deduplicación local y global basada en hashes SHA-256 sobre la combinación de campos tools y messages, eliminando duplicados dentro y entre fuentes.

Este proceso busca garantizar que el SFT enseñe razonamiento y uso de herramientas a partir de ejemplos coherentes y verificables.

Post-entrenamiento: pipeline multi-etapa de RL y capacidades agenticas

Tras el SFT, Granite 4.2 se somete a un pipeline de aprendizaje por refuerzo en varias etapas. Una parte destacada es el RL agentico: los modelos de 8B y 30B aprenden a actuar en entornos reales pero sandboxeados, practicando llamadas a herramientas, edición y ejecución de código, navegación y control de terminal. Esto les permite desarrollar políticas para tomar acciones efectivas en cadenas de interacción complejas.

Además, todos los modelos tienen integradas capacidades nativas de llamadas a herramientas y exportan esas llamadas en el formato de function-calling compatible con OpenAI, facilitando su integración con marcos agenticos existentes (por ejemplo, usando vLLM o SGLang).

Modos de razonamiento: thinking, non-thinking y low-effort

Granite 4.2 introduce mecanismos para ajustar la profundidad del razonamiento según la tarea:

  • Modo thinking: genera cadenas de pensamiento para razonamiento detallado.
  • Modo non-thinking: responde directamente sin producir un chain-of-thought.
  • Low-effort thinking: un punto medio que consume un presupuesto breve de razonamiento para preguntas sencillas.

Estos modos permiten optimizar latencia y costo en producción, ofreciendo deliberación cuando es necesaria y respuestas rápidas cuando la tarea lo permite.

Relevancia y consideraciones para América Latina

Para equipos y tomadores de decisiones en Latinoamérica, Granite 4.2 ofrece varias ventajas prácticas:

  • Flexibilidad de despliegue: al ser un modelo de licencia Apache 2.0 y compatible con endpoints OpenAI-style, facilita su integración on-premises o en nubes regionals, lo que puede ayudar a cumplir requisitos de soberanía de datos.
  • Soporte para herramientas y contextos largos: útil para empresas que manejan documentación extensa (contratos, expedientes legales, historiales clínicos) o flujos de trabajo de ingeniería que requieren ejecución de comandos y control de procesos.
  • Post-entrenamiento agentico: la capacidad de interactuar con entornos sandbox puede acelerar automatizaciones locales, desde pipelines de desarrollo hasta asistentes que operen con sistemas internos.

Sin embargo, la adopción en la región debe considerar gobernanza de datos, evaluación de sesgos y pruebas de seguridad operacional antes de desplegar agentes con acceso a sistemas críticos.

Conclusión

Granite 4.2 representa un paso claro hacia LLMs diseñados explícitamente para razonamiento y actuación agentica. Su pipeline —pre-entrenamiento desde cero en 15T de tokens, SFT con una mezcla agentica y no-agentica controlada, y etapas finales de RL— busca equilibrar capacidades de pensamiento, interacción con herramientas y robustez en producción. Para organizaciones en América Latina, ofrece opciones técnicas y legales (Apache 2.0) que facilitan pruebas y despliegues controlados, siempre acompañados de las prácticas de gobernanza y seguridad necesarias.

Fuente original: Hugging Face Blog