NVIDIA Nemotron 3.5 Lightning: el modelo veloz para la capa de ejecución de agentes IA

NVIDIA presentó Nemotron 3.5 Lightning, un modelo de propósito específico pensado para la ejecución masiva de agentes IA: usar modelos caros para pensar y Lightning para trabajar. Su arquitectura híbrida prioriza eficiencia sin renunciar a capacidades de razonamiento y contexto largo.

Por Redaccion TD
NVIDIA Nemotron 3.5 Lightning: el modelo veloz para la capa de ejecución de agentes IA

Introducción

NVIDIA Nemotron 3.5 Lightning llega con una propuesta clara: separar el razonamiento complejo del trabajo repetitivo en agentes de IA. La idea es sencilla y práctica para entornos productivos: utilizar un modelo de frontera para planear y uno rápido y eficiente para ejecutar cientos de llamadas a herramientas, validaciones, lecturas de archivos y formateos. Lightning está diseñado precisamente para esa capa de ejecución de alto volumen.

¿Qué es Nemotron 3.5 Lightning?

Nemotron 3.5 Lightning es un modelo de razonamiento e instrucciones de código abierto orientado a la ejecución dentro de sistemas agenticos. Sus características principales publicadas por NVIDIA incluyen:

  • Parámetros totales: ~30B
  • Parámetros activos por token: ~3B
  • Arquitectura: híbrida (Mamba-2 + Mixture-of-Experts + Atención selectiva + Multi-Token Prediction)
  • Ventana de contexto: hasta 1M tokens
  • Entrada/Salida: texto
  • Soporte de razonamiento: sí, configurable
  • Llamado a herramientas: soportado
  • Opciones de cuantización: NVFP4, W4A16
  • Checkpoint en precisión completa: BF16
  • Técnicas de decodificación especulativa: MTP, DSpark, DFlash
  • Temperatura recomendada: 1.0
  • top-p recomendado: 0.95
  • Licencia: OpenMDW 1.1
  • Fecha de lanzamiento: 11 de agosto de 2026

NVIDIA también documenta despliegue en GPU única sobre DGX Spark GB10 o H100, y compatibilidad con arquitecturas Blackwell, Hopper y Ampere según la cuantización. El modelo está pensado principalmente para inglés y lenguajes de programación; además NVIDIA declara soporte para español, francés, alemán, italiano y japonés.

¿Por qué NVIDIA construyó un modelo enfocado en ejecución?

En escenarios reales, un agente puede enfrentarse a dos tipos de trabajo claramente diferenciables: el razonamiento complejo (por ejemplo, diagnosticar un bug o crear una estrategia) y la ejecución repetitiva (ejecutar comandos, validar salidas, formatear resultados, llamadas a APIs). Usar un modelo de frontera para cada paso de ejecución resulta costoso y lento. Lightning busca optimizar costos y latencias delegando las partes de alto volumen a un modelo rápido que mantiene suficiente capacidad representacional para ejecutar correctamente las instrucciones.

Este cambio obliga a repensar la selección de modelos: en vez de buscar un único modelo que haga todo bien, es más útil definir qué modelo manejará cada tipo de trabajo dentro del agente.

Arquitectura: ¿qué hace especial a Lightning?

La arquitectura híbrida de Nemotron 3.5 Lightning combina varios componentes para balancear capacidad y eficiencia:

  1. Mixture-of-Experts (MoE): el modelo tiene ~30B de parámetros totales, pero activa solo cerca de 3B por token. Un router selecciona un subconjunto de expertos (configuración reportada: 128 expertos enrutados más un experto compartido, con seis expertos elegidos por token). Esto conserva parte de la capacidad de un modelo mayor mientras reduce el cómputo efectivo por inferencia.

  2. Capas Mamba-2: en lugar de apoyarse únicamente en atención, Lightning usa Mamba-2—a base de modelado de espacio de estado—para procesar secuencias largas de forma más eficiente. La atención completa no se elimina, sino que se reserva para capas donde la interacción global entre tokens es crítica.

  3. Atención selectiva: la atención se mantiene en capas puntuales cuando hay que comparar información distante en documentos largos, repositorios de código, trayectorias de herramientas multi-paso, historiales de conversación o memoria de agente. La filosofía no es reemplazar la atención, sino emplearla solo donde aporta valor.

  4. Multi-Token Prediction (MTP): Lightning incluye capas MTP que aprenden a predecir múltiples tokens futuros y pasaron por una etapa adicional de preentrenamiento enfocada en este objetivo, lo que mejora rendimiento en tareas de decodificación y throughput.

Estos elementos en conjunto explican el balance entre capacidad (para razonamiento y coherencia) y rendimiento (latencia y costo) que NVIDIA busca con Lightning.

¿Por qué es más rápido?

No existe un único truco: la velocidad proviene de combinar técnicas. MoE reduce cómputo al activar pocos expertos por token; Mamba-2 baja el coste de procesar secuencias largas en comparación con atención completa; la atención selectiva evita pagar el precio de atención global en cada capa; y MTP aumenta la eficiencia de decodificación. Además, las opciones de cuantización (NVFP4, W4A16) permiten desplegar el modelo con menor uso de memoria y mayor throughput en hardware compatible.

NVIDIA habilita también despliegues en GPU única (por ejemplo H100 o DGX Spark GB10) y soporte para distintas generaciones de aceleradores según la configuración de cuantización, lo que facilita integración en infraestructuras variadas.

Dónde encaja en una arquitectura de agentes

Un patrón práctico de producción sería: usar un modelo de frontera (por ejemplo, un modelo grande y preciso) para tareas de diagnóstico, planificación y razonamiento complejo; y delegar la ejecución de las acciones planificadas (llamados a herramientas, validaciones, reformatos) a Nemotron 3.5 Lightning. Así se reduce costo y latencia sin sacrificar la calidad del razonamiento central.

Es fundamental evaluar el punto de corte: qué tipo de pasos del agente pueden ser atendidos por Lightning sin degradar resultados. La respuesta dependerá del dominio (soporte al cliente, automatización de devops, agentes de datos, etc.) y del diseño de las herramientas que el agente utiliza.

Limitaciones y consideraciones prácticas

  • Nemotron 3.5 Lightning no debe verse simplemente como “otro modelo de 30B”: su ventaja proviene de la arquitectura MoE y de la configuración de capas, por lo que su rendimiento real depende del checkpoint y runtime desplegado.
  • Los equipos deben validar la compatibilidad de cuantización y hardware que usen en producción (Blackwell, Hopper, Ampere) y verificar requisitos de memoria y latencia para escenarios concretos.
  • Aunque es de peso abierto, conviene revisar la licencia OpenMDW 1.1 para entender restricciones de uso y distribución.
  • Para aplicaciones multilingües en América Latina, el soporte oficial incluye español, pero la efectividad en dialectos y jergas locales debe probarse con datos reales.

Implicaciones para América Latina

Para empresas y organizaciones latinoamericanas, Nemotron 3.5 Lightning ofrece una vía para optimizar agentes que ejecutan tareas repetitivas y de alto volumen, reduciendo costos de cómputo y mejorando respuestas en tiempo real. Su disponibilidad como peso abierto facilita adaptaciones locales y auditorías. Sin embargo, es clave:

  • Evaluar el comportamiento en español y en los flujos de trabajo locales (documentos, APIs, bases de datos regionales).
  • Considerar políticas de datos y residencia si el modelo se integra con información sensible.
  • Diseñar arquitecturas híbridas que mezclen modelos de frontera para planificación y Lightning para ejecución, maximizando eficiencia.

Conclusión

Nemotron 3.5 Lightning representa un enfoque pragmático: delegar el trabajo repetitivo y de alto volumen a un modelo optimizado por throughput, manteniendo modelos más complejos para razonamiento. Su arquitectura híbrida (MoE + Mamba-2 + atención selectiva + MTP), opciones de cuantización y soporte de hardware lo hacen una opción atractiva para operadores que necesitan escalar agentes IA sin disparar costos. Para equipos en América Latina, la disponibilidad de pesos y el soporte de español facilitan pruebas y adopción, siempre con la recomendación de validar rendimiento en los casos de uso locales antes de producción.

Fuente original: Analytics Vidhya