Nemotron 3.5 Lightning en SageMaker JumpStart: modelo rápido para agentes siempre activos

NVIDIA Nemotron 3.5 Lightning llega a Amazon SageMaker JumpStart como un modelo abierto optimizado para pasos especializados y de alto volumen en flujos de agentes. Permite desplegar sin configurar la infraestructura de serving y promete hasta 4x de throughput y 30% menos en tiempo de tareas en cargas agenticas.

Por Redaccion TD
Nemotron 3.5 Lightning en SageMaker JumpStart: modelo rápido para agentes siempre activos

Qué es Nemotron 3.5 Lightning

NVIDIA Nemotron 3.5 Lightning es una versión distilada del modelo de frontera Nemotron 3 Ultra, diseñada específicamente para ejecutar pasos especializados y de alto volumen en flujos de agentes siempre activos. Está disponible como modelo abierto y, con su integración en Amazon SageMaker JumpStart, las organizaciones pueden desplegarlo sin tener que configurar manualmente la infraestructura de serving.

Lightning utiliza una arquitectura híbrida Mixture-of-Experts (MoE) y está entrenado para uso de herramientas por agentes dentro de harnesses populares. Al ser un modelo abierto, las empresas pueden personalizarlo y desplegar las versiones resultantes en sus propios entornos.

Características clave

  • Arquitectura: Hybrid Mixture-of-Experts (MoE).
  • Parámetros: 30B totales con 3B activos por pase hacia adelante, lo que permite operar con alta eficiencia en GPU única soportada.
  • Longitud de contexto: hasta 1 millón de tokens, útil para asistentes de larga duración que acumulan estado.
  • Entrada/salida: texto a texto.
  • Decodificación especulativa: DFlash para reducir latencia por token.
  • Rendimiento: hasta 4x mayor throughput y hasta 30% más rápido en completar tareas en cargas agenticas de alto volumen.

Estas especificaciones están orientadas a la parte de los flujos de agentes que requieren muchas llamadas rápidas y repetitivas, donde no siempre hace falta recurrir a un modelo de frontera en cada paso.

Por qué importar a la estrategia de agentes (system-of-models)

Los agentes siempre activos ejecutan múltiples pasos: observan, actualizan contexto, razonan y ejecutan acciones. No todos esos pasos requieren la misma capacidad de razonamiento. Mientras la planificación compleja o la orquestación de sub-agentes puede necesitar un modelo de frontera, muchas tareas repetitivas como clasificación de alertas, extracción de campos o validación de políticas pueden resolverse con modelos más pequeños y especializados.

Un enfoque eficiente es un sistema de modelos donde cada paso se enruta al modelo adecuado. Nemotron 3.5 Lightning está pensado para el extremo de alto volumen de ese sistema: su arquitectura MoE activa solo 3B de los 30B parámetros por pase, favoreciendo throughput y latencias bajas sin necesidad de infraestructura de frontera a escala.

Además, la ventana de contexto de hasta 1M tokens permite mantener el estado acumulado de sesiones largas sin re-grounding frecuente, lo que es especialmente útil para asistentes personales o agentes que manejan hilos de trabajo extendidos.

Si su pila incluye NVIDIA NeMo Switchyard, pueden usarlo para enrutar pasos individuales a través del pool de modelos elegido y seleccionar Lightning cuando sus requisitos de velocidad y exactitud de dominio lo justifiquen.

Precisión y variantes numéricas

NVIDIA publicó comparaciones entre las variantes BF16 y NVFP4 de Nemotron 3.5 Lightning en varios benchmarks de razonamiento y tareas agenticas. Los resultados medidos por NVIDIA bajo un mismo harness muestran que NVFP4 se mantiene cercano a BF16 en muchas tareas. Algunos resultados destacados son:

  • MMLU Pro: BF16 81.94 | NVFP4 81.62
  • GPQA Diamond: BF16 75.44 | NVFP4 75.57
  • SWE-bench Verified: BF16 51.56 | NVFP4 52.80
  • PinchBench: BF16 85.37 | NVFP4 83.43
  • IFBench: BF16 71.88 | NVFP4 72.88
  • AA-LCR: BF16 52.00 | NVFP4 49.19

NVIDIA también indica que las recetas de evaluación y los comandos utilizados están publicados en NeMo Gym, y que estas mediciones se realizaron con un harness consistente.

Casos de uso empresarial relevantes

Nemotron 3.5 Lightning se orienta a los pasos especializados de alto volumen dentro de flujos de agentes. Algunos casos de uso empresariales señalados por NVIDIA que son relevantes para organizaciones en América Latina incluyen:

  • Agentes personales: asistentes de larga duración que gestionan correo, calendarios, proyectos y reservas, con opción de ejecución local para datos contextuales.
  • Servicios financieros: extracción de datos de documentos, verificación de políticas, monitoreo de señales de riesgo y preparación de resúmenes estructurados.
  • Operaciones de ciberseguridad: enriquecimiento y clasificación de alertas, consulta de logs, validación de controles y correlación de indicadores.
  • Telecomunicaciones: triage de alarmas de red, optimización de configuraciones y atención a consultas de facturación.
  • Retail: enriquecimiento de catálogos, resolución de excepciones de inventario y apoyo en descubrimiento de productos y gestión de pedidos.

Para Latinoamérica, estos escenarios están directamente vinculados a retos comunes: centros de contacto con alto volumen de interacciones, necesidad de automatizar clasificación y extracción en múltiples idiomas y esquemas documentales, y operaciones de red y seguridad que requieren respuestas rápidas. Implementar un modelo como Lightning en pasos de alto volumen puede reducir costos y latencias, reservando modelos más potentes para la toma de decisiones complejas.

Personalización y despliegue

Las organizaciones pueden post-entrenar (post-train) el modelo con NVIDIA NeMo para adaptar herramientas, flujos y políticas de dominio específico, y luego desplegar el modelo resultante donde sus agentes operen. La versión en SageMaker JumpStart publicada por AWS permite desplegar Nemotron 3.5 Lightning sin gestionar manualmente la infraestructura de serving; sin embargo, la tarjeta de modelo en JumpStart no expone opciones de personalización desde la interfaz de JumpStart.

Requisitos para desplegar en SageMaker JumpStart

Antes de comenzar, asegúrense de contar con:

  • Cuenta de AWS y permisos adecuados para SageMaker JumpStart.
  • Cuota de servicio suficiente para instancias GPU compatibles (por ejemplo: ml.g6e.12xlarge, ml.p4d.24xlarge o ml.p5.48xlarge).

Importante: desplegar este modelo crea un endpoint de Amazon SageMaker AI que genera cargos mientras esté activo. Eliminar el endpoint al finalizar evita costos continuos.

Cómo desplegar desde SageMaker Studio (resumen)

  • Abrir Amazon SageMaker Studio y en la barra lateral seleccionar SageMaker JumpStart.
  • Buscar “Nemotron 3.5 Lightning” y seleccionar la tarjeta del modelo.
  • La variante NVFP4 del modelo aparece con un identificador que comienza por huggingface-reasoning-nemotron-3-5- (según la tarjeta en JumpStart).

La integración en JumpStart simplifica el paso operativo de convertir un modelo abierto en un endpoint utilizable por sus agentes.

Recomendaciones para adopción

  • Evaluar el patrón system-of-models: identifiquen qué pasos en sus flujos agenticos son de alto volumen y pueden beneficiarse de Lightning, y cuáles requieren modelos de mayor capacidad.
  • Planificar pruebas de rendimiento con cargas reales de producción para validar throughput y latencias en su infraestructura específica.
  • Considerar la personalización de dominio con NeMo si necesitan ajustar herramientas, formatos de documentos o políticas locales.
  • Controlar costos operativos: los endpoints GPU generan cargos mientras funcionen; automatizar escalado y apagado puede reducir gastos.

Conclusión

Nemotron 3.5 Lightning apunta a un espacio operativo concreto: acelerar pasos especializados y de alto volumen dentro de agentes siempre activos, sin recurrir a la escala ni al costo de modelos de frontera en cada llamada. La disponibilidad en Amazon SageMaker JumpStart facilita el despliegue y la integración en flujos existentes, lo que puede ser particularmente valioso para empresas de Latinoamérica que buscan optimizar operaciones en atención al cliente, finanzas, seguridad, telecom y retail. Aprovechar un sistema de modelos y diseñar una estrategia de enrutamiento adecuada permitirá combinar precisión y eficiencia en la ejecución de agentes.

Fuente original: AWS ML Blog