LFM2.5-2.6B: agentes on-device potentes para ejecutar sin la nube

LFM2.5-2.6B es un modelo compacto diseñado para correr agentes directamente en el dispositivo, manteniendo datos privados y reduciendo costos de inferencia en la nube. Ofrece rendimiento competitivo frente a modelos mucho más grandes en tareas de uso de herramientas e instrucciones.

Por Redaccion TD
LFM2.5-2.6B: agentes on-device potentes para ejecutar sin la nube

¿Qué es LFM2.5-2.6B y por qué importa?

LFM2.5-2.6B es un modelo creado específicamente para ejecutar agentes completamente en el dispositivo (on-device). Su objetivo es ofrecer capacidades avanzadas —como llamadas a herramientas y flujos de trabajo multi-paso— manteniéndose lo suficientemente pequeño y rápido para hardware cotidiano: desde laptops hasta teléfonos. Para organizaciones y equipos en América Latina esto tiene dos ventajas claras: mayor privacidad de datos al procesar la información localmente y ahorro en la factura de inferencia en la nube cuando se escala el uso.

Según sus desarrolladores, el modelo compite con otros que tienen hasta cuatro veces más parámetros en tareas relacionadas con uso de herramientas, seguimiento de instrucciones y tareas agenticas multietapa.

Cómo se entrenó un agente confiable para edge

La construcción de LFM2.5-2.6B siguió una ruta en cuatro etapas para convertir un modelo base en un modelo agentico:

  • Preentrenamiento y contexto extendido: el modelo base fue preentrenado con aproximadamente 34 trillones de tokens y durante una fase intermedia se amplió la ventana de contexto hasta 128K, lo que facilita manejar conversaciones y documentos largos.

  • Supervised Fine-Tuning (SFT): se realizaron dos rondas de SFT, con un fuerte peso en datos agenticos como uso de herramientas, búsquedas web y trayectorias generadas por harnesses (entornos de agentes).

  • Especialización por dominio (Teacher specialization): se entrenaron ‘teachers’ especialistas en dominios concretos (por ejemplo, matemáticas, código o uso de herramientas).

  • Distilación on-policy multi-dominio (MOPD) y Agentic Reinforcement Learning: los especialistas se destilaron en un único estudiante mediante MOPD. Luego se aplicó aprendizaje por refuerzo en entornos agenticos reales (Agentic RL), ejecutando multi-turnos dentro de harnesses que simulan interacciones complejas con herramientas y prompts del sistema.

El pipeline de Agentic RL separa claramente optimización del modelo, inferencia y ejecución del entorno. Un Training Engine optimiza el modelo, un Rollout Engine genera acciones con la política vigente, y un servicio Sandbox ejecuta las acciones en harnesses como OpenClaw o Hermes Agent. Esta arquitectura permite tratar los harnesses como cajas negras, capturando trayectorias token a token para reconstruir y validar muestras de entrenamiento RL.

Rendimiento en benchmarks y limitaciones

LFM2.5-2.6B fue evaluado contra modelos de hasta 4 veces su tamaño en una batería de pruebas: STEM, seguimiento de instrucciones, uso de herramientas y tareas agenticas. A pesar de ser el más pequeño del grupo, compite e incluso supera a modelos más grandes en muchas métricas.

Puntos destacados:

  • Dominio en seguimiento de instrucciones: el modelo encabeza los benchmarks de instruction-following presentados.
  • Uso de herramientas: lidera en casi todas las pruebas de tool-use, excepto en BFCLv4, donde un modelo Qwen de 9.7B lo supera por poco.
  • Tareas agenticas y conocimiento: supera a varios Gemma y se mantiene parejo con las series Qwen en agentic tasks; además lidera en pruebas de conocimiento y se mantiene cercano en matemáticas.
  • Código: en programación el panorama cambia: los modelos más grandes conservan una ventaja clara, por lo que para cargas de trabajo de coding intensivo conviene considerar instancias mayores.

En resumen, para aplicaciones centradas en instrucciones, búsquedas y manejo de herramientas, LFM2.5-2.6B ofrece una relación costo/rendimiento atractiva, especialmente cuando la prioridad es ejecutar localmente.

Velocidad de inferencia y requisitos de hardware

Una de las promesas del modelo es la eficiencia en inferencia: gracias a la arquitectura LFM2, LFM2.5-2.6B es el más rápido dentro de su clase en las pruebas reportadas.

  • CPU: alcanza 220 tokens/segundo en un Apple M5 Max y 113 tokens/segundo en un AMD Ryzen AI Max+ 395. Incluso a 30 tokens/segundo permite ejecutar agentes capaces en dispositivos móviles.
  • GPU: en cargas de alta concurrencia, el modelo llega a casi 15,000 tokens/s, lo que equivale a aproximadamente 1.3 mil millones de tokens por día en una sola H100.

Además, su footprint de memoria es reducido: puede funcionar con menos de 2.5 GB de memoria en ciertas configuraciones, lo que facilita el despliegue en hardware de consumo.

Soporte en el ecosistema de inferencia y cómo empezarlo a usar

LFM2.5-2.6B cuenta con soporte desde el día uno en varias herramientas de la cadena de inferencia: llama.cpp, MLX, vLLM, SGLang y ONNX. Esto facilita integrarlo en aplicaciones existentes o prototipar soluciones on-device.

Para desarrolladores que usan el stack de Hugging Face, el modelo y su versión base están disponibles para descarga y pruebas. También hay una demo en navegador (WebGPU) que permite probar el agente sin instalación.

Recomendación práctica: consideren LFM2.5-2.6B cuando la necesidad sea desplegar agentes locales para cargas de alto volumen, mantener datos dentro del dispositivo o reducir la dependencia de servicios de inferencia en la nube.

Aplicaciones y relevancia para América Latina

En la región, donde la protección de datos sensibles y los costos de infraestructura pueden ser una barrera, un modelo que corre localmente abre oportunidades concretas:

  • Atención al cliente y soporte en campo: apps que procesan información local sin transferir datos a la nube.
  • Herramientas móviles para sectores como salud, agricultura o ventas que requieren respuestas rápidas y confidenciales.
  • Despliegue en oficinas remotas o regiones con conectividad limitada, donde el procesamiento local reduce latencia y dependencia de enlaces externos.

Por supuesto, para soluciones que demanden alto desempeño en generación de código o razonamiento intensivo en cálculos, conviene evaluar modelos más grandes o arquitecturas híbridas (on-device + servidor).

Dónde conseguirlo y próximos pasos

LFM2.5-2.6B y su versión base están disponibles en Hugging Face. Pueden probar la demo en navegador o integrarlo en harnesses locales como OpenClaw, Hermes Agent o Pi siguiendo las guías del proyecto.

Si están evaluando llevar agentes a producción en la región, este modelo ofrece una alternativa práctica para mantener privacidad, reducir costos y ampliar despliegues a dispositivos cotidianos. Esperemos ver cómo equipos en América Latina lo adoptan para casos reales de negocio y servicio.

Fuente original: Hugging Face Blog