LFM2.5-Encoders: encoders rápidos para contextos largos que funcionan bien en CPU
LiquidAI publica LFM2.5-Encoder-230M y 350M, encoders preentrenados diseñados para mantener precisión competitiva mientras escalan a inputs muy largos con latencias moderadas en CPU. Son útiles para clasificación, enrutamiento de intención, detección de PII y otras tareas de producción.
Resumen
LiquidAI lanzó dos nuevos encoders en Hugging Face: LFM2.5-Encoder-230M y LFM2.5-Encoder-350M. Ambos fueron diseñados para mantener la calidad de encoders más grandes mientras permiten procesamiento eficiente de textos largos (hasta 8,192 tokens) y con buena latencia en CPU. Esto abre la puerta a ejecutar tareas de comprensión de documentos a escala—contratos, transcripciones o hilos de soporte—en hardware ya disponible, reduciendo costos operativos.
Por qué un encoder de propósito general
Aunque la familia LFM2.5 ya incluía modelos optimizados para recuperación multilingüe, los encoders tienen aplicaciones más amplias: clasificación de texto, enrutamiento de intenciones, filtros de seguridad y extracción. Un encoder preentrenado con objetivo de masked language modelling (MLM) se adapta bien a tareas tanto de nivel de secuencia como de token.
En entornos productivos, muchas de estas tareas corren continuamente y sobre entradas cada vez más largas; además suelen ejecutarse en CPU por razones de costo y despliegue. Por eso LiquidAI construyó un encoder general que prioriza velocidad y escalabilidad de contexto sin sacrificar la calidad.
Arquitectura y cambios clave
Los LFM2.5-Encoders se inicializan a partir de los backbones decodificadores LFM2.5 (las variantes 230M y 350M). Para convertir cada decodificador causal en un encoder bidireccional se realizaron cambios puntuales:
- Máscara de atención bidireccional: cada token puede ver vecinos a ambos lados en lugar de sólo los previos.
- Convoluciones no causales y de corto alcance: se aplican con padding simétrico para mezclar información de ambos lados del token.
- Objetivo de masked language modeling: durante el entrenamiento se enmascaró el 30% de los tokens.
Este enfoque preserva las ventajas de la arquitectura LFM2 (crecimiento de costo que se desacelera con la longitud de entrada) y la adapta a tareas de comprensión bidireccional.
Entrenamiento en dos etapas
El entrenamiento se realizó en dos fases:
- Competencia lingüística general: entrenamiento MLM sobre un gran corpus web con contexto corto (1,024 tokens).
- Adaptación a largo contexto: extensión del contexto a 8,192 tokens sobre la mezcla completa de datos, con énfasis en fortalezas útiles para tareas factuales, legales y multilingües.
Este diseño permite conservar capacidades generales del lenguaje mientras se adapta a inputs que requieren ventana amplia de contexto.
Resultados de benchmark
Los modelos fueron afinados completamente en cada tarea y evaluados en un conjunto de 17 tareas extraídas de GLUE, SuperGLUE y tareas de clasificación multilingüe. Los puntajes reportados son medias sobre cinco semillas para mayor estabilidad y todo el marco y resultados en bruto están abiertos.
- LFM2.5-Encoder-350M quedó en la posición 4 de 14 modelos evaluados. Los tres por delante son modelos más grandes, incluido uno de 3.5B casi 10 veces su tamaño.
- LFM2.5-Encoder-230M supera a ModernBERT-base y a todos los modelos EuroBERT en estas pruebas, pese a ser más pequeño que la mayoría.
- Ambos encoders puntúan por encima de los LFM2.5-Retrievers del mismo grupo, lo que confirma que diseñar un encoder de propósito general aporta beneficios en tareas de comprensión y clasificación.
Estos resultados muestran que, para muchas aplicaciones prácticas, los encoders medianos bien optimizados pueden igualar o acercarse al rendimiento de modelos mucho mayores.
Rendimiento de inferencia en CPU y GPU
Una de las ventajas distintivas de la familia LFM2 es la inferencia eficiente a contextos largos. Al comparar con ModernBERT (que también soporta 8,192 tokens), los LFM2.5-Encoders muestran la mayor ventaja en CPU:
- En CPU, LFM2.5-Encoder-230M es el más rápido para cualquier longitud de secuencia medida; incluso supera a ModernBERT-base en entradas cortas. Cuando la longitud aumenta, el throughput de ModernBERT cae con fuerza, mientras que los LFM2.5-Encoders mantienen mejor rendimiento hasta caer en rangos medios.
- A 8,192 tokens, ModernBERT-base necesita más de minuto y medio por pasada forward, frente a aproximadamente 28 segundos para LFM2.5-Encoder-230M —es decir, cerca de 3.7× más lento el primero.
En GPU la tendencia es similar pero con márgenes menores: ModernBERT-base puede liderar en longitudes por debajo de ~1K tokens en algunas GPUs (Apple GPU en la prueba), pero los LFM2.5-Encoders toman la delantera a partir de ~2K tokens. El mensaje claro para equipos y operaciones: si procesan textos largos y buscan economía, LFM2.5-Encoders son una opción sobresaliente, sobre todo en CPU.
Demos y aplicaciones prácticas
LiquidAI ofrece demos afinadas sobre estos encoders, todas ejecutándose en espacios de Hugging Face usando sólo CPU. Entre las demostraciones destacan:
- Enrutamiento cero-shot de prompts: defina canales de enrutamiento en texto libre y el modelo puntúa todo el prompt frente a cada canal en una sola pasada.
- Linter de políticas (zero-shot): valide texto contra reglas internas expresadas en lenguaje natural; el modelo puntúa token por token frente a cada regla en una sola pasada.
- Corrección ortográfica token a token.
- Detección de datos personales (PII): identifica y elimina 40 tipos de información personal en 16 idiomas, lo que es especialmente útil para operaciones multilingües en regiones como América Latina.
- Generación por masked-diffusion (bonus): usar el encoder como chatbot que genera texto iterativamente des-enmascarando, en vez de generación autoregresiva izquierda a derecha.
Estas demos reflejan casos de uso reales: clasificación continua, revisión de cumplimiento normativo, protección de datos y automatización de flujos de atención al cliente.
Cómo usar y afinar LFM2.5-Encoders
Recomiende estos encoders cuando tenga tareas de alto volumen de comprensión (clasificación, enrutamiento, extracción, scoring) que deben operar constantemente y con bajo costo. Frente a usar un LLM generativo, un encoder afinado suele ser más pequeño, más rápido y mucho más barato de ejecutar en CPU.
Elección entre tamaños:
- LFM2.5-Encoder-350M: para priorizar precisión cuando eso es crítico.
- LFM2.5-Encoder-230M: para entornos con restricciones de hardware o que requieran mayor throughput.
Pasos básicos para empezar: instale la librería transformers y cargue el modelo preentrenado (por ejemplo, AutoModelForMaskedLM junto con AutoTokenizer). Puede usar el modelo directamente para predicción de tokens enmascarados o anclar una cabeza específica para clasificación y afinarlo en su conjunto de datos.
Relevancia para América Latina
Para organizaciones latinoamericanas —startups, despachos jurídicos, bancos y BPOs— la posibilidad de procesar contratos largos, registros de llamadas y conversaciones en múltiples idiomas (español, portugués, inglés) en CPUs comunes implica menores costos de infraestructura y cumplimiento más rápido. La capacidad multilingüe y la detección de PII en 16 idiomas resultan particularmente útiles en operaciones que manejan datos transfronterizos.
Conclusión
LFM2.5-Encoders ofrecen un equilibrio atractivo entre eficiencia y rendimiento: modelos medianos que igualan o superan a opciones mayores en muchas tareas, con latencias mucho más bajas en inputs largos y buen comportamiento en CPU. Para equipos que priorizan economía operacional y necesitan procesar documentos o conversaciones extensas, estos encoders son una alternativa práctica y potente.
Para probarlos, visite Hugging Face y descargue LFM2.5-Encoder-230M o LFM2.5-Encoder-350M, afínelos a su tarea y evalúe el impacto en costos y latencia en su infraestructura actual.
Fuente original: Hugging Face Blog