LFM2.5 Q4_0: modelos optimizados por Quantization-Aware Distillation para edge
Liquid AI presentó checkpoints Q4_0 entrenados con Quantization-Aware Distillation (QAD) para las variantes LFM2.5 (230M, 350M, 1.2B-Instruct y 2.6B). Estas versiones prometen mantener la memoria y velocidad de Q4_0 mientras recuperan la mayor parte de la precisión perdida al cuantizar.
Qué se lanzó
Liquid AI publicó artefactos GGUF Q4_0 entrenados con Quantization-Aware Distillation (QAD) para cuatro checkpoints de la familia LFM2.5: LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct y LFM2.5-2.6B. Los archivos están disponibles en Hugging Face y están listos para usarse con runtimes que soportan GGUF Q4_0, como llama.cpp.
El objetivo principal del lanzamiento es ofrecer versiones de 4 bits que conserven la huella de memoria y el rendimiento de Q4_0, pero sin la caída de calidad típica que suele acompañar a la cuantización post-entrenamiento.
Qué es Quantization-Aware Distillation (QAD)
Quantization-Aware Distillation combina dos ideas: usar un modelo “teacher” de alta precisión como guía y entrenar un “student” que ya incorpora la cuantización durante su aprendizaje. En lugar de cuantizar un modelo ya entrenado (post-training quantization, PTQ), QAD entrena el modelo objetivo con la cuantización presente, permitiendo que el student compense las pérdidas de representación.
En términos prácticos, eso se traduce en checkpoints de 4 bits que reproducen mejor el comportamiento del modelo en BF16/F16, pero con la ventaja de ocupar menos memoria y ofrecer mayor throughput en hardware limitado.
Resultados de benchmark
Los QAD Q4_0 fueron evaluados frente a los GGUF producidos por PTQ y contra el techo en formato BF16. La suite de pruebas incluyó tareas de razonamiento, seguimiento de instrucciones, uso de herramientas y capacidades agenticas: GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF y BFCLv4. Para evaluación matemática se empleó GSM8K en los modelos 230M y 350M, y AIME25 en 1.2B y 2.6B. Los resultados reportan la media de cinco repeticiones.
Las mejoras son consistentes: las versiones QAD Q4_0 retuvieron 97.1%, 96.5%, 97.4% y 96.6% de su rendimiento BF16 respectivo para LFM2.5-230M, 350M, 1.2B-Instruct y 2.6B. En términos simples, recuperan alrededor del 97% de la precisión promedio que se pierde al cuantizar a 4 bits mediante técnicas convencionales.
Además, en comparación con strong baselines de PTQ, los QAD Q4_0 muestran una mejora sustancial en todas las pruebas consideradas.
Rendimiento en hardware real de edge
La medición de throughput de decodificación se realizó sobre cuatro plataformas representativas:
- MacBook Pro (GPU)
- NucBox EVO-X2 (GPU)
- Samsung Galaxy S26 Ultra (CPU Arm)
- Raspberry Pi 5 (CPU Arm)
Los checkpoints QAD Q4_0 mantienen la ventaja de memoria y velocidad propia de Q4_0 y, en muchos casos, superan la competencia en throughput. Específicamente:
- Para los modelos 230M y 350M, los QAD Q4_0 empatan la calidad de Q5_K_M dentro de la variación de evaluación, y además alcanzan entre 4% y 33% mayor throughput de decodificación.
- Para los modelos 1.2B y 2.6B, los QAD Q4_0 igualan la calidad de Q4_K_M y logran entre 3% y 14% más throughput.
También se observó que, cuando aplica, los QAD Q4_0 igualan el desempeño de UD-Q4_K_XL de Unsloth (un checkpoint fuerte de PTQ) en los tamaños 230M y 1.2B.
Estas medidas se traducen en respuestas más rápidas y menor consumo de memoria en dispositivos donde los recursos son limitados, un aspecto crítico para despliegues móviles u offline.
Relevancia práctica para América Latina
Para empresas y equipos de producto en América Latina, estos checkpoints abren posibilidades relevantes:
- Reducción de costos de infraestructura: modelos que ocupan menos memoria permiten ejecutar inferencia en hardware más económico o ampliar el número de instancias por servidor.
- Despliegue móvil y edge: teléfonos inteligentes y SBCs (por ejemplo, Raspberry Pi) son opciones viables para servicios locales, kioscos o soluciones con conectividad intermitente.
- Latencia y privacidad: ejecutar modelos localmente reduce latencia para experiencias en tiempo real y limita la exposición de datos sensibles a servicios en la nube.
En países con restricciones presupuestarias o donde la conectividad es inconsistente, poder correr modelos competitivos en dispositivos locales puede acelerar la adopción de IA en sectores como salud primaria, educación y servicios públicos.
Cómo usarlos hoy
Los artefactos QAD Q4_0 están empaquetados como GGUF y funcionan con llama.cpp y otros runtimes que acepten Q4_0. Un ejemplo de uso con llama-cli:
llama-cli -hf LiquidAI/LFM2.5-350M
—hf-file LFM2.5-350M-QAD-Q4_0.gguf
-p “What is C. elegans?”
Basta descargar el GGUF correspondiente (LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct o LFM2.5-2.6B) desde la página de Hugging Face de Liquid AI y cargarlo en el runtime compatible.
Consideraciones finales y próximos pasos
Los QAD Q4_0 representan una alternativa sólida frente a la cuantización post-training cuando se busca mantener calidad sin sacrificar memoria ni velocidad. Para equipos en Latinoamérica interesados en prototipar rápidamente, esto significa más opciones para ejecutar modelos potentes en hardware accesible.
Recomendaciones prácticas:
- Validen el modelo QAD en sus escenarios concretos: la suite de benchmarks es amplia, pero el rendimiento real depende del dominio de la aplicación.
- Prueben en el hardware objetivo: medir throughput y latencia en el dispositivo final (teléfono, SBC, servidor local) es clave.
- Consideren la gestión de modelos y actualizaciones: mantener versiones y pruebas automatizadas ayuda a controlar regresiones cuando se adopta cuantización o distillation.
Los QAD Q4_0 ya están disponibles en Hugging Face para descarga. Liquid AI sugiere usar la referencia “LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment” para citaciones técnicas.
Si su organización busca reducir costos de inferencia y mejorar la disponibilidad de servicios de IA en entornos con recursos limitados, estos checkpoints ofrecen una vía pragmática para desplegar capacidades avanzadas en el edge.
Fuente original: Hugging Face Blog