Cómo interpretar los nombres de modelos LLM: guía práctica para elegir localmente
Los nombres de modelos LLM parecen jerigonza técnica, pero cada parte aporta información útil: tamaño, tipo, precisión, cuantización y formato. Esta guía explica cómo leer esos nombres para tomar decisiones informadas al desplegar modelos localmente.
Introducción
Si alguna vez intentaron descargar un modelo LLM para uso local, seguramente se encontraron con nombres que parecen un rompecabezas, por ejemplo: Qwen3.8-27B-A3B-It-2507-gguf-q2ks-mixed-AutoRound. Lejos de ser una línea de opciones arbitrarias, cada segmento del nombre comunica algo concreto: cuántos parámetros tiene el modelo, si todos están activos en cada inferencia, cómo se almacenan los pesos y en qué formato viene el archivo.
Entender esos elementos facilita seleccionar la versión correcta para su caso de uso y para la infraestructura disponible, particularmente importante en mercados de América Latina donde la capacidad de cómputo y los costos operativos suelen ser consideraciones clave.
1) 7B, 14B, 35B… ¿qué significa el tamaño?
La cifra con la letra B indica la cantidad de parámetros del modelo en miles de millones. Por ejemplo:
- 7B = 7 mil millones de parámetros
- 14B = 14 mil millones
- 35B = 35 mil millones
- 70B = 70 mil millones
Los parámetros son los valores aprendidos que definen el comportamiento del modelo. En términos prácticos, a mayor número de parámetros, mayor memoria y potencia de cómputo suelen requerirse durante la inferencia y el entrenamiento. Nota: algunos modelos propietarios avanzados pueden reportar conteos en trillones, como se ve en ciertas versiones comerciales.
2) MoE: ¿usa el modelo todos los parámetros a la vez?
Existen dos arquitecturas generales que verán en los nombres: modelos densos y modelos Mixture-of-Experts (MoE).
-
Modelos densos: usan esencialmente todo su conjunto de parámetros para generar cada token. Un modelo denso de 35B activa, en la práctica, esos 35 mil millones.
-
Modelos MoE: contienen grupos de parámetros organizados en “expertos”. Un mecanismo de enrutamiento selecciona cuáles expertos se emplean para un token dado, por lo que el modelo puede tener un conteo total alto pero activar solo una fracción en cada paso.
Esto permite que un MoE ofrezca una gran capacidad total sin exigir el mismo costo computacional que un modelo denso del mismo tamaño.
3) A3B y el conteo de parámetros activos
Cuando aparece algo como 35B-A3B, el primer número sigue indicando el total de parámetros (35B). La parte A3B informa cuántos parámetros se activan aproximadamente por token: en este caso, alrededor de 3 mil millones.
Así, 35B-A3B significa 35B disponibles, pero ~3B activos en cada paso. Es importante no confundir A3B con decir que el modelo es de 3B: el modelo completo sigue siendo de 35B, solo que su uso efectivo por token es menor gracias al diseño MoE.
4) Base vs Instruct: cómo fue afinado el modelo
Otro componente común en los nombres es la etiqueta que indica el tipo de afinamiento:
-
Base: versión preentrenada sin ajuste adicional para seguir instrucciones. Genera texto según los patrones aprendidos, pero no está necesariamente optimizada para comportarse como asistente.
-
Instruct: la misma arquitectura puede pasar por un ajuste adicional denominado instruction tuning o fine-tuning con datos de instrucciones, para mejorar su capacidad de seguir órdenes, responder preguntas y operar en modo conversacional.
Para aplicaciones de chat, atención al cliente o asistentes internos, la variante Instruct suele ser la más adecuada.
5) FP16 y BF16: la precisión de los pesos
Los formatos FP16 y BF16 indican cómo se representan numéricamente los pesos del modelo.
- Ambos usan 16 bits por valor, pero BF16 tiene más capacidad en el rango exponencial, lo que facilita el entrenamiento y algunos flujos modernos.
Como referencia, un modelo de 35 mil millones de parámetros almacenado a 16 bits requiere aproximadamente 70 GB solo para los pesos, lo que puede estar fuera del alcance de muchas máquinas de escritorio o servidores modestos.
6) Q4, Q5, Q6, Q8: la cuantización y su impacto
Para reducir requisitos de memoria se recurre a la cuantización, que representa los pesos con menos bits:
- Q8 ≈ 8 bits
- Q6 ≈ 6 bits
- Q5 ≈ 5 bits
- Q4 ≈ 4 bits
- Q3 ≈ 3 bits
Pase de 16 bits a 4 bits reduce enormemente el tamaño. Por ejemplo, un modelo de 35B que ocupa ~70 GB en 16 bits puede rondar ~18 GB en una cuantización cercana a 4 bits. La reducción viene con un posible impacto en la calidad, que depende del esquema de cuantización y del uso.
7) Q4_K_M y variantes: qué significan las letras adicionales
A veces verán sufijos como Q4_K_M tras la etiqueta Q4. Esas letras identifican el método o la variante de cuantización. Los esquemas modernos no tratan todos los pesos exactamente igual: hay bloques, agrupaciones y metadatos que buscan equilibrar compresión y fidelidad. Por eso aparecen extensiones que señalan ajustes finos en la técnica de cuantización.
8) GGUF y formatos de archivo
Al final del nombre suelen aparecer indicaciones sobre el formato del archivo, como gguf u otros formatos binarios optimizados para frameworks locales. Ese sufijo no afecta al comportamiento del modelo, pero sí determina compatibilidad con herramientas y librerías que se usan para cargar e inferir.
9) Cómo ponerlo todo junto al elegir un modelo local
Al decidir qué modelo descargar, vale la pena evaluar:
- Recursos disponibles: memoria RAM de GPU/CPU, límites de inferencia y presupuesto.
- Necesidad de interacción: para chat y asistentes, prefieran versiones Instruct.
- Latencia y costo: la cuantización baja reduce memoria y costos, pero puede degradar respuesta; prueben variantes si es crítico.
- Compatibilidad: asegúrense de que el formato del archivo funcione con su pila de inferencia.
Ejemplo práctico: si ven Qwen3.8-27B-A3B-It-2507-gguf-q2ks-mixed-AutoRound, pueden leerlo así: modelo Qwen 3.8 con 27B parámetros totales, aproximadamente A3B parámetros activos, versión It (posible indicativo de instrucción o iteración), empaquetado en gguf con una variante de cuantización q2ks y ajustes adicionales. Cada segmento aclara una dimensión del trade-off entre capacidad y eficiencia.
10) Hoja de referencia rápida
- B tras un número = miles de millones de parámetros.
- MoE vs denso = si todos los parámetros se usan por token o no.
- A3B = parámetros activados por token, no tamaño efectivo del modelo.
- Base/Instruct = tipo de ajuste y comportamiento esperado.
- FP16/BF16 = precisión de los pesos (16 bits).
- Q4/Q5/Q6/Q8 = cuantización en 4/5/6/8 bits aproximadamente.
- Sufijos como K, M = variantes de cuantización.
- gguf = formato de archivo y compatibilidad.
Conclusión
Leer correctamente los nombres de los modelos LLM les da una ventaja práctica para seleccionar la versión que mejor se ajusta a sus recursos y objetivos. En entornos con recursos limitados, como muchos despliegues locales en América Latina, entender cuantización, formatos y la diferencia entre Base e Instruct puede significar la diferencia entre un prototipo inusable y una solución productiva.
Si empiezan a probar modelos locales, anoten los componentes del nombre y usen la hoja de referencia rápida para comparar opciones antes de descargar y desplegar.
Fuente original: Analytics Vidhya