Machine Learning 6 min lectura
Cómo abaratar la distilación de conocimiento para modelos LLM a gran escala
La distilación de conocimiento permite comprimir grandes LLMs, pero el paso de distilación suele ser el más costoso en VRAM y cómputo. Una combinación de cacheo offline de logits top-K y una versión 'chunked' y fusionada de la pérdida KL reduce el uso de memoria lo suficiente como para hacer experimentación a gran escala práctica.