Inteligencia Artificial 6 min lectura
Cómo PagedAttention y RadixAttention optimizan el manejo del KV cache en LLMs
El KV cache se ha convertido en el cuello de botella principal al servir modelos de contexto largo. PagedAttention y RadixAttention atacan problemas distintos pero complementarios: asignación eficiente de memoria y reutilización de prefijos.