Las cuatro caches clave para servir modelos LLM y reducir latencia
Las aplicaciones basadas en LLM pueden incluir miles o millones de tokens, lo que hace crítico evitar reprocesos innecesarios. Este artículo explica cuatro tipos de cache —KV, prefix, prompt y semantic— y cómo se complementan para acelerar la inferencia.