Reducir la latencia de LLM en producción con routing consciente de prefijos en SageMaker
Amazon SageMaker ahora puede enrutar solicitudes que comparten el mismo inicio (prefijo) al mismo nodo, permitiendo que las cachés KV se mantengan calientes. Esto reduce significativamente el tiempo hasta el primer token (TTFT) en aplicaciones con prompts compartidos, como chatbots de soporte.