Inteligencia Artificial 6 min lectura
Reducir costos de RAG en Amazon Bedrock con compresión sensible a la consulta
La compresión consciente de la consulta filtra contexto irrelevante antes de la llamada al modelo principal, reduciendo tokens de entrada y costos en Amazon Bedrock. Esta estrategia usa un modelo más pequeño para recortar los fragmentos recuperados y puede integrarse con Knowledge Bases y otras capacidades de Bedrock.