Más allá de RAG: compresión de conocimiento orientada a tareas para IA empresarial en AWS

La compresión de conocimiento orientada a tareas (TAKC) transforma bases de conocimiento extensas en representaciones específicas por tarea, optimizando respuestas analíticas y reduciendo costos. En AWS, TAKC se implementa como pipelines serverless que almacenan versiones comprimidas y en varios niveles de fidelidad.

Por Redaccion TD
Más allá de RAG: compresión de conocimiento orientada a tareas para IA empresarial en AWS

El límite de RAG y la necesidad de algo más

Retrieval-Augmented Generation (RAG) es una técnica valiosa para responder consultas a partir de grandes colecciones de documentos, pero cuando las preguntas requieren síntesis entre cientos de fuentes su capacidad se queda corta. La búsqueda por similitud recupera fragmentos relevantes, pero no siempre logra conectar información dispersa entre distintos documentos —un punto crítico en procesos como due diligence financiero, revisiones regulatorias o análisis de riesgos legales.

TAKC —task-aware knowledge compression o compresión de conocimiento orientada a tareas— propone una solución diferente: en lugar de depender de la búsqueda en bruto sobre todo el corpus, pre-comprime la base de conocimiento en representaciones enfocadas al tipo de tarea y las almacena para consultas posteriores. En esencia, TAKC prepara versiones concentradas del material para cada propósito analítico.

¿Qué hace distinto a TAKC?

La diferencia clave es la orientación a la tarea. El mismo documento se puede resumir de formas distintas según la finalidad: un informe anual comprimido para análisis financiero debe mantener cifras de ingresos, márgenes y flujo de caja; ese mismo informe comprimido para revisión de cumplimiento debe priorizar referencias regulatorias y antecedentes de sanciones.

Los resúmenes genéricos diluyen la densidad informativa para usos concretos. TAKC utiliza un LLM para generar resúmenes cortos y específicos por tarea, descartando lo irrelevante y reteniendo lo que importa para cada caso. Esos resúmenes se generan de forma offline —una vez por documento y por tipo de tarea— y se almacenan para ser consultados en tiempo de consulta.

Compresión multinivel según complejidad de la consulta

No todas las preguntas necesitan la misma fidelidad. TAKC define cuatro niveles de compresión por tipo de tarea:

  • Light (8x): conserva más contexto, ideal para razonamiento multi-paso y síntesis entre documentos.
  • Medium (16x): reduce aún más el contexto y sirve para consultas analíticas de complejidad moderada.
  • High (32x): orientado a búsquedas factuales y preguntas concretas.
  • Ultra (64x): apto para clasificación y búsquedas por palabras clave.

En términos relativos, la reducción de tokens va desde aproximadamente 8x hasta 64x, con reducciones porcentuales indicadas en cada nivel. Un analizador de complejidad de consultas enruta automáticamente una pregunta al nivel adecuado según señales como longitud de la consulta, tipo de pregunta y lenguaje analítico. Así, la mayoría de las consultas cotidianas se atienden desde caches altamente comprimidos a bajo costo, y solo las consultas complejas consumen contexto ampliado.

Ventajas sobre una RAG tradicional

  • Acceso a la base de conocimiento completa en forma comprimida, no solo a los top-k fragmentos que devuelve una búsqueda de similitud.
  • Preservación de conexiones inter-documentales porque la compresión puede procesar documentos en conjunto.
  • Versionado y auditoría de prompts/task-types para reproducibilidad: los prompts que definen qué conservar se guardan en configuración versionada y disparan recompresiones cuando cambian.
  • Ahorro en uso de tokens y costos operativos, al delegar la mayoría de consultas a caches comprimidos.

Arquitectura implementada en AWS

La referencia presentada se ejecuta en AWS como dos pipelines serverless desacoplados: ingesta y consultas.

Componentes principales mencionados:

  • Amazon S3: almacenamiento de documentos e inputs de ingesta.
  • AWS Lambda: ejecución de funciones cortas y event-driven para procesar documentos y atender tareas puntuales.
  • Amazon API Gateway: expone la interfaz de consulta como endpoint REST.
  • Amazon ElastiCache Serverless: cache para lecturas sobre claves compuestas (por ejemplo takc:{task}:{rate}).
  • Amazon Cognito: gestión de emisión de JWT y refresh tokens, evitando código de autenticación custom.
  • AWS Systems Manager Parameter Store o un prefijo S3 versionado para almacenar prompts por tipo de tarea y permitir auditoría.

La elección de serverless responde a patrones típicos: cargas de ingesta en ráfagas y consultas con demanda variable hacen que la facturación por uso y la elasticidad del modelo serverless resulten convenientes.

Flujo de ingesta y consulta (resumen)

  1. Un documento se deposita en S3 bajo un prefijo que indica el tipo de tarea.
  2. El pipeline de ingesta activa Lambdas que llaman al LLM para generar las compresiones según cada task-type y cada nivel de fidelidad.
  3. Las representaciones comprimidas se guardan en el cache y/o en S3 con metadatos que permiten búsquedas y trazabilidad.
  4. En tiempo de consulta, el sistema usa un analizador de complejidad para seleccionar el nivel de compresión apropiado y la clave cacheada correspondiente.
  5. Si la compresión elegida no contiene suficiente detalle, el enrutador sube a un nivel de menor compresión (más contexto) de forma transparente para el usuario.

La referencia incluye scripts de validación que comparan respuestas del LLM usando las versiones comprimidas contra respuestas generadas desde los documentos completos, permitiendo evaluar la calidad de la compresión por tarea.

Relevancia para organizaciones en América Latina

Empresas e instituciones en la región enfrentan escenarios similares: procesos de fusiones y adquisiciones, auditorías regulatorias, cumplimiento ambiental y contractual, y gestión de litigos. TAKC es útil cuando las conexiones críticas entre documentos no comparten lenguaje directo y exigen síntesis entre múltiples fuentes.

Además, la posibilidad de desplegar la implementación de código abierto en su propia cuenta AWS facilita el cumplimiento de requisitos de soberanía de datos y políticas internas, algo particularmente relevante para sectores regulados en América Latina.

Consideraciones operativas y buenas prácticas

  • Mantener los prompts por task-type en un almacén versionado para auditoría y reproducibilidad.
  • Ejecutar recompresiones cuando se actualizan los prompts o cuando cambia la base de conocimiento.
  • Complementar TAKC con filtros metadatos y reformateo de queries para reducir el conjunto de documentos antes de la compresión.
  • Validar la calidad de compresión comparando salidas a distintos niveles contra la referencia completa.

Conclusión

TAKC extiende la idea de RAG al transformar previamente la base de conocimiento en representaciones enfocadas por tarea y en múltiples niveles de fidelidad. Para organizaciones que deben sintetizar información dispersa entre cientos de documentos, esta aproximación mejora la capacidad analítica, reduce costos y facilita el cumplimiento operativo. En AWS, la arquitectura serverless propuesta permite implantar una versión abierta en la propia cuenta, manteniendo control sobre los datos y los prompts que definen cada compresión.

Fuente original: AWS ML Blog