NarrateAI y Amazon Bedrock: cómo garantizar calidad de LLMs en tiempo real

NarrateAI implementa un conjunto de mecanismos de aseguramiento de calidad para que los asistentes conversacionales respondan con precisión numérica y en streaming. Este artículo describe las cinco técnicas clave y su encadenamiento en la capa en tiempo real.

Por Redaccion TD
NarrateAI y Amazon Bedrock: cómo garantizar calidad de LLMs en tiempo real

Introducción

En revisiones ejecutivas en vivo, las decisiones se toman sobre la base de datos mostrados al instante. Un asistente conversacional potenciado por un LLM puede responder preguntas complejas al momento, pero los riesgos son evidentes: cifras inventadas, respuestas lentas o tasas de rechazo por sobrecarga de API tienen consecuencias profesionales inmediatas. NarrateAI, utilizado por más de 4,000 líderes ejecutivos en AWS, aborda este reto construyendo aseguramiento de calidad listo para producción desde la recuperación de datos hasta la entrega de la respuesta.

Este artículo se centra en la capa de interacción en tiempo real de NarrateAI, construida sobre Amazon Bedrock y AgentCore. Aquí se describen cinco técnicas que operan como un sistema coordinado —orquestación adaptativa de pipeline, failover multi-modelo cross-account, evaluación en streaming, marco de evaluación compuesto y verificación de precisión de datos— y cómo juntas alcanzan aproximadamente 99% de precisión numérica mientras entregan respuestas en tiempo real.

El desafío: rapidez y exactitud en entornos críticos

No todas las consultas exigen la misma cantidad de información. Preguntas puntuales —por ejemplo, “¿Cuál fue el logro trimestral de mi equipo?”— suelen requerir pocas secciones de documentación. Solicitudes amplias como “Análisis completo por región” requieren sintetizar cientos de secciones. Los usuarios esperan tiempos de respuesta homogéneos sin sacrificar exactitud, por lo que la solución debe tratar eficientemente ambos casos.

Además, un único modelo LLM, por muy capaz que sea, no elimina problemas prácticos: ventanas de contexto limitadas (p. ej., en torno a 200K tokens), límites de cuota por cuenta, y la posibilidad de generar lenguaje subjetivo o alucinar números. Para resolverlo se debe orquestar la recuperación y el cómputo, validar continuamente lo generado y verificar números contra los datos originales.

Arquitectura de dos capas: visión general

NarrateAI opera con una arquitectura de dos capas. La capa de Generación Automática de Narrativas se encarga del procesamiento por lotes (batch) y preparación de conocimiento empresarial. La capa de Interfaz Conversacional AI gestiona la interacción en tiempo real con los usuarios y es aquí donde se aplican las cinco técnicas que garantizan calidad en producción.

A continuación detallamos cada técnica y su rol dentro del flujo de respuesta.

1) Orquestación adaptativa del pipeline

La estrategia central es enrutar cada consulta según el volumen agregado de secciones de documento recuperadas (|D|). En la mayoría de los casos —aproximadamente 90% según el despliegue descrito— los datos caben en un único pase rápido; en consultas complejas se activa procesamiento paralelo en lotes.

Se emplea un pipeline de tres fases:

  • Mode-Aware Consolidation: empaqueta las secciones recuperadas y decide la ruta. Si |D| ≤ θ (umbral), concatena todo en un solo chunk; si |D| > θ, agrupa las secciones en N lotes respetando los límites de documento.
  • Bifurcated Analysis: según la ruta, ejecuta una única llamada LLM que hace streaming directo a la evaluación (fast-path) o N llamadas paralelas (normal-path) una por batch.
  • Conditional Consolidation: si hubo procesamiento paralelo, fusiona los N análisis, resuelve conflictos y produce la respuesta final.

Este enfoque optimiza costos y latencia al tratar de forma distinta consultas sencillas y complejas, reduciendo invocaciones innecesarias y evitando truncamiento por sobrepasar la ventana de contexto del modelo.

2) Failover multi-modelo cross-account

Las cuotas de inferencia y el throttling por cuenta pueden convertirse en puntos de fallo visibles para el usuario. NarrateAI extiende la capacidad de inferencia a través de múltiples cuentas y modelos independientes, lo que permite redistribuir peticiones cuando una cuenta o modelo alcanza su límite. Este failover cross-account reduce la probabilidad de que los usuarios experimenten rechazos o degradación de servicio.

La ventaja operativa es clara en entornos empresariales globales: mantener disponibilidad y throughput bajo cargas concurrentes sin depender de un único espacio de cuota.

3) Evaluación en streaming en tiempo real

En lugar de generar la respuesta completa y luego validar, NarrateAI valida cada párrafo a medida que el LLM lo produce. La evaluación en streaming se solapa con la generación, de modo que las comprobaciones de calidad no añaden latencia completa al tiempo de respuesta. Esto permite entregar contenido con formato profesional y verificado prácticamente en tiempo real, ideal para presentaciones ejecutivas.

4) Marco de evaluación compuesto

Cada párrafo pasa por múltiples evaluadores independientes ejecutándose en paralelo. Este marco compuesto combina verificaciones automáticas orientadas al formato, coherencia y exactitud, reduciendo la dependencia en un único criterio de evaluación y mejorando la robustez frente a distintos tipos de fallo (lenguaje subjetivo, inconsistencia de hechos, etc.).

5) Verificación de precisión de datos en cascada

Para evitar alucinaciones numéricas se emplea una verificación en dos etapas: primero, coincidencia exacta barata; si esto no confirma una cifra, se escala a una verificación semántica más costosa. Esta cascada minimiza el uso de recursos pesados y captura las discrepancias numéricas antes de presentar resultados a la audiencia.

El encadenamiento de estas técnicas —orquestación que decide la ruta, failover que asegura capacidad, evaluación en streaming que valida por párrafos, marco compuesto que aporta múltiples puntos de verificación y verificación de datos en cascada que garantiza números— produce respuestas validadas y listos para revisión ejecutiva.

Integración en producción y resultados

Implementado sobre Amazon Bedrock y AgentCore, este conjunto de mecanismos permite mantener throughput bajo uso global concurrido y ofrecer respuestas con formato profesional aptas para inclusión directa en reuniones. El enfoque descrito consigue, según la implementación reportada, cerca de 99% de precisión numérica mientras opera en modo streaming.

Consideraciones para organizaciones en Latinoamérica

Las empresas latinoamericanas que adopten asistentes conversacionales para reportes ejecutivos se benefician de esta aproximación porque mitiga riesgos críticos: decisiones basadas en cifras erróneas o interrupciones por throttling. En contextos regionales con picos estacionales o múltiples oficinas distribuidas, las estrategias cross-account y la orquestación adaptativa ayudan a escalar sin sacrificar calidad.

Al diseñar una solución similar, conviene evaluar la estructura de datos local (ERP, BI, documentos regulatorios) para definir umbrales de empaquetado (θ) y las reglas de verificación semántica que mejor se adapten a métricas financieras y operativas de la organización.

Conclusión

NarrateAI demuestra que un LLM potente no basta por sí solo para usos críticos en tiempo real: se requiere una ingeniería de aseguramiento de calidad que abarque desde la recuperación y el enrutamiento de datos hasta la verificación numérica final. La combinación de orquestación adaptativa, failover cross-account, evaluación en streaming, un marco compuesto de evaluaciones y una verificación en cascada ofrece un camino práctico para entregar respuestas precisas, rápidas y confiables en revisiones ejecutivas y otros escenarios corporativos.

Fuente original: AWS ML Blog