Cómo Abnormal AI usa Amazon Bedrock AgentCore para proteger el email a escala

Abnormal AI combina modelos ligeros, ML más profundos y agentes inline que ejecutan código en sandboxes efímeros de Amazon Bedrock AgentCore para detectar y bloquear amenazas antes del inbox, procesando miles de millones de mensajes y automatizando gran parte de su desarrollo.

Por Redaccion TD
Cómo Abnormal AI usa Amazon Bedrock AgentCore para proteger el email a escala

Resumen

Abnormal AI, un servicio de seguridad conductual que protege a más del 25% de la Fortune 500, ha integrado Amazon Bedrock AgentCore Code Interpreter para ejecutar agentes que detectan amenazas en correo electrónico en tiempo real. Estos agentes corren en sandboxes efímeros y ejecutan código a gran escala, permitiendo a la compañía procesar miles de millones de mensajes y bloquear ataques inline antes de que lleguen al buzón.

En este artículo describimos qué es AgentCore Code Interpreter, por qué los agentes necesitan una “pizarra” computacional para tareas más allá del razonamiento semántico, la arquitectura de detección de Abnormal AI y las lecciones prácticas para equipos que quieran desplegar Code Interpreter en producción.

¿Qué es Amazon Bedrock AgentCore Code Interpreter?

Amazon Bedrock AgentCore Code Interpreter es un runtime serverless y totalmente gestionado que permite a agentes ejecutar código de forma dinámica en sesiones aisladas. Sus características clave:

  • Sesiones MicroVM efímeras: tiempo de vida configurable, desde 15 minutos (por defecto) hasta 8 horas para tareas de larga duración.
  • Seguridad: las sesiones corren en sandboxes con separación a nivel del sistema operativo del host, diseñadas para reducir el riesgo de divulgación entre sesiones.
  • Redes flexibles: puede configurarse en modo sandbox con VPC o con acceso público a internet, según necesidades.
  • Manejo de archivos: hasta 100 MB por la API; para datos mayores se integra con Amazon S3.
  • Runtimes preinstalados: entornos de Python y Node.js con bibliotecas comunes para visualización, estadísticas y procesamiento de datos.
  • Observabilidad integrada: logs enviados a Amazon CloudWatch y trazas a AWS CloudTrail.

Un punto crítico es que Code Interpreter se expone como una API: no impone un flujo de trabajo al agente, sino que ofrece un entorno donde el agente puede ejecutar comandos, subir archivos y recuperar resultados. Esto facilita la integración con infraestructuras de agentes ya existentes.

Por qué los agentes necesitan un “scratch pad” computacional

Los grandes modelos de lenguaje son muy buenos para razonamiento y coherencia semántica, pero muchas tareas del mundo real requieren procesamiento o verificación computacional que no es solo lenguaje:

  • Cálculos y conteos: por ejemplo, “¿cuántos correos phishing detectamos en la última hora?” exige cómputo, no solo generación de texto.
  • Procesamiento y visualización de datos: transformar registros en gráficos, PDFs o reportes estructurados.
  • Verificación de código: ejecutar tests unitarios, linting o pruebas de integración para validar salidas generadas por el agente.

Al combinar un LLM con Code Interpreter, el agente obtiene una capacidad práctica para calcular, transformar y verificar resultados, complementando el razonamiento puramente semántico. Como lo resume Shrivu Shankar, vicepresidente de estrategia de IA en Abnormal AI: “Prácticamente cualquier agente, escriba código o no, necesita un sandbox interprete de código que le permita procesar datos y llegar a respuestas”.

Arquitectura de detección de Abnormal AI: tres niveles a escala masiva

Abnormal AI procesa cientos de millones a miles de millones de mensajes al día mediante una arquitectura en tres niveles, donde cada capa maneja casos de mayor complejidad que la anterior:

  • Tier 1 — Clasificación ligera y de alto volumen (miles de millones/día): pequeñas modelos, reglas heurísticas y clasificadores ligeros (por ejemplo, regresiones logísticas) filtran la mayor parte del tráfico. A este nivel, correr modelos más grandes sería costoso e innecesario.

  • Tier 2 — Modelos medios para casos inciertos (millones/día): los mensajes que Tier 1 no clasifica con confianza pasan a modelos de aprendizaje profundo y ML que analizan señales conductuales con mayor detalle.

  • Tier 3 — Agentes inline con Code Interpreter (decenas de miles/día): los casos más difíciles, que normalmente requerirían un analista humano, se procesan mediante agentes inline. Estos agentes reciben inteligencia de amenazas, crean y ejecutan scripts en un sandbox, analizan los resultados en el contexto del modelo conductual y emiten una decisión. Los sistemas de monitoreo y un mecanismo de manejo de misclasificaciones alimentan retroalimentación para mejorar continuamente el pipeline.

El despliegue de los agentes en Tier 3 permite a Abnormal ejecutar código dinámico a escala, realizando análisis forenses y comprobaciones que serían impracticables solo con generación de lenguaje.

El agente analista: aprendizaje por lotes que retroalimenta el sistema

Además del pipeline en tiempo real, Abnormal usa un agente analista que opera en batch. Sus funciones principales:

  • Ingestar misclasificaciones y señales de ajuste desde el pipeline en tiempo real.
  • Identificar patrones y tendencias en grandes conjuntos de mensajes.
  • Autonomía para redactar heurísticas candidatas para Tier 1 y sugerir mejoras para modelos de Tier 2.

Este agente batch ejecuta aproximadamente 100 trabajos por semana y ayuda a automatizar la creación de reglas y la mejora continua de modelos, cerrando el ciclo entre detección, análisis y ajuste.

Lecciones prácticas para implementar Code Interpreter a escala

A partir de la arquitectura y el uso de Abnormal AI se derivan varias consideraciones relevantes para equipos que planeen desplegar Code Interpreter en producción:

  • Diseñar con sandboxes efímeros y TTL configurables: las sesiones MicroVM con tiempo de vida ajustable ayudan a equilibrar latencia, durabilidad de tareas y seguridad.
  • Asegurar separación a nivel de host OS: el aislamiento fuerte reduce el riesgo de fuga de información entre sesiones de agentes.
  • Integrar observabilidad desde el inicio: enviar logs a CloudWatch y trazas a CloudTrail facilita monitoreo, auditoría y análisis forense.
  • Usar redes configurables según riesgo: contemplar VPC para entornos cerrados y acceso público solo cuando sea necesario.
  • Manejar archivos de forma escalable: aprovechar el límite de 100 MB por API para cargas rápidas y S3 para datasets más grandes.
  • Exponer el runtime como API: mantener la flexibilidad del flujo del agente y facilitar la integración con infraestructuras existentes.
  • Automatizar retroalimentación: un agente batch que procese misclasificaciones y proponga heurísticas acelera la mejora continua del sistema.

Impacto en el ciclo de desarrollo

Abnormal AI aplica su enfoque AI-nativo incluso en desarrollo de software: hoy en día, 80% de sus cambios de código se construyen usando un agente de alguna manera, y el 40% se genera de extremo a extremo por un agente en background (construcción totalmente IA, no solo asistida). Esto muestra cómo la capacidad de ejecutar y verificar código automáticamente transforma tanto el runtime como el proceso de creación.

Conclusión

La combinación de modelos de lenguaje, pipelines jerarquizados y sandboxes computacionales efímeros como Amazon Bedrock AgentCore Code Interpreter permite a empresas como Abnormal AI llevar análisis complejos y ejecución dinámica de código al plano operativo en tiempo real. Para organizaciones en América Latina que enfrentan volúmenes crecientes de amenazas y escasez de analistas humanos, esta arquitectura ofrece un camino para escalar detección, automatizar ajustes y mantener controles de seguridad y observabilidad adecuados.

Fuente original: AWS ML Blog