AISI y EvalEval: avanzando hacia evaluaciones de IA reproducibles
La UK AI Security Institute (AISI) está publicando resultados de evaluación usando la infraestructura de EvalEval, favoreciendo la reproducibilidad y la verificación. El esfuerzo incluye datos, configuraciones y resultados para múltiples benchmarks y modelos 'frontier'.
Por qué la reproducibilidad en evaluaciones de IA importa
A medida que la adopción de modelos de inteligencia artificial se acelera, las evaluaciones se vuelven una fuente clave de evidencia sobre el desempeño y los límites de esos sistemas. Sin embargo, muchos resultados se publican en formatos y plataformas dispares, con información incompleta respecto a la configuración experimental. Repetir esos experimentos puede ser costoso o incluso imposible en la práctica.
La falta de transparencia y estandarización dificulta comparar resultados, identificar sesgos en los protocolos de evaluación y extraer conclusiones útiles para políticas públicas, compras tecnológicas o despliegues en producción —un desafío particularmente relevante en América Latina, donde presupuestos y acceso a recursos de cómputo suelen ser limitados.
Qué es EvalEval y qué propone Every Eval Ever
EvalEval es una coalición investigadora que desarrolla infraestructura y principios científicos para mejorar el ecosistema de evaluación de IA. Su proyecto Every Eval Ever (EEE) propone un esquema compartido para reportar resultados de evaluación, mientras que Evaluation Cards es la plataforma abierta que reúne metadatos de benchmarks, datos de ejecuciones y metadatos de modelos en registros interpretables.
El objetivo es claro: facilitar la interpretación cuando puntuaciones aparentemente similares se obtienen bajo condiciones de evaluación muy diferentes, y permitir comparaciones reproducibles entre estudios.
Colaboración entre AISI y EvalEval: de la idea a la práctica
La UK AI Security Institute (AISI), órgano del gobierno del Reino Unido dedicado a entender riesgos de la IA avanzada, ha empezado a usar la infraestructura de EvalEval para publicar resultados de evaluación de forma abierta y verificable. Esta colaboración se originó en un taller conjunto durante NeurIPS 2025 y la retroalimentación de AISI ayudó a conformar el esquema EEE.
En esta nueva etapa, AISI está haciendo disponibles en Evaluation Cards los métodos y hallazgos de sus evaluaciones cuando corresponde, incluyendo resultados verificados, contexto y configuraciones experimentales.
Qué datos y benchmarks ha compartido AISI
La liberación incluye información para los cinco benchmarks centrales del experimento en el artículo de AISI How Inference Compute Shapes Frontier LLM Evaluation:
- HealthBench
- FrontierMath
- Humanity’s Last Exam
- SWE-Bench
- Pro Terminal-Bench 2.0
Estos resultados cubren seis modelos frontier evaluados en el estudio: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 y GPT-5.4. Adicionalmente, AISI libera datos de dos evaluaciones relacionadas en el dominio cibernético, Cyber CTFs y The Last Ones, que usan un conjunto de modelos parcialmente distinto.
Hallazgos relevantes: el papel del cómputo de inferencia y el protocolo
El trabajo de AISI se centra en cómo el rendimiento reportado en benchmarks depende del cómputo de inferencia y del protocolo de evaluación. Un ejemplo destacado es Humanity’s Last Exam: su desempeño varía según cómo se defina el protocolo y cuántos tokens de inferencia se permitan.
En la visualización del estudio, cada curva muestra la fracción acumulada de tareas intentadas que fueron resueltas dentro de un conteo de tokens específico, tomando la primera observación de éxito por tarea. Cuando los modelos recibieron retroalimentación de corrección desde un oráculo después de cada intento, continuaron resolviendo más tareas a medida que aumentaba el uso de tokens. Este tipo de detalle explica por qué dos estudios con puntajes parecidos pueden implicar condiciones experimentales muy distintas.
Por qué la transparencia a nivel de transcripto es crucial
Hacer públicos los transcript-level data no solo facilita reproducir un experimento, sino también diagnosticar por qué un modelo falla o avanza en determinadas tareas. Con la información de configuración y de ejecución disponible, investigadores y profesionales pueden:
- Comparar directamente distintos estudios y entender discrepancias.
- Evaluar cómo decisiones de diseño del experimento influyen en la métrica final.
- Reproducir análisis sin necesidad de repetir costos de cómputo prohibitivos.
Para equipos en América Latina, esto significa poder aprovechar datos publicados como referencia verificada para evaluar riesgos y capacidades de modelos sin incurrir en gastos que muchas veces exceden el presupuesto local.
Qué puede hacer cada actor del ecosistema
A partir de esta adopción, AISI y EvalEval recomiendan acciones concretas:
- Model developers: reportar resultados verificados y la configuración completa de las evaluaciones.
- Evaluation developers: publicar los benchmarks y los datos de ejecución usando el esquema Every Eval Ever.
- Investigadores en evaluación, gobernanza y política: explorar Evaluation Cards por benchmark o modelo y usar la plataforma para revisar el estado de los reportes de evaluación en el ecosistema.
Estas buenas prácticas hacen más fiable la comparación entre modelos y ayudan a quienes toman decisiones a basarse en evidencia sólida.
Relevancia para políticas públicas y adopción en la región
La estandarización de reportes de evaluación tiene implicaciones directas para la formulación de políticas, adquisición de tecnologías y auditorías de seguridad en IA. Para gobiernos, universidades y empresas latinoamericanas, contar con resultados verificables y con contexto operativo reduce la incertidumbre al tomar decisiones sobre uso, compra o regulación de modelos avanzados.
Además, la disponibilidad de registros estructurados facilita la investigación local, colabora con procesos de auditoría independientes y promueve mayor responsabilidad en despliegues que puedan tener impacto social o económico.
Hacia una cultura de evaluación abierta y reproducible
La adopción por parte de AISI de la infraestructura de EvalEval es un paso práctico hacia evaluaciones más transparentes y comparables. A medida que más organizaciones adopten esquemas como Every Eval Ever y plataformas como Evaluation Cards, la comunidad científica y las autoridades regulatorias tendrán puntos de referencia verificados que permitan meta-investigación más fiable.
Evaluaciones abiertas no eliminan la necesidad de juicio humano ni de análisis contextual, pero aportan un estándar común para documentar cuándo y cómo se obtuvieron mediciones que, de otra forma, podrían ser difíciles de interpretar o replicar.
Recursos y próximos pasos
Entre los proyectos y métodos relacionados mencionados por AISI y EvalEval están HiBayES (modelado bayesiano jerárquico para mejorar la evaluación), OptStop (para hacer más eficiente la evaluación) y las Evaluation Cards. Estos esfuerzos combinados buscan cerrar las brechas en la documentación y la reproducibilidad.
Para equipos en América Latina interesados en participar o aplicar estas prácticas, la recomendación es comenzar por documentar configuraciones experimentales, publicar datos verificables cuando sea posible y explorar las Evaluation Cards como referencia para diseñar evaluaciones comparables.
La colaboración entre AISI y EvalEval muestra que la infraestructura y las normas compartidas son viables y útiles para elevar la calidad de la evidencia sobre capacidades de IA. Ese es un paso relevante para llevar la evaluación de modelos de laboratorio a decisiones responsables en el mundo real.
Fuente original: Hugging Face Blog