Etica e IA 5 min lectura
BenchMIRT: qué están realmente midiendo los benchmarks de LLM
BenchMIRT aplica una versión multidimensional de Item Response Theory para auditar benchmarks de modelos de lenguaje a nivel de cada pregunta. Revela que puntajes agregados pueden ocultar señales distintas como seguridad y razonamiento.