Cómo el aprendizaje por refuerzo puede mejorar el transporte y la política pública
Cathy Wu, investigadora del MIT, aplica aprendizaje por refuerzo (RL) para diseñar sistemas de transporte más eficientes y sostenibles. Su trabajo muestra avances técnicos que podrían ayudar a formular políticas públicas basadas en evidencia.
De los orígenes personales a la investigación aplicada
Cathy Wu, profesora asociada en los departamentos de Ingeniería Civil y Ambiental (CEE) y en el Instituto para Datos, Sistemas y Sociedad (IDSS) del MIT, desarrolló desde joven una motivación clara: usar herramientas computacionales para mejorar la vida de las personas. Su interés en la movilidad nació tanto de experiencias familiares —un padre con largas jornadas y atascos— como de la fascinación por simulaciones tipo “SimCity” que la llevaron a pensar en cómo diseñar sistemas de transporte más seguros y eficientes.
Tras sus estudios en MIT y un doctorado en UC Berkeley, Wu llevó su formación en ciencias de la computación hacia un objetivo concreto: aplicar metodologías de aprendizaje automático y, en particular, aprendizaje por refuerzo (RL), para enfrentar problemas complejos de transporte. Su enfoque sostiene que muchas decisiones de diseño requieren explorar centenares o miles de alternativas, algo que los métodos tradicionales no pueden evaluar con rapidez ni con suficiente evidencia.
Por qué el aprendizaje por refuerzo interesa en transporte
Diseñar redes de transporte implica modelar múltiples variantes y escenarios de uso. El aprendizaje por refuerzo ofrece una forma de automatizar la búsqueda de políticas eficientes en esos espacios complejos, liberando a los investigadores y a los profesionales para probar opciones que antes eran inviable evaluar a gran escala.
Wu y su grupo han mostrado que RL puede ser una herramienta práctica para este tipo de optimización, pero que su uso no es directo: los algoritmos son sensibles al problema específico y pueden comportarse muy diferente incluso en escenarios estrechamente relacionados. Esa sensibilidad fue una barrera importante en los primeros intentos posteriores al primer resultado exitoso de Wu en 2018, cuando aplicó RL a la evaluación del impacto de vehículos autónomos sobre el flujo de tráfico y el trabajo se volvió viral por su potencial.
Tropiezos, diagnóstico y un giro metodológico
Después del éxito inicial, Wu enfrentó un periodo de resultados fallidos al aplicar RL a nuevos problemas de tráfico. Ese ciclo de pruebas y errores llevó a un diagnóstico clave: los algoritmos de RL funcionan muy bien en una fracción de problemas, pero fallan en muchos otros —aun cuando los problemas son parecidos.
El avance llegó cuando el equipo identificó una estrategia para aprovechar justamente esa heterogeneidad. En 2023 desarrollaron un método para detectar en qué instancias RL se entrena bien y en cuáles no. En lugar de intentar entrenar modelos para cada posible escenario, seleccionaron las instancias más aptas para el entrenamiento y combinaron los modelos resultantes.
El resultado fue significativo: al entrenar solo en los problemas que convergen y generalizan bien, el conjunto de modelos obtenido resolvía correctamente un conjunto más amplio de casos, incluyendo algunos que por sí solos no habrían sido solucionados con entrenamiento directo. Esa selección inteligente de problemas mejoró la eficiencia de entrenamiento hasta 30 veces, reduciendo drásticamente la necesidad de entrenar decenas o cientos de modelos independientes.
Wu considera este avance como la prueba de que el aprendizaje por refuerzo puede jugar un rol importante en problemas de optimización difíciles, y desde entonces una parte sustancial de su grupo se enfoca en lo que llaman “contextual RL”, es decir, aplicar RL para resolver un espacio de problemas relacionados en lugar de una sola instancia aislada.
De la simulación a la política pública: eco-driving como caso de estudio
Una aplicación concreto de este trabajo se orienta a medidas de eco-driving: controlar inteligentemente las velocidades de los vehículos para reducir el frenado y la aceleración excesivos. El equipo de Wu demostró que políticas basadas en estas estrategias podrían reducir las emisiones de vehículos entre 11% y 22%, según sus simulaciones.
Este hallazgo es relevante porque provee evidencia cuantitativa sobre el potencial de intervenciones que no requieren cambios drásticos en infraestructura, sino en la gestión del flujo vehicular y en comportamientos de conducción asistida. Para los encargados de diseñar políticas públicas, disponer de modelos que muestren el impacto esperado en emisiones y eficiencia facilita la toma de decisiones basadas en datos.
Relevancia para América Latina
Las ciudades latinoamericanas enfrentan congestión urbana, desigualdad de acceso a la movilidad, y retos ambientales crecientes. Las metodologías que Wu y su equipo desarrollan pueden ser valiosas para planificadores locales y autoridades de transporte por varias razones:
- Permiten evaluar muchas políticas posibles a gran escala sin desplegar intervenciones costosas desde el inicio.
- Hacen posible priorizar medidas de bajo costo —como programas de eco-driving o ajustes en la gestión de semáforos— con evidencia de reducción de emisiones.
- Abren la puerta a soluciones contextuales: el enfoque de “contextual RL” es especialmente útil cuando cada ciudad o corredor tiene características particulares que requieren modelos que generalicen entre variantes parecidas.
No obstante, su aplicación práctica en la región demanda colaboración entre investigadores, autoridades locales y sectores privados para adaptar los modelos a datos reales, implementar pilotos y validar resultados en el terreno.
Limitaciones y consideraciones éticas
Wu defiende la política basada en evidencia como pilar de una sociedad democrática, pero el uso de RL en sistemas públicos no está exento de desafíos. La sensibilidad de los algoritmos, la necesidad de datos representativos y la garantía de que las soluciones no perjudiquen a grupos vulnerables son cuestiones que deben abordarse con rigor.
La investigación de Wu remarca que, además de avances técnicos, es necesario contar con procesos transparentes de evaluación y mecanismos para traducir resultados algorítmicos a decisiones operativas y regulaciones claras.
Conclusión
El trabajo de Cathy Wu ilustra una trayectoria que va desde una motivación personal por mejorar la vida cotidiana hasta soluciones computacionales robustas que pueden influir en políticas públicas de transporte. Al superar la sensibilidad del aprendizaje por refuerzo mediante la selección estratégica de problemas de entrenamiento, su equipo logró avances que hacen más factible el uso de RL en contextos reales.
Para América Latina, donde la presión sobre la movilidad urbana y el deseo de políticas efectivas y económicas son grandes, estas metodologías ofrecen una vía prometedora: usar modelos avanzados para diseñar intervenciones más eficientes, sostenibles y basadas en evidencia.
Aunque persisten retos técnicos y éticos, el enfoque de combinar investigación metodológica con aplicaciones prácticas abre la posibilidad de transformar la forma en que se conciben y evalúan las políticas de transporte en las ciudades.
Fuente original: MIT News AI