Visión por IA en ciudades: promesas, riesgos y desafíos para América Latina
La visión por computadora abre nuevas posibilidades para entender y diseñar ciudades a gran escala: desde estimar emisiones hasta mapear el uso de parques. Pero su despliegue masivo plantea riesgos reales de privacidad, vigilancia y refuerzo de sesgos.
Una nueva mirada sobre la ciudad
La capacidad de las máquinas para “ver” la ciudad está cambiando la forma en que planificadores, investigadores y autoridades entienden el espacio urbano. Proyectos recientes del MIT Senseable City Lab muestran aplicaciones concretas: usando aprendizaje automático sobre imágenes de cámaras de tráfico en Nueva York, los investigadores identificaron tipos de vehículos y estimaron las emisiones asociadas a cada uno. Con suficientes cámaras, estas técnicas visuales podrían monitorear contaminantes con una combinación de escala y detalle poco común hasta ahora.
Ese ejemplo ilustra la doble naturaleza del fenómeno: por un lado, la posibilidad de generar datos muy precisos sobre problemas urbanos cotidianos; por otro, la emergencia de dilemas éticos y sociales vinculados al uso masivo de imágenes. En su nuevo libro How AI Sees the City: Urban Visual Intelligence, publicado por Routledge, Fábio Duarte, Martina Mazzarello, Carlo Ratti y Fan Zhang exploran ese territorio que combina historia, técnica y políticas públicas.
De la tradición visual a la inteligencia visual
Los autores recuerdan que la observación visual ha sido una herramienta fundamental en el urbanismo desde hace siglos. Desde mapas antiguos hasta la fotografía que mostró transformaciones como la remodelación de París o la superpoblación de barrios en Nueva York, las imágenes siempre han moldeado cómo pensamos la ciudad. Pensadores como Kevin Lynch y William H. Whyte hicieron de la observación directa un método para entender la forma urbana y el uso del espacio público.
La novedad es que hoy la visión por IA permite escalar esa mirada: ya no es solo un investigador observando una plaza, sino algoritmos analizando millones de imágenes para identificar calles, edificios, vegetación, flujo peatonal o congestión vehicular. Como señala Fábio Duarte, con técnicas de visión cada imagen puede tratarse como un conjunto de datos.
Aplicaciones prácticas: emisiones, movilidad y más
Las aplicaciones son variadas. Además del ejemplo de emisiones en Nueva York, la visión por IA ayuda a diagnosticar por qué se producen atascos, qué intersecciones son más peligrosas o qué áreas de plazas y parques atraen mayor presencia de personas. Imágenes tomadas desde teléfonos o cámaras urbanas complementan la visión satelital: mientras los satélites miden cobertura de árboles a gran escala, las imágenes a nivel de calle muestran cuánto verde perciben las personas en su día a día, un factor relevante para el bienestar.
La mejora en el reconocimiento de imágenes también ha permitido estudios menos obvios: a partir de fotos de alojamientos en plataformas como Airbnb, investigadores han analizado estilos de diseño interior y descubierto que no existe una homogeneización global absoluta, sino diferencias geográficas marcadas.
Relevancia para América Latina
Las ciudades latinoamericanas —con retos como congestión, calidad del aire, informalidad y espacios públicos heterogéneos— pueden beneficiarse de estas herramientas para planificar y priorizar intervenciones. Datos visuales a escala pueden ayudar a identificar corredores críticos de movilidad, zonas con árboles insuficientes o puntos recurrentes de riesgo vial.
Sin embargo, el contexto regional también exige cautela: muchas ciudades latinoamericanas enfrentan altos niveles de desigualdad y prácticas policiales que han usado cámaras para control social. Implementar sistemas de visión por IA sin marcos claros de gobernanza puede profundizar problemas existentes y afectar desproporcionadamente a comunidades vulnerables.
Los riesgos: vigilancia, sesgo y erosión de libertades
El libro y los investigadores subrayan peligros concretos. La instalación masiva de cámaras plantea inquietudes sobre vigilancia. A modo de referencia, Londres cuenta con cerca de 210 cámaras por milla cuadrada, y algunas ciudades chinas tienen densidades extremadamente elevadas —por ejemplo, Shanghai supera las 5.000 cámaras por milla cuadrada—. Estos ejemplos muestran que la tecnología puede usarse para seguridad pública o para crear sistemas de monitoreo intenso con impactos sobre la privacidad y las libertades civiles.
Además, los algoritmos no son neutrales. Si los conjuntos de datos usados para entrenar modelos reflejan sesgos —por ejemplo, subrepresentación de cierto tipo de barrios o sesgos en la identificación de personas—, la IA puede reforzar decisiones discriminatorias en políticas de movilidad, fiscalización o seguridad.
Finalmente, la retención de imágenes y la eventual combinación con otras bases de datos (identidades, registros) aumentan el riesgo de usos indebidos.
Gobernanza y buenas prácticas
Frente a esas oportunidades y riesgos, la alternativa no es abandonar la tecnología sino gobernarla. Algunas líneas de acción prácticas y coherentes con los debates del libro incluyen:
- Evaluaciones de impacto de privacidad antes de desplegar cámaras o modelos, que analicen riesgos y mitigaciones.
- Auditorías independientes de sesgo y desempeño algorítmico, realizadas por terceros y con resultados públicos.
- Límites claros en la retención y uso de grabaciones, incluyendo reglas sobre anonimización y eliminación periódica.
- Transparencia sobre qué se mide, con qué objetivos y quién tiene acceso a los datos.
- Participación ciudadana en decisiones sobre monitoreo visual, especialmente en comunidades más afectadas.
Estas medidas son particularmente relevantes en contextos latinoamericanos, donde la confianza en instituciones públicas puede variar y la percepción de control social es sensible.
Hacia un uso responsable de la visión por IA urbana
La contribución central del trabajo del MIT Senseable City Lab es situar la visión por IA dentro de una tradición de observación urbana, pero subrayando que la escala y el detalle actuales requieren nuevas reglas del juego. Como resume Fan Zhang, la promesa real no es solo que las computadoras analicen millones de imágenes, sino que podamos conectar lo visible con preguntas más amplias sobre cómo funcionan las ciudades y cómo las experimentan las personas.
Para los tomadores de decisión en América Latina esto significa abordar dos tareas simultáneas: explorar aplicaciones que mejoren la calidad de vida (mejor gestión del tráfico, identificación de zonas prioritarias de arbolado, diseño de espacios públicos más seguros) y establecer marcos de gobernanza que prevengan abusos. Implementada con límites claros, auditorías y participación ciudadana, la visión por IA puede ser una herramienta valiosa; sin esas salvaguardas, corre el riesgo de transformar la mirada pública en un sistema de control.
Conclusión
La visión por IA ofrece a las ciudades una mirada sin precedentes: más datos, mayor detalle y posibilidades de intervención. Pero esa capacidad exige responsabilidad. El desafío para las ciudades latinoamericanas es diseñar políticas públicas que permitan aprovechar los beneficios técnicos sin sacrificar derechos ciudadanos ni profundizar desigualdades. La discusión está abierta y las decisiones que se tomen ahora definirán si la visión por IA será una aliada de la gobernanza urbana o una fuente de nuevas tensiones sociales.
Fuente original: MIT News AI