2026 en LLMs: el año en que los agentes de código se volvieron prácticos

En 2026 los grandes modelos de lenguaje dieron un salto práctico: sus agentes de código pasaron de cometer errores frecuentes a ser herramientas útiles en el día a día. Este repaso cronológico cubre lanzamientos clave, debates sobre sandboxing y lo que esto significa para desarrolladores y empresas en América Latina.

Por Redaccion TD
2026 en LLMs: el año en que los agentes de código se volvieron prácticos

Un cierre de año que fue todo menos tranquilo

El 27 de septiembre de 2026, en San Jose, Simon Willison ofreció la charla de cierre del WeAreDevelopers World Congress North America, donde hiló los principales hitos del año en LLMs y agentes de código. Compartió las diapositivas anotadas y la charla en video en YouTube, y ofreció un relato cronológico sobre cómo se desarrollaron los cambios durante 2026.

El punto de partida: noviembre de 2025 y los modelos que marcaron la pauta

Para Willison, 2026 empezó unos meses antes: en noviembre de 2025 llegaron Claude Opus 4.5 y GPT-5.1. A simple vista fueron mejoras incrementales, pero cuando los modelos mejoran ligeramente a veces cruzan una línea invisible: empiezan a hacer cosas que antes no hacían bien. En este caso, esa línea la marcaron los agentes de código.

Claude Code, presente desde febrero de 2025, y Codex, algo más joven, ya existían; sin embargo, con Opus 4.5 y GPT-5.1 las combinaciones con sus respectivos harnesses de agentes pasaron de “suelen equivocarse” a “confiables para uso diario”. Ese salto práctico es la noticia más relevante del año para desarrolladores.

Un benchmark absurdo y revelador: el pelícano en bicicleta

Willison cuenta que, desde hace tiempo, prueba modelos con una tarea intencionalmente tonta: “Genera un SVG de un pelícano montando una bicicleta”. Aunque es un benchmark ridículo, sigue siendo útil porque combina retos de dibujo y composición que a los modelos les cuesta coordinar. En noviembre todavía había fallas: Claude seguía sin dibujar bien la bicicleta y GPT-5.1 tampoco resolvía del todo el encuadre. Aun así, el progreso en otras áreas —especialmente en generación y mantenimiento de código— fue significativo.

Proyectos, repositorios y el auge de los agentes abiertos

En noviembre apareció un primer commit en un repositorio GitHub llamado “Warelay”. Durante las semanas siguientes ese proyecto pasó por varios nombres (CLAWDIS, CLAWDBOT, Moltbot y finalmente algo que quedó abreviado en la narración), reflejando la rapidez con que pequeños equipos y desarrolladores empiezan a iterar cuando las herramientas son accesibles.

En diciembre, con las fiestas, muchos desarrolladores experimentaron a su ritmo. Cuando volvieron en enero quedó claro que lo que antes era experimental ahora podía integrarse en flujos de trabajo reales.

Predicciones y debates: sandboxing, seguridad y el rumor de desastres

En el podcast Oxide, junto a Bryan Cantrill y Adam Leventhal, Willison hizo predicciones prudentes: que sería innegable que los LLMs escriben buen código y que resolver sandboxing sería clave. La comunidad respondió: de 277 sesiones en la conferencia, alrededor de 40 tocaron temas de sandboxing o seguridad de agentes, lo que muestra el foco en mitigar riesgos.

Willison incluso predijo un “desastre tipo Challenger” para la seguridad de agentes, una metáfora para riesgos severos derivados de agentes mal asegurados; aunque hubo mucho ruido y preocupación, el escenario catastrófico previsto no ocurrió en 2026. También hubo bromas sobre el alcance del debate público, como la idea de que el Papa podría opinar sobre el impacto económico de los LLMs.

Cultura profesional: Deep Blue y la ensoñación inducida por la IA

Un concepto que surgió en el podcast, acuñado por Adam, fue Deep Blue: esa sensación de letargo profesional cuando la IA puede hacer casi todo. Para muchos ingenieros de software, 2026 fue el año en que los cambios llegaron tan rápido que generaron incertidumbre sobre el rol profesional y el significado del trabajo cotidiano.

Willison llamó a su experiencia “AI mania”: la urgencia de mantener agentes ocupados todo el tiempo, y los proyectos ambiciosos que eso provoca. Sus propios experimentos incluyeron crear un intérprete de JavaScript en Python portado desde MicroQuickJS y un runtime WebAssembly en Python. Al final, esos ejercicios le ayudaron a calibrar expectativas: construir herramientas lentas y poco maduras expone rápidamente su utilidad real.

Tech fun: Python, WebAssembly y la pila de horrores

Uno de los experimentos que relató es llamativo por lo meta: ejecutar su intérprete de JavaScript escrito en Python, dentro de Python compilado a WebAssembly (Pyodide), corriendo en JavaScript en el navegador. Willison lo describe como “una bella pila de horrores”, pero también como una forma útil de explorar límites técnicos y entender dónde los agentes pueden aportar.

¿Qué significa esto para América Latina?

  • Adopción más rápida en empresas emergentes: las startups latinoamericanas pueden aprovechar agentes de código para acelerar prototipos y reducir el tiempo de ingeniería, especialmente en equipos con menos talento especializado.
  • Riesgos de seguridad y cumplimiento: la discusión sobre sandboxing y control de agentes es relevante para empresas y reguladores latinoamericanos. Implementar controles técnicos y políticas internas será crítico para evitar fugas de datos y uso indebido.
  • Necesidad de habilidades nuevas: además de programadores, las organizaciones requerirán roles orientados a supervisión de agentes, evaluación de calidad de código generado y gobernanza de modelos.
  • Localización y datos: para soluciones en español y contextos locales, será importante adaptar modelos y pipelines de datos; la disponibilidad de datos relevantes y la capacidad de validar resultados serán factores de éxito.

Conclusión: más ambición, más prudencia

2026 mostró que empujar límites es la manera de encontrar dónde fallan las herramientas. El salto de los agentes de código de ser curiosidades a herramientas prácticas abre oportunidades, pero también obliga a priorizar seguridad, gobernanza y formación. Para líderes y equipos en América Latina, el mensaje es doble: aprovechen la productividad que ofrecen los agentes, pero inviertan desde ya en controles, pruebas y en el desarrollo de capacidades locales para sacarles el máximo provecho sin exponerse innecesariamente.

Al cerrar su charla, Willison subrayó que el año no ha terminado y que muchos de los debates y experimentos continuarán. Para quienes toman decisiones, esa continua iteración es una invitación a experimentar con objetivos claros y a prepararse para gobernar modelos que ya son, en muchos casos, lo bastante confiables para el trabajo diario.

Fuente original: Simon Willison