Documentos internos muestran que Microsoft y OpenAI sabían que entrenaban IA con prensa: “el mayor robo laboral de la historia”
Archivos publicados por el New York Times muestran que en 2023 hubo reconocimientos internos en Microsoft y OpenAI sobre el uso de artículos de prensa para entrenar modelos, con advertencias explícitas sobre el daño al periodismo y comentarios que califican la práctica como un 'robo' de gran escala.
Qué revelan los documentos
A finales de 2023 el New York Times presentó una demanda contra OpenAI y Microsoft, acusando a ambas empresas de usar artículos periodísticos para entrenar modelos de inteligencia artificial sin autorización ni compensación. A esa acción legal se sumaron once medios más. En el marco de ese caso, el propio New York Times publicó varios documentos internos que habían sido desclasificados y que aportan luz sobre las discusiones internas en ambas compañías.
Uno de los pasajes más contundentes proviene de un documento de Microsoft firmado en 2023 por Brent Hecht, director de ciencia aplicada. Hecht describe la situación con una frase tajante: “el mayor robo laboral de la historia”. En el mismo documento advierte que “millones de personas en todo el mundo pronto considerarán que el hecho de que grandes modelos ‘absorban’ todo su trabajo es un robo asombroso de proporciones sin precedentes” y señala que esos modelos “son un producto que destruye su cadena de suministro”. Es decir, no se trató de una omisión ingenua: había reconocimiento interno del conflicto entre los modelos y los contenidos periodísticos.
En OpenAI también hubo advertencias tempranas. En 2020 Jack Clark, entonces director de políticas y hoy cofundador de Anthropic, envió un informe a Sam Altman y Greg Brockman alertando que el trabajo en los modelos podría llevar a “sustituir el trabajo de las personas que definen la cultura de la sociedad”. Más adelante, otros empleados de OpenAI expresaron preocupaciones similares: Nick Turley calificó la IA como una “amenaza existencial” para el periodismo en junio de 2023 y, posteriormente, señaló que “Los productos de IA son en gran medida sustitutivos, punto”.
Los documentos incluyen además comunicaciones más operativas: abogados de los medios demandantes sostienen que OpenAI desplegó herramientas para sortear muros de pago. Entre los archivos figura un mensaje de Greg Brockman celebrando que un empleado hubiera creado “un truco para sortear el muro de pago de The New York Times”. Microsoft, por su parte, no negó el debate interno: Satya Nadella declaró en uno de los documentos que “cualquier cosa que esté restringida por un muro de pago debería estar sujeta a licencia para cualquiera que quiera usarla” y afirmó que, si hubiera sabido que OpenAI había extraído y entrenado información detrás de un muro de pago, les habría exigido que reentrenaran los modelos.
Implicaciones legales y éticas
Los documentos aumentan la complejidad del caso legal porque muestran que los responsables tenían conciencia de la naturaleza y el alcance del uso de contenido protegido. No es solo una cuestión técnica —usar texto para entrenar redes— sino una cuestión de derecho a la propiedad intelectual, contratos con suscriptores y los modelos de negocio del periodismo.
Ética e IA se cruzan aquí: hay un debate sobre si la recolección masiva de contenidos públicos y pagos para alimentar modelos sin pagar a sus creadores es justificable por motivos de innovación o si constituye una apropiación injusta del trabajo ajeno. Los archivos sugieren que, más allá de la discusión teórica, hubo acciones concretas para obtener acceso a contenidos restringidos.
El impacto real sobre el periodismo
Los ejecutivos y técnicos que redactaron esos documentos no solo temían la pérdida de ingresos, sino una transformación profunda del consumo de noticias. Desde la perspectiva técnica, los modelos de lenguaje pueden producir resúmenes o respuestas que sustituyen la visita a la nota original. Un ingeniero de OpenAI señaló en 2023 que aunque los modelos incluyan enlaces o citas, los usuarios no necesariamente harán clic en ellos. Conforme los chatbots se convirtieron en herramientas de búsqueda y descubrimiento, los resúmenes automáticos empezaron a restar visitas a los sitios originales: los resultados de búsqueda enriquecidos con resúmenes de IA provocaron caídas significativas en el tráfico para algunos editoriales, con “caídas de más del 50% en el tráfico en algunos casos”, según los documentos.
Esto pone en riesgo dos vías fundamentales para financiar el periodismo digital: la publicidad basada en tráfico y las suscripciones. Si los usuarios obtienen información directamente desde una IA sin redirigirse al sitio del medio, el ecosistema económico que sostiene la producción periodística se debilita.
Relevancia para América Latina
Aunque los documentos se centran en grandes actores internacionales y en el New York Times, las consecuencias potenciales son relevantes para América Latina. En la región coexisten medios con modelos de suscripción emergentes y una amplia diversidad de contenidos locales que ya enfrentan presión por la concentración publicitaria y la caída de ingresos tradicionales.
Para medios latinoamericanos, la llegada de resúmenes de IA y la reutilización de contenidos sin compensación podrían replicar los mismos efectos: pérdida de tráfico, menor alcance de las suscripciones y dificultades para sostener salas de redacción que, en muchos casos, ya operan con recursos limitados. Además, la extracción masiva de contenido local para entrenar modelos con fines comerciales plantea preguntas sobre quién se beneficia de la inteligencia que aprende de trabajos periodísticos producidos en la región.
Posibles escenarios y decisiones estratégicas
Los documentos y la demanda abren varias rutas:
-
Litigio y acuerdos: las demandas pueden terminar en acuerdos que establezcan licencias y compensaciones para los medios, o en sentencias que marquen precedentes sobre el uso de contenido protegido para entrenar modelos.
-
Políticas de licencia y API: empresas que proveen modelos podrían desarrollar mecanismos de licenciamiento más explícitos para contenidos detrás de muros de pago, o filtros técnicos para evitar el scraping de sitios protegidos.
-
Nuevos modelos de negocio para medios: los editores podrían priorizar formatos que las IAs no reproduzcan fácilmente (investigación original, periodismo de datos, experiencias multimediales) o negociar licencias por el uso de su contenido.
-
Regulación y estándares: la presión pública y los casos legales pueden impulsar regulaciones sobre extracción de contenidos y derechos de autor aplicados al entrenamiento de IA.
Conclusión
Los documentos desclasificados vinculados a la demanda del New York Times muestran que en 2023 había reconocimiento explícito dentro de Microsoft y OpenAI sobre los riesgos y la práctica de usar prensa, incluso detrás de muros de pago, para entrenar modelos. Las frases contundentes —“el mayor robo laboral de la historia”, “amenaza existencial”— reflejan que no fue una cuestión accidental sino una tensión deliberada entre innovación tecnológica y protección del trabajo periodístico.
Para tomadores de decisión en América Latina, el caso es una señal para acelerar estrategias de protección del contenido, explorar acuerdos de licenciamiento justos y considerar cómo adaptar los modelos de negocio ante una IA que ya no es solo una herramienta de búsqueda, sino un competidor potencial en la distribución de información.
Fuente original: Xataka IA