Un escrito de resumen juicio desellado el 17 de septiembre de 2026 en el caso de derechos de autor que organizaciones de noticias presentaron contra OpenAI y Microsoft cita documentos internos en los que un ejecutivo de Microsoft describió el scraping de noticias para entrenamiento de IA como "an astonishing theft of unprecedented proportions", y en los que el responsable de ChatGPT de OpenAI dijo que los editores enfrentan una "existential threat".
El documento es el escrito conjunto de resumen juicio de los demandantes de medios en In re OpenAI, Inc., Copyright Infringement Litigation, MDL No. 1:25-md-3143 (SHS) (OTW), presentado en el Tribunal de Distrito de los Estados Unidos para el Distrito Sur de Nueva York el 17 de septiembre y de 92 páginas. Los demandantes incluyen The New York Times, los títulos del New York Daily News, el Center for Investigative Reporting y Ziff Davis. Piden al tribunal que dictamine antes del juicio que las dos compañías infringieron sus derechos de autor en tres etapas: adquirir artículos, entrenar modelos con ellos y, en el caso de Microsoft, usar copias recuperadas para fundamentar las respuestas del chatbot.
Qué pone el escrito en el expediente
El director de ciencia aplicada de Microsoft, el Dr. Brent Hecht, escribió en un memorando de enero de 2023 que el scraping de noticias para entrenamiento era "an astonishing theft of unprecedented proportions" y quizá "the largest theft of labor in human history", según el escrito. También dijo, sostienen los demandantes, que la práctica "make a complete mockery of the idea of fair use", la doctrina en la que ambas compañías basan su defensa del entrenamiento sin licencia.
El responsable de ChatGPT de OpenAI, Nick Turley, es citado escribiendo que los editores enfrentan una "existential threat" por parte de productos que son "largely substitutive, period" y que "will get more and more substitutive as they get better". Un documento interno de Microsoft fue más lejos y describió un "doom loop": "It is highly unusual that an end-product threatens the economic foundations of its essential suppliers, but that is the situation we have created for our LLM business with respect to its content supply chain."
El escrito también cita al cofundador y presidente de OpenAI, Greg Brockman, quien escribió que los modelos eran "excellent at news" y respondió "ah nice" cuando un investigador, Nick Ryder, le contó lo que describió como un truco para eludir el muro de pago del Times. El consejero delegado de Microsoft, Satya Nadella, declaró en una deposición que "anything that is paywalled should be licensed" para fundamentar respuestas o entrenar, y coincidió en que los chatbots han sustituido a los usuarios que iban a la fuente original.
La base de tráfico y los recuentos de conjuntos de datos
Las cifras de clics provienen de datos de la propia Microsoft, que comparan su "answer engine" Copilot con la búsqueda tradicional de Bing: una caída del 87 al 93 por ciento para The Times, del 83 al 91 por ciento para los títulos del Daily News y del 51 al 94 por ciento para ZD.
En cuanto a la escala, el escrito afirma que los conjuntos de datos de entrenamiento intermedio de OpenAI contienen más de 91.692 copias de las obras de los demandantes; que un conjunto de datos reunido bajo un programa de Microsoft-OpenAI llamado Project Mango contiene copias de al menos 160.903 obras únicas; y que un New York Times Annotated Corpus obtenido de un tercero contenía más de 1,8 millones de artículos publicados entre enero de 1987 y junio de 2007, bajo una licencia limitada a la investigación no comercial. Un conjunto de Common Crawl post-filtrado usado para entrenamiento contenía 2.064.805 elementos de nytimes.com, dice el escrito.
Por qué importa
El fair use depende en parte de si la copia sustituye a la obra original. Los demandantes sostienen que las citas y los datos de tráfico muestran sustitución, y que los mercados de licencias que las compañías podrían haber usado en su lugar quedaron desplazados; buscan daños estatutarios por cada artículo infringido. Si el tribunal declara la responsabilidad, la cuestión de cuánto deben pagar los desarrolladores de IA por el contenido de noticias pasa de la negociación al riesgo legal para todo modelo entrenado con datos de editores.
Lo que el escrito no establece
Vale la pena tener presentes dos límites. Primero, las descripciones anteriores provienen del escrito de los demandantes, que cita los documentos internos como extractos y no de forma completa, y ambas compañías disputan cómo deben leerse. Segundo, no se ha emitido ninguna resolución, y la moción es deliberadamente limitada: los demandantes buscan sentencia solo sobre obras cuyos resultados muestran una amplia coincidencia literal, dejando sus restantes reclamaciones para el juicio.
Microsoft respondió diciendo que los documentos redactados por Hecht "reflect one employee's individual perspective, are not a legal analysis, and do not represent the company's views", y que sus productos son un fair use transformativo que no sustituye a los sitios de noticias. OpenAI no respondió de inmediato a la solicitud de comentarios de Ars Technica. Steven Lieberman, abogado del New York Daily News y siete diarios hermanos, dijo que el material recién visible muestra que "OpenAI and Microsoft knew that what they were doing was wrong".
Fuentes