Um memorando de julgamento sumário revelado a 17 de setembro de 2026 no processo de direitos de autor que organizações de notícias apresentaram contra a OpenAI e a Microsoft cita documentos internos nos quais um executivo da Microsoft descreveu o scraping de notícias para treino de IA como "um roubo assombroso de proporções sem precedentes", e nos quais o responsável do ChatGPT da OpenAI afirmou que os editores enfrentam uma "ameaça existencial".
O documento é o memorando conjunto de julgamento sumário dos queixosos jornalísticos em In re OpenAI, Inc., Copyright Infringement Litigation, MDL No. 1:25-md-3143 (SHS) (OTW), apresentado no Tribunal Distrital dos Estados Unidos para o Distrito Sul de Nova Iorque a 17 de setembro e com 92 páginas. Entre os queixosos estão o The New York Times, os títulos do New York Daily News, o Center for Investigative Reporting e a Ziff Davis. Pedem ao tribunal que decida antes do julgamento que as duas empresas violaram os seus direitos de autor em três fases: aquisição de artigos, treino de modelos com eles e, no caso da Microsoft, utilização de cópias recuperadas para fundamentar as respostas do chatbot.
O que o memorando coloca nos autos
O diretor de ciência aplicada da Microsoft, Dr. Brent Hecht, escreveu num memorando de janeiro de 2023 que o scraping de notícias para treino era "um roubo assombroso de proporções sem precedentes" e talvez "o maior roubo de trabalho da história humana", segundo o documento. Disse também, argumentam os queixosos, que essa prática "ridicularizaria por completo a ideia de uso justo" — a doutrina em que ambas as empresas baseiam a sua defesa do treino sem licença.
O responsável do ChatGPT da OpenAI, Nick Turley, é citado a escrever que os editores enfrentam uma "ameaça existencial" por parte de produtos que são "em grande medida substitutos, ponto final" e que "se tornarão cada vez mais substitutos à medida que melhorarem". Um documento interno da Microsoft foi mais longe, descrevendo um "ciclo da perdição": "É altamente invulgar que um produto final ameace os fundamentos económicos dos seus fornecedores essenciais, mas é essa a situação que criámos para o nosso negócio de LLM no que respeita à sua cadeia de abastecimento de conteúdos."
O memorando cita ainda o cofundador e presidente da OpenAI, Greg Brockman, que escreveu que os modelos eram "excelentes em notícias" e respondeu "ah, que bom" quando um investigador, Nick Ryder, lhe falou do que descreveu como um truque para contornar o paywall do Times. O diretor-executivo da Microsoft, Satya Nadella, declarou numa deposição que "tudo o que está atrás de um paywall deve ser licenciado" para fundamentação ou treino, e concordou que os chatbots substituíram os utilizadores que iam à fonte original.
A base de tráfego e as contagens dos conjuntos de dados
Os números de cliques vêm dos próprios dados da Microsoft, comparando o seu "motor de respostas" Copilot com a pesquisa tradicional do Bing: uma queda de 87 a 93 percent para o Times, de 83 a 91 percent para os títulos do Daily News e de 51 a 94 percent para a ZD.
Quanto à escala, o documento afirma que os conjuntos de dados de treino intermédio da OpenAI contêm mais de 91,692 cópias das obras dos queixosos; que um conjunto de dados reunido no âmbito de um programa Microsoft-OpenAI chamado Project Mango contém cópias de pelo menos 160,903 obras únicas; e que um New York Times Annotated Corpus obtido a terceiros continha mais de 1.8 million artigos publicados entre janeiro de 1987 e junho de 2007, sob uma licença limitada a investigação não comercial. Um conjunto do Common Crawl pós-filtrado utilizado para treino continha 2,064,805 itens do nytimes.com, segundo o memorando.
Porque é que isto importa
O uso justo depende em parte de saber se a cópia substitui a obra original. Os queixosos argumentam que as citações e os dados de tráfego mostram substituição, e que os mercados de licenciamento que as empresas poderiam ter usado foram ultrapassados; pedem danos legais por cada artigo violado. Se o tribunal reconhecer responsabilidade, a questão do que os programadores de IA devem pagar pelos conteúdos noticiosos passa da negociação para o risco jurídico de todos os modelos treinados com dados de editores.
O que o documento não estabelece
Vale a pena ter presentes dois limites. Primeiro, as descrições acima vêm do memorando dos queixosos, que cita os documentos internos em excertos e não na íntegra, e ambas as empresas contestam a forma como devem ser lidos. Segundo, não foi emitida qualquer decisão, e o pedido é deliberadamente restrito: os queixosos pedem uma decisão apenas quanto a obras cujos resultados mostram uma vasta sobreposição literal, deixando as restantes pretensões para julgamento.
A Microsoft reagiu, dizendo que os documentos da autoria de Hecht "refletem a perspetiva individual de um funcionário, não constituem uma análise jurídica e não representam as opiniões da empresa", e que os seus produtos são um uso justo transformador que não substitui os sites de notícias. A OpenAI não respondeu de imediato ao pedido de comentário da Ars Technica. Steven Lieberman, advogado do New York Daily News e de sete jornais irmãos, afirmou que o material agora visível mostra que "a OpenAI e a Microsoft sabiam que o que estavam a fazer era errado".
Fontes