OpenAI aveva sostenuto che non era in grado di analizzare i propri dataset d’allenamento per rispettare le richieste del tribunale. Una deposizione obbligata ad aprile ha però rivelato nuovi dettagli: Vinnie Monaco, ingegnere responsabile della protezione dei dati in OpenAI, ha ammesso che l’azienda aveva già condotto ricerche interne sui propri corpus per trovare contenuti protetti provenienti da testate giornalistiche.

78 milioni di conversazioni e uno strumento interno chiamato Project Giraffe

Secondo le rivelazioni emerse, ben prima che il New York Times presentasse la sua causa legale a fine 2023, OpenAI aveva già raccolto una base di 78 milioni di conversazioni anonime di ChatGPT. Questa base era utilizzata per valutare in maniera interna il livello di riproduzione di contenuti protetti. Subito dopo la presentazione della causa, OpenAI ha lanciato il Project Giraffe, al cui interno è stato sviluppato un filtro denominato Bloom.

Il sistema Bloom aveva lo scopo di rilevare e registrare quando ChatGPT replicava contenuti presenti all’interno delle sue risposte. I media intenti in causa avevano chiesto l'accesso a 120 milioni di log. OpenAI, però, ha negoziato per ridurre questa richiesta a 20 milioni, che è stata finalmente trasmessa al tribunale a dicembre.

Billioni di risposte cancellate dopo la presentazione della causa

Gli editori coinvolti nella causa accusano OpenAI di aver cancellato centinaia di miliardi di risposte di ChatGPT dopo l’inizio del processo. Questo sarebbe avvenuto nonostante un’ordinanza del tribunale che richiedeva l’archiviazione di tutte le prove. Inoltre, si afferma che l’azienda abbia sostituito milioni di log richiesti con dati diversi.

I legali, e in particolare Ian B. Crosby, avvocato principale dei pùrtori, sottolineano che se OpenAI veramente ritenesse legale copiare il lavoro dei propri clienti, non avrebbe nascosto le prove. Questa strategia sembra indicare l’intenzione di nascondere la reale portata del problema.

OpenAI fa riferimento alla privacy degli utenti

Drew Pusateri, portavoce di OpenAI, ha respinto le accuse. L'azienda difende la propria posizione affermando che il caso del New York Times abbia perso di forza e che i media cerchino di ottenere informazioni su conversazioni non rilevanti per il processo. La posizione di OpenAI, rafforzata da una logica di diritto di parola (fair use), è supportata anche dal rispetto della privacy degli utenti.

Il New York Times, tuttavia, ha già investito oltre 28 milioni di dollari in costi legali per questa causa e per un’altra contro Perplexity. Il punto chiave rimane il fatto che OpenAI, nonostante la sua tesi del fair use, ostacola continuamente i tribunali nell’accesso ai dati che documentano l’effettivo utilizzo di contenuti protetti.

Un confronto strategico con Anthropic

Nel frattempo, Anthropic ha scelto un percorso diverso. L’azienda, per chiudere un altro processo legale sull’utilizzo di testi per l’addestramento, ha accettato di versare 1,5 miliardi di dollari agli autori interessati. La differenza di approccio tra OpenAI, da un lato, e Anthropic, dall'altro, evidenzia una forte divisione sulle strategie di gestione della proprietà intellettuale e dell'azione legale.