Il memo interno di Brent Hecht
Nel gennaio 2023 Brent Hecht, capo della divisione Applied Science di Microsoft, ha redatto un memo interno in cui definiva la pratica di “raschiare” il web per alimentare i modelli linguistici “il più grande furto di lavoro della storia umana”. Il documento, rimasto riservato per tre anni, è stato reso pubblico il 17 settembre 2026 grazie alla desecretazione di una serie di atti giudiziari presentati nella causa intentata dal New York Times contro Microsoft e OpenAI.
Dimensioni dei dataset coinvolti
I filing della causa hanno rivelato la portata numerica dei contenuti presi senza licenza. In particolare:
- OpenAI ha incluso nei propri dataset di mid‑training più di 91 692 copie di articoli pubblicati dal New York Times, dal Daily News e dal Center for Investigative Reporting.
- Un dataset derivato da Common Crawl conteneva oltre 2 milioni di documenti provenienti esclusivamente dal dominio nytimes.com.
- Tutti gli articoli erano presenti nella loro interezza, non come estratti o sintesi, e non erano stati compensati né autorizzati dagli editori.
Questi numeri dimostrano che la raccolta non è stata marginale, ma rappresenta una fetta significativa del patrimonio editoriale digitale.
Effetti di Microsoft Copilot sull’editoria
Una presentazione interna di Microsoft del gennaio 2024, anch’essa firmata da Hecht, descriveva l’impatto di Microsoft Copilot sui siti di notizie come un “doom loop”. Il documento evidenziava due dinamiche chiave:
- Il calo del traffico di referral verso i siti di notizie, dovuto alla capacità di Copilot di fornire risposte senza che l’utente visiti le pagine originali.
- Una conseguente riduzione della quantità di dati disponibili sul web, che a sua volta indebolisce le prestazioni future dei modelli AI, creando un circolo vizioso.
I dati interni mostrano che Copilot ha ridotto il tasso di click‑through verso il dominio del New York Times del 93 % rispetto alla ricerca tradizionale su Bing, un risultato senza precedenti per un prodotto commerciale.
Dichiarazioni dei vertici di Microsoft e OpenAI
Il CEO di Microsoft, Satya Nadella, in una deposizione ha affermato che qualsiasi contenuto protetto da paywall dovrebbe essere licenziato prima di essere usato per addestrare modelli AI. Questa posizione è ora usata dagli avvocati del Times per dimostrare la consapevolezza dell’azienda circa la necessità di una licenza.
Parallelamente, il co‑fondatore di OpenAI, Greg Brockman, è citato nei documenti per aver riconosciuto che i prodotti di intelligenza artificiale generativa sono “largamente sostitutivi” delle fonti originali e che tale caratteristica si accentuerà con il miglioramento dei modelli.
Il dibattito sul fair use
La difesa principale di Microsoft e OpenAI si basa sul concetto di fair use, la dottrina americana che consente usi non autorizzati di materiale protetto quando il nuovo utilizzo è trasformativo. Tuttavia, il memo di Hecht afferma che accettare tale difesa renderebbe il concetto di fair use una “presa in giro”. I legali del New York Times sostengono che le dichiarazioni interne “eviscerano” la plausibilità della difesa, poiché dimostrano una consapevole intenzione di sfruttare contenuti senza compenso.
Prospettive legali e impatti futuri
Un giudice federale ha già autorizzato nel 2025 il proseguimento del caso sul merito, e la decisione finale sull’ammissione di queste prove è attesa entro il 2027. Se il tribunale accoglierà le evidenze interne, la sentenza potrebbe creare un precedente difficile da aggirare per tutte le aziende che hanno addestrato modelli su testi web non licenziati.
Il risultato avrà ripercussioni ben oltre la disputa tra il New York Times, Microsoft e OpenAI: editori, piattaforme di aggregazione e start‑up AI dovranno rivedere le proprie pratiche di raccolta dati, potenzialmente investendo in licenze massicce o in nuovi approcci di addestramento che rispettino i diritti d’autore.
Conclusioni
Le rivelazioni dei documenti giudiziari segnano la prima volta in cui i leader dell’industria AI hanno espresso per iscritto una valutazione netta sulla natura del loro operato. Il caso potrebbe determinare il futuro equilibrio tra innovazione tecnologica e tutela del lavoro giornalistico, imponendo una riflessione profonda su come le intelligenze artificiali debbano essere alimentate in modo etico e legale.