Il CEO di Microsoft, Satya Nadella, ha recentemente espresso una forte critica nei confronti dei principali fornitori di intelligenza artificiale (AI), accusandoli di ipocrisia rispetto al modo in cui utilizzano i dati per addestrare i loro modelli. Secondo Nadella, aziende come OpenAI e Anthropic, tra le altre, vietano la cosiddetta destillazione artificiale, un processo in cui modelli più piccoli vengono addestrati replicando il comportamento di modelli più grandi. Tuttavia, lo stesso tipo di pratiche che vietano, vengono utilizzate per ottenere vantaggi competitivi tramite l’accesso a dati pubblici o le interazioni con gli utenti. Il leader di Microsoft ha definito questa contraddizione "ironica" e sottolinea che l’effetto di questi paradossi sta nel trasferire il controllo e il valore economico verso le aziende infrastrutturali piuttosto che verso i soggetti che generano la conoscenza.
Che cos’è la distillazione artificiale?
La distillazione artificiale è un approccio che mira a ridurre le dimensioni di modelli di intelligenza artificiale molto complessi senza compromettere le loro capacità cognitive. In questo processo, un "modello student" viene addestrato a replicare le risposte di un "modello maestro", che è spesso molto più grande e richiede più risorse computazionali. La tecnica è vantaggiosa, soprattutto nei contesti dove l’efficienza e la velocità di risposta sono fondamentali, ad esempio per l’implementazione di modelli su dispositivi mobili o in ambienti con bande limitate. Tuttavia, OpenAI e Anthropic hanno posto restrizioni legali su questa metodologia, spesso citando preoccupazioni per la protezione della proprietà intellettuale.
Secondo Nadella, paradossalmente, queste aziende accedono a grandi quantità di dati pubblici attraverso meccanismi come il "Fair Use", ma rifiutano che i loro modelli vengano addestrati su dati generati in altre modellità. Il tutto accade nonostante la distillazione rappresenti un processo legittimo dal punto di vista tecnico, e spesso un necessario passo verso una maggiore sostenibilità e scalabilità nel campo dell’AI. La situazione risulta paradossale anche in virtù del fatto che i modelli delle stesse aziende che vietano la distillazione imparano da dati generati da milioni di interazioni con utenti, che a loro volta si aspettano un miglioramento dei servizi e un’esperienza più personalizzata.
Il "Paradosso Informativo" secondo Nadella
Nadella descrive questa situazione come un "paradosso informativo invertito", in cui le aziende che generano contenuti e competenze, pagano due volte: una volta a titolo monetario per utilizzare gli strumenti AI, e una volta con il cosiddetto "esaurimento informatico" ("Exhaust"), ovvero i dati generati durante l’interazione con le applicazioni di intelligenza artificiale. Questi dati, come le correzioni, le valutazioni e le risposte degli utenti, rappresentano un bagno significativo di informazioni che può essere utilizzato per addestrare ulteriori modelli AI.
Una visione strategica
Nadella sottolinea che il rischio per gli utenti e per le aziende che utilizzano l’AI sta nel fatto che tali dati potrebbero essere utilizzati per ottenere vantaggi competitivi da parte dei fornitori stessi, che potrebbero sviluppare nuovi modelli o migliorare gli esistenti. Secondo il CEO, è fondamentale che le aziende che generano conoscenza mantengano il controllo del proprio processo di apprendimento, piuttosto che vederlo cedere passivo ad altre entità.
Per fare un esempio concreto, un’azienda che utilizza un'IA per analizzare i propri dati clienti potrebbe non rendersi conto che il sistema sta registrando interazioni e risposte che finiranno per aiutare i concorrenti del fornitore di IA. Questo scenario non è solo problematico per l'equità economica ma anche per la privacy e la proprietà intellettuale.
Proposta di Microsoft
Microsoft vuole prendere una posizione distinta in questo scenario. Secondo Nadella, la compagnia si propone di fornire una struttura chiara per l’apprendimento che permetta alle aziende di mantenere il controllo dei propri dati. Questo include strumenti per gestire in modo autonomo i modelli AI, limitando la raccolta e l'utilizzo di informazioni sensibili da parte dell’infrastruttura sottostante.
Ad esempio, Microsoft sta offrendo alle aziende strumenti come Azure AI Studio e lo stack M365, che consentono di personalizzare i modelli di AI senza richiedere l’accesso diretto ai dati dell’azienda. Questi strumenti permettono di mantenere la privacy e il controllo sull’architettura decisionale, permettendo di personalizzare i modelli AI rispetto alle esigenze specifiche dell’azienda.
Riflessione finale
La critica di Nadella pone il tema al di là della tecnologia, concentrandosi su questioni etiche, legali e commerciali fondamentali nell'era dell’intelligenza artificiale. Se da un lato la distillazione artificiale offre una strada per modelli più efficienti, dall’altro rappresenta un rischio se non vengono gestite adeguate politiche di trasparenza e controllo da parte degli utilizzatori.
Per le aziende che vedono l’AI come un fattore centrale competitivo, il rischio di rimanere in balia di fornitori esterni che gestiscono interamente l’infrastruttura diventa reale. Il modello di Microsoft, se si rivelerà convincente, potrebbe rappresentare una via alternativa per evitare paradossi simili, garantendo più autonomia e sicurezza.
In un mercato in cui l’innovazione è cruciale, la questione del controllo sui dati e sugli algoritmi diventa una priorità non solo tecnica, ma strategica, per chi cerca di costruire prodotti sostenibili nel lungo termine.