Cosa abbiamo osservato

Nel corso di luglio abbiamo rilevato operatori che tentavano di estrarre il ragionamento protetto dei modelli in modi inediti, ad esempio copiando il ragionamento criptato da una conversazione e chiedendo a un modello in un’altra conversazione di decifrarlo e trascriverlo. Questo approccio non rompeva la crittografia né comprometteva i database, ma manipolava le interazioni in modo da rendere visibile al richiedente il contenuto nascosto, violando i termini di servizio in maniera coordinata e su larga scala.

Ricercatori di sicurezza indipendenti hanno segnalato vulnerabilità correlate di “compattazione” tra modelli e conversazioni, presentate in un pre‑print su arXiv. Dopo aver verificato le loro scoperte, abbiamo confermato che i percorsi d’attacco descritti erano reali e hanno accelerato l’implementazione delle mitigazioni.

L’attività è partita il 1° luglio, con un volume iniziale basso, per poi registrare picchi significativi il 24 e il 25 luglio: più di 16 000 richieste con pattern di estrazione rilevanti, provenienti da oltre 4 000 utenti. Un’analisi successiva ha evidenziato un cluster correlato di oltre 15 000 utenti, completamente interrotto entro il 28 luglio.

L’evoluzione della campagna dimostra che la distillazione avversaria è una sfida di sicurezza più ampia, che richiede difese stratificate e adattive.

Valutazione dell’attribuzione

Non è ancora chiaro se tutti gli operatori osservati appartengano a un unico attore. Tuttavia, attribuiamo un nucleo centrale dell’attività a individui associati a Moonshot AI, lo sviluppatore di Kimi.

Perché è importante

La distillazione avversaria comporta rischi per la sicurezza e la sicurezza nazionale. Il ragionamento estratto può essere usato per addestrare un nuovo modello senza conservare le salvaguardie applicate alle risposte visibili agli utenti. Su larga scala, la distillazione accelera il trasferimento di capacità avanzate senza richiedere lo stesso investimento in misure di sicurezza, un problema particolarmente critico nei settori a doppio uso.

Questo rischio non è esclusivo di OpenAI: le tecniche analoghe potrebbero colpire altri sistemi di IA avanzata, rendendo la questione una sfida condivisa che necessita di coordinamento industriale.

Come abbiamo risposto

Abbiamo contrastato la campagna di distillazione attraverso una combinazione di azioni su account, controlli tecnici e coordinamento con i partner. Le misure includono:

    • Blocco o restrizione di account fraudolenti;
    • Rinforzo dei controlli di registrazione e dell’infrastruttura;
    • Espansione del monitoraggio per reti correlate.

Inoltre, abbiamo potenziato le protezioni per il ragionamento nascosto su utenti, spazi di lavoro, organizzazioni e famiglie di modelli. Abbiamo chiuso un percorso che permetteva a chi possedeva il ragionamento criptato di un altro utente di riprodurlo e recuperarne il contenuto, aggiungendo controlli per rilevare e trattenere output in streaming potenzialmente esposti.

Quando l’attività è passata attraverso servizi di terze parti, abbiamo collaborato con i fornitori per identificare e disattivare gli account coinvolti.

Infine, abbiamo condiviso i risultati rilevanti tramite il Frontier Model Forum e canali governativi di condivisione delle informazioni, consentendo a sviluppatori di frontiera e partner pubblici di cercare attività simili e rafforzare le proprie difese. I sistemi che supportano artefatti di ragionamento portabili o riproducibili possono affrontare rischi analoghi.

Cosa ci aspettiamo in futuro

Prevediamo che i tentativi di distillazione avversaria diventeranno più sofisticati man mano che i modelli di frontiera migliorano e gli attori cercano metodi più economici per imitare le loro capacità. La difesa richiederà controlli a più livelli e un adattamento continuo.

Il lavoro non è concluso. Le distribuzioni ospitate da partner necessitano delle stesse protezioni dei servizi di prima parte, e gli attacchi basati su output di strumenti richiedono difese che esaminino più del semplice testo visibile. Continueremo a migliorare le difese contro gli strumenti, la copertura dei classificatori, i rifiuti del modello e a propagare i controlli pertinenti tra i partner cloud.

Le nostre future azioni si concentreranno su tre aree chiave:

    • Rafforzare le protezioni tecniche contro l’estrazione;
    • Migliorare la rilevazione e l’applicazione di sanzioni contro campagne coordinate;
    • Ampliare la condivisione di informazioni sulle minacce con industria e governo.