Il red-teaming è essenziale per individuare le vulnerabilità e migliorare la robustezza dei nostri modelli, ma le attuali approcci non sono scalabili, creando un collo di bottiglia.
Evaluations comuni di robustezza hanno già saturato i nostri modelli più recenti.
Dobbiamo sviluppare metodi che permettano alla sicurezza e allineamento dei modelli di crescere insieme alle loro capacità.
Siamo arrivati a un risultato importante: GPT-Red, modello di red-teaming automatizzato che scala la capacità di individuare vulnerabilità, permettendoci di correggerle prima del deploy.
GPT-Red è un red-teamer potente e i modelli precedenti sono estremamente vulnerabili alle sue iniezioni.
Utilizziamo GPT-Red per addestrare in modo avverso GPT-5.6, rendendolo molto più robusto.
Pianificheremo di espandere questa strategia insieme al red-teaming umano, a protezioni aggiuntive e monitoraggio in tempo reale.
Un problema con il red-teaming
Gli utenti spesso eseguono compiti su modelli AI utilizzando strumenti terzi come browser, app connesse, file locali e altri strumenti. Questi vantaggi sono necessari per svolgere compiti reali ma aprono anche la porta a manomissioni di terze parti.
Un esempio pratico è quando un attore malintenzionato inserisce una precisa istruzione ingannevole per far caricare dati sensibili su un server esterno.
Il red-teaming umano si concentra sull'aiutarci a trovare queste vulnerabilità per mettere in atto misure protettive. Tuttavia, il red-teaming non si scala facilmente e richiede molto tempo.
La creazione e gestione di tali esercitazioni richiede lavoro manuale significativo, limitando la velocità con cui possiamo trovare nuove mode di fallimento e migliorare i modelli.
Per mantenere il ritmo con i modelli sempre più potenti, abbiamo addestrato modelli interni e automatizzati per red-teaming, che rilevano vulnerabilità e generano attacchi durante l'addestramento per aumentare la robustezza.
Crediamo che il red-teaming automatizzato apra una forma cruciale di miglioramento autonomo per la sicurezza: utilizzare i modelli esistenti per rendere i futuri modelli più sicuri.
GPT-Red rappresenta questi sforzi. Simile ai red-teamer umani, GPT-Red lavora per un obiettivo proponendo prompt, osservando le risposte dei modelli e migliorandoli iterativamente.
GPT-Red è addestrato a livello calcolistico paragonabile a uno dei nostri addestramenti post addestrarci più grandi, un livello inedito dedicato esclusivamente alla sicurezza.
Lo integreremo direttamente nel processo di addestramento dei nostri modelli di produzione. Come risultato, GPT-5.6 è il nostro modello più resistente, con un 600% in meno di fallimenti rispetto al nostro modello migliore solo quattro mesi fa su test di iniezione diretti.
Attacchi di GPT-Red
Il red-teaming di GPT-Red avviene tramite addestramento di auto-giocare, dove il modello e una selezione di Diversi LLM difensori sono allenati in parallelo su una vasta serie di scenari.
GPT-Red viene premiato per generare fallimenti validi, ad esempio iniezioni, mentre i modelli difensori sono ricompensati per resistere attacchi.
Costruiamo una serie di scenari realistici dove potrebbero essere inserite iniezioni.
Ogni ambiente include una minaccia specifica, ad esempio GPT-Red potrebbe controllare parti di un file locale.
Alla fine del suo allenamento, GPT-Red è un attaccante molto forte, rompendo quasi tutti i modelli contro i quali viene testato.
Usiamo GPT-Red per generare iniezioni di prompt per l'addestramento di GPT-5.6, rendendolo estremamente resistente agli attacchi.
Separiamo il modello GPT-Red da quelli che utilizziamo per il servizio, per evitare che le sue capacità dannose vengano utilizzate da attori malintenzionati.
Confronto con altri modelli
GPT-Red è estremamente efficace contro i modelli e situazioni di difesa.
Lo testiamo anche per verificare se è un efficace red-teamer generico all'interno di OpenAI.
Un confronto con umani in un ambiente riprodotto ha mostrato che GPT-Red riesce in 84% dei casi.
Usiamo una versione interna dell'arena di iniezioni indirette realizzata da Dziemian.
GPT-Red presenta tassi di successo molto superiori alle squadre umane.
Casi reali di red-teaming
Un test pratico su agenti autonomi ha coinvolto un distributore automatico gestito da AI.
GPT-Red ha cambiato i prezzi di prodotti in stock a 0.50 dollari e ha annullato ordini di terzi.
Inoltre, abbiamo testato GPT-Red su scenari di fuoriuscita di dati in agenti basati su GPT-5.4 Mini.
GPT-Red ha superato test in 10 scenari diversi in modo più efficiente rispetto ad un modello standard.
Applicazioni pratiche di GPT-Red
L'obiettivo finale di GPT-Red è migliorare la robustezza dei modelli.
Con la possibilità di addestrare autonomamente i modelli, ci auguriamo risultati sempre più forti.
Grazie a GPT-Red, i modelli diventano più robusti grazie alla resistenza alle iniezioni automatizzate.
Il modello ci permette di anticipare potenziali problemi e risolverli prima dell'adottazione globale.
Continueremo a espandere questo approccio e ad integrarlo con tecnologie di sicurezza aggiuntive.