Il red-teaming è essenziale per individuare le vulnerabilità e migliorare la robustezza dei nostri modelli, ma le attuali approcci non sono scalabili, creando un collo di bottiglia.

Evaluations comuni di robustezza hanno già saturato i nostri modelli più recenti.

Dobbiamo sviluppare metodi che permettano alla sicurezza e allineamento dei modelli di crescere insieme alle loro capacità.

Siamo arrivati a un risultato importante: GPT-Red, modello di red-teaming automatizzato che scala la capacità di individuare vulnerabilità, permettendoci di correggerle prima del deploy.

GPT-Red è un red-teamer potente e i modelli precedenti sono estremamente vulnerabili alle sue iniezioni.

Utilizziamo GPT-Red per addestrare in modo avverso GPT-5.6, rendendolo molto più robusto.

Pianificheremo di espandere questa strategia insieme al red-teaming umano, a protezioni aggiuntive e monitoraggio in tempo reale.

Un problema con il red-teaming

Gli utenti spesso eseguono compiti su modelli AI utilizzando strumenti terzi come browser, app connesse, file locali e altri strumenti. Questi vantaggi sono necessari per svolgere compiti reali ma aprono anche la porta a manomissioni di terze parti.

Un esempio pratico è quando un attore malintenzionato inserisce una precisa istruzione ingannevole per far caricare dati sensibili su un server esterno.

Il red-teaming umano si concentra sull'aiutarci a trovare queste vulnerabilità per mettere in atto misure protettive. Tuttavia, il red-teaming non si scala facilmente e richiede molto tempo.

La creazione e gestione di tali esercitazioni richiede lavoro manuale significativo, limitando la velocità con cui possiamo trovare nuove mode di fallimento e migliorare i modelli.

Per mantenere il ritmo con i modelli sempre più potenti, abbiamo addestrato modelli interni e automatizzati per red-teaming, che rilevano vulnerabilità e generano attacchi durante l'addestramento per aumentare la robustezza.

Crediamo che il red-teaming automatizzato apra una forma cruciale di miglioramento autonomo per la sicurezza: utilizzare i modelli esistenti per rendere i futuri modelli più sicuri.

GPT-Red rappresenta questi sforzi. Simile ai red-teamer umani, GPT-Red lavora per un obiettivo proponendo prompt, osservando le risposte dei modelli e migliorandoli iterativamente.

GPT-Red è addestrato a livello calcolistico paragonabile a uno dei nostri addestramenti post addestrarci più grandi, un livello inedito dedicato esclusivamente alla sicurezza.

Lo integreremo direttamente nel processo di addestramento dei nostri modelli di produzione. Come risultato, GPT-5.6 è il nostro modello più resistente, con un 600% in meno di fallimenti rispetto al nostro modello migliore solo quattro mesi fa su test di iniezione diretti.

Attacchi di GPT-Red

Il red-teaming di GPT-Red avviene tramite addestramento di auto-giocare, dove il modello e una selezione di Diversi LLM difensori sono allenati in parallelo su una vasta serie di scenari.

GPT-Red viene premiato per generare fallimenti validi, ad esempio iniezioni, mentre i modelli difensori sono ricompensati per resistere attacchi.

Costruiamo una serie di scenari realistici dove potrebbero essere inserite iniezioni.

Ogni ambiente include una minaccia specifica, ad esempio GPT-Red potrebbe controllare parti di un file locale.

Alla fine del suo allenamento, GPT-Red è un attaccante molto forte, rompendo quasi tutti i modelli contro i quali viene testato.

Usiamo GPT-Red per generare iniezioni di prompt per l'addestramento di GPT-5.6, rendendolo estremamente resistente agli attacchi.

Separiamo il modello GPT-Red da quelli che utilizziamo per il servizio, per evitare che le sue capacità dannose vengano utilizzate da attori malintenzionati.

Confronto con altri modelli

GPT-Red è estremamente efficace contro i modelli e situazioni di difesa.

Lo testiamo anche per verificare se è un efficace red-teamer generico all'interno di OpenAI.

Un confronto con umani in un ambiente riprodotto ha mostrato che GPT-Red riesce in 84% dei casi.

Usiamo una versione interna dell'arena di iniezioni indirette realizzata da Dziemian.

GPT-Red presenta tassi di successo molto superiori alle squadre umane.

Casi reali di red-teaming

Un test pratico su agenti autonomi ha coinvolto un distributore automatico gestito da AI.

GPT-Red ha cambiato i prezzi di prodotti in stock a 0.50 dollari e ha annullato ordini di terzi.

Inoltre, abbiamo testato GPT-Red su scenari di fuoriuscita di dati in agenti basati su GPT-5.4 Mini.

GPT-Red ha superato test in 10 scenari diversi in modo più efficiente rispetto ad un modello standard.

Applicazioni pratiche di GPT-Red

L'obiettivo finale di GPT-Red è migliorare la robustezza dei modelli.

Con la possibilità di addestrare autonomamente i modelli, ci auguriamo risultati sempre più forti.

Grazie a GPT-Red, i modelli diventano più robusti grazie alla resistenza alle iniezioni automatizzate.

Il modello ci permette di anticipare potenziali problemi e risolverli prima dell'adottazione globale.

Continueremo a espandere questo approccio e ad integrarlo con tecnologie di sicurezza aggiuntive.