Che cos’è il marchio d’acqua Textgrain

OpenAI ha sviluppato un marchio d’acqua digitale, chiamato Textgrain, per rendere più trasparente la provenienza dei contenuti generati da grandi modelli linguistici (LLM). Il meccanismo è progettato per essere invisibile ai lettori umani, ma rilevabile da software specifici che analizzano la probabilità statistica di certe sequenze di parole.

Implementazione limitata all’Unione europea

Contrariamente a quanto fa Anthropic, OpenAI non renderà il marchio d’acqua una funzione di default. Nei prossimi settimane Textgrain sarà integrato in ChatGPT e nel modello di programmazione Codex esclusivamente per gli utenti situati all’interno dell’Unione europea. Gli abbonati che accedono ai modelli tramite le API potranno utilizzare Textgrain a livello mondiale, ma dovranno attivarlo manualmente, anche per le richieste provenienti dall’UE.

Accesso al sistema di rilevazione

All’inizio, l’accesso a uno strumento di rilevazione del marchio d’acqua sarà riservato a ricercatori e organizzazioni selezionate, che dovranno fare domanda per partecipare. L’obiettivo è valutare l’efficacia di Textgrain e contribuire al suo miglioramento, con l’eventuale intenzione di rilasciare il codice come Open Source in futuro.

Come funziona il marchio d’acqua

Il principio alla base di Textgrain è la manipolazione della probabilità statistica di utilizzo di parole specifiche. Nei testi lunghi, questa manipolazione crea un “segno” che può essere scoperto da algoritmi dedicati. Con testi brevi la tecnica è meno efficace, e possono verificarsi falsi positivi.

Performance di rilevamento per diversi tipi di testo

    • Testi di psicologia (200 token): rilevamento nel 78,5 % dei casi.
    • Testi di psicologia (300 token): rilevamento nel 89,7 % dei casi.
    • Testi di psicologia (400 token): rilevamento nel 94,3 % dei casi.
    • Testi matematici (200 token): rilevamento nel 36,5 % dei casi.
    • Testi matematici (300 token): rilevamento nel 52 % dei casi.
    • Testi matematici (400 token): rilevamento nel 60,8 % dei casi.

Le differenze dipendono dalla flessibilità lessicale: i testi specialistici, come quelli matematici, offrono meno libertà nella scelta delle parole, riducendo così la capacità del marchio d’acqua di inserirsi senza alterare il contenuto.

Limiti e possibilità di elusione

Il marchio d’acqua non consente di ricostruire l’identità dell’utente che ha generato il testo, né indica la percentuale di contenuto umano o la veridicità delle informazioni. Inoltre, l’assenza di Textgrain non prova automaticamente che il testo sia di origine umana: potrebbe trattarsi di un modello di un altro fornitore o di un fallimento del sistema di rilevazione.

Esistono anche tecniche per “oscurare” il marchio d’acqua. La traduzione, il mescolamento con testi esterni o la sostituzione di parole con sinonimi possono ridurre drasticamente la probabilità di individuazione. Ad esempio, sostituendo ogni decimo parola con un sinonimo, la rilevazione scende dal 92 % al 66 %; se si cambia ogni quarto, la percentuale scende a appena il 17 %.

Impatto sulla qualità del testo

Secondo OpenAI, l’inserimento di Textgrain ha un impatto minimo sulla fluidità e sulla coerenza del contenuto. Il modello continua a generare risposte naturali, poiché la manipolazione statistica avviene a livello di micro‑scelte lessicali, invisibili al lettore.

Prospettive future

L’obiettivo a lungo termine di OpenAI è rendere Textgrain uno strumento aperto, contribuendo a un ecosistema più trasparente per l’uso dell’intelligenza artificiale generativa. Nel contesto dell’AI Act, il marchio d’acqua rappresenta una risposta concreta alle richieste di tracciabilità, ma la sua limitata distribuzione geografica solleva interrogativi sulla coerenza normativa tra i mercati.