Introduzione allo studio di Graphite

Una recente ricerca condotta da Graphite, società di marketing specializzata in analisi dei contenuti digitali, ha individuato più di 13.000 tic linguistici caratteristici dei testi prodotti dai più avanzati modelli di intelligenza artificiale. L’obiettivo era capire quali elementi stilistici differenziano una scrittura umana da quella di una macchina, fornendo così un metodo pratico per riconoscere contenuti generati dall’AI.

Metodologia di raccolta dati

Graphite ha selezionato 10.000 articoli pubblicati prima dell’avvento di ChatGPT, garantendo così una base di testi esclusivamente umani. Successivamente, i modelli di IA sono stati alimentati solo con i riassunti degli articoli e invitati a riscriverli da zero, evitando il rischio di plagio diretto. Le due collezioni – quella originale e quella rigenerata – sono state quindi confrontate parola per parola, conteggiando la frequenza di ogni espressione.

I tic più evidenti di Claude Opus 5.5

Il modello Claude Opus 5.5 si distingue per l’uso ripetuto di alcune frasi e termini. Tra i più ricorrenti troviamo:

    • “this matters” – 116 volte più frequente nei testi dell’AI rispetto a quelli umani;
    • “why X matters” – comparsa 92 volte più alta;
    • “dependable” (affidabile) – 23 volte più frequente.

Il modello ha inoltre modificato la classica costruzione “non è X, è Y” in “è più di una X, è una Y”, mantenendo sostanzialmente la stessa logica ma con una variazione lessicale.

Astra di OpenAI: prudenza e formule di copertura

Il modello Astra, sviluppato da OpenAI, adotta uno stile più cauto. Predilige espressioni come “può offrire” o “potrebbe fornire”, evitando affermazioni definitive. Inoltre, è incline a correggere errori inesistenti, introducendo frasi del tipo “un argomento non è semplicemente X” o “si suggerisce di fare una cosa invece di affidarsi a X”. Queste costruzioni compaiono più di 100 volte più spesso nei testi dell’AI rispetto a quelli umani.

Il trattino lungo e altre correzioni stilistiche

Un altro elemento monitorato è l’uso del trattino lungo (—). In passato, molti modelli lo impiegavano in maniera eccessiva, rendendo i testi poco naturali. Oggi, però, le versioni più recenti hanno drasticamente ridotto il suo utilizzo:

    • Claude Opus 5.5 utilizza il trattino lungo il 99 % in meno rispetto alla sua versione precedente;
    • Astra lo impiega l’88 % in meno rispetto ai campioni umani;
    • Gemini 3.1 Pro lo ha quasi eliminato del tutto.

Nonostante questi miglioramenti, Graphite sottolinea che il numero totale di tic rimane sostanzialmente invariato: eliminando alcuni vizi, ne emergono altri nuovi.

Evoluzione divergente di Claude e GPT

Secondo Greg Druck, chief AI officer di Graphite, i modelli Claude e GPT stanno percorrendo strade opposte. I modelli della famiglia Claude tendono a avvicinarsi sempre più al linguaggio umano, sia nella scelta che nella frequenza delle parole. Al contrario, i modelli GPT mostrano una tendenza a allontanarsi dalla distribuzione linguistica tipica degli esseri umani, rendendo i loro testi più riconoscibili come generati da una macchina.

Promesse dei laboratori e realtà dei test

Le aziende produttrici di IA proclamano continui miglioramenti: Anthropic afferma che Opus 5.5 comunica in modo più naturale, mentre OpenAI promette con GPT‑6 versioni “più chiare, meno gergo e meno giri di parole strani”. Tuttavia, Druck rimane scettico, osservando che i test effettuati sui modelli giganteschi – con miliardi di parametri – sono inevitabilmente limitati e che “qualcosa scappa sempre”.

Conclusioni e implicazioni pratiche

Lo studio di Graphite offre un quadro dettagliato dei tic linguistici che possono fungere da “impronte digitali” dell’intelligenza artificiale. Conoscere questi pattern permette a giornalisti, ricercatori e piattaforme di verifica dei fatti di identificare più rapidamente contenuti non umani, migliorando la trasparenza dell’ecosistema informativo. Allo stesso tempo, la continua evoluzione dei modelli suggerisce che la “caccia ai tic” sarà una sfida dinamica, richiedendo aggiornamenti costanti delle metodologie di rilevazione.