Introduzione

Negli ultimi anni, le aziende dietro i principali modelli di intelligenza artificiale, come OpenAI e Anthropic, hanno investito enormi risorse per ridurre i modelli ricorrenti tipici dei loro sistemi. Nonostante i progressi, gli studiosi hanno scoperto che permangono “frasi preferite” che tradiscono la provenienza artificiale dei testi. Questo articolo riporta i risultati della ricerca condotta da Graphite Growth, evidenziando le espressioni più frequenti e i cambiamenti osservati nelle versioni più recenti di ChatGPT e Claude.

Metodo di studio

Gli esperti hanno analizzato le abitudini di scrittura di modelli di punta confrontandole con una base di controllo umana composta da 10.000 articoli pubblicati prima dell’avvento di ChatGPT. I modelli sono stati incaricati di riscrivere questi articoli a partire da riassunti, permettendo così di confrontare parole e costruzioni sintattiche tra i testi generati dall’IA e quelli umani. Il confronto ha prodotto circa 13.000 frasi che compaiono almeno due volte più spesso nei testi artificiali rispetto a quelli scritti da persone.

Le frasi “preferite” da GPT e Claude

Tra le scoperte più sorprendenti, ogni versione di modello presenta proprie preferenze linguistiche. Alcuni esempi significativi includono:

    • Claude Opus 5.5 utilizza la parola “affidabile” 23 volte più spesso rispetto ai testi umani.
    • Il modello GPT‑6 Astra tende a descrivere gli argomenti con la formula “una ulteriore dimensione”.
    • Entrambi i modelli mostrano una predilezione per le costruzioni correttive, come “non semplicemente X” o “invece di affidarsi a X”.

Queste costruzioni compaiono circa 100 volte più frequentemente nei testi IA rispetto a quelli umani, fornendo un chiaro indizio per il riconoscimento.

Il caso del trattino (–)

Il trattino è stato per lungo tempo un “segnale” evidente di testi generati dall’IA. Gli studi hanno dimostrato che i nuovi modelli stanno cercando di eliminarlo:

    • Claude Opus 5.5 riduce l’uso del trattino del 99 % rispetto al suo predecessore Opus 5.
    • OpenAI GPT‑6 Astra utilizza il trattino con una frequenza inferiore dell’88 % rispetto ai testi umani.
    • Gemini 3.1 Pro quasi lo elimina del tutto.

Nonostante la drastica diminuzione, la totalità dei criteri di identificazione rimane sostanzialmente stabile: “Non è che i segnali diminuiscano, ma ne compaiono di nuovi”, ha osservato Greg Druck, Chief AI Officer di Graphite Growth, in una dichiarazione a TechCrunch.

Costruzioni tipiche e loro varianti

Le analisi hanno evidenziato due gruppi di costruzioni ricorrenti:

1. Costruzioni comparative

Frasi del tipo “non solo X, ma anche Y” sono state in gran parte eliminate, ma sono state sostituite da versioni come “più di un X è Y”. Queste ultime compaiono circa 100 volte più spesso nei testi IA.

2. Costruzioni esplicative

Modelli come Claude Opus 5.5 tendono a spiegare frequentemente “perché qualcosa è importante”, un pattern che appare di gran lunga più spesso rispetto alla scrittura umana.

Impatto delle modifiche sui sistemi di rilevamento

Le piattaforme social, in particolare LinkedIn, hanno introdotto funzionalità che consentono agli utenti di segnalare i contenuti sospettati di essere generati da IA. Tuttavia, gli esperti avvertono che eliminare completamente le costruzioni “sospette” è estremamente difficile. “Le grandi architetture con miliardi di parametri possono essere testate solo in parte; alcuni pattern inevitabilmente passano inosservati”, afferma Druck.

Nuove tendenze e futuri sviluppi

Le aziende stanno puntando a rendere i propri modelli più “naturali”, riducendo fenomeni noti come l’“AI Slop”, ovvero la monotonia e la prevedibilità dei testi IA. Nonostante gli sforzi, gli studiosi prevedono che emergeranno costantemente nuove forme di identificazione. Ogni aggiornamento del modello introduce nuove preferenze, mantenendo viva la possibilità di distinguere i testi artificiali da quelli umani.

Conclusioni

Il lavoro di Graphite Growth dimostra che, anche se le versioni più recenti di ChatGPT e Claude stanno diventando sempre più sofisticate, conservano ancora “tracce” linguistiche riconoscibili. Gli indicatori più affidabili includono parole con frequenza anomala, costruzioni comparative o correttive e l’uso (o l’assenza) del trattino. Per i professionisti della comunicazione, dei media e della ricerca, conoscere questi segnali è fondamentale per valutare l’autenticità dei contenuti online.