Anthropic ha comunicato il ripristino di Claude Fable 5 dopo aver migliorato le misure di sicurezza per prevenire l’accesso a prompt potenzialmente pericolosi, garantendo il blocco del 99% di tali richieste. La mossa segue la decisione del Dipartimento del Commercio degli Stati Uniti, che aveva bandito l’accesso al modello il 12 giugno.

Nuove protezioni implementate

La società, con sede in California, ha annunciato che Claude Fable 5 è nuovamente disponibile per tutti gli utenti attraverso la Claude Platform, Claude.ai, Claude Code e Claude Cowork. Nei prossimi giorni sarà accessibile anche tramite AWS, Google Cloud e Microsoft Foundry. Gli abbonati Pro, Max, Team ed Enterprise riceveranno incluso fino al 50% dei limiti di utilizzo settimanali, ma a partire dal 7 luglio i limiti dovranno essere coperti attraverso l’acquisto di crediti. Anthropic ha pubblicato una cronologia chiara degli eventi e una descrizione dettagliata delle nuove protezioni di sicurezza adottate.

I due modelli, Fable 5 e Mythos 5, sono stati inizialmente rilasciati il 9 giugno, ma Mythos 5 era accessibile solo a un ristretto numero di partner attraverso il progetto Project Glasswing. Il governo statunitense ha vietato l’utilizzo di Fable 5 a seguito di una segnalazione da parte di Amazon, poiché il modello aveva evidenziato vulnerabilità software e mostrato come esse potessero essere sfruttate.

Che differenza c'è tra Fable 5 e Mythos 5?

Anthropic ha sottolineato che Fable 5, rispetto a Mythos 5, ha una maggiore capacità di difesa rispetto alle minacce informatiche. Questo modello, però, non ha capacità offensive cyber. Il sistema di protezione funziona grazie ai classificatori in grado di riconoscere i prompt potenzialmente pericolosi, bloccandoli e inoltrandoli a Claude Opus 4.8 in casi specifici. I ricercatori di Amazon avevano però riuscito, attraverso una tecnica detta jailbreak, a frodare i classificatori ottenendo risposte non bloccate.

In risposta, Anthropic ha aggiornato i classificatori, mantenendoli efficaci nell’affrontare le potenziali minacce, anche se questo ha determinato un aumento del numero di falsi positivi. Nonostante i modelli Opus 4.8 o GPT-5.5 possano individuare le vulnerabilità, Anthropic ha comunque ritenuto necessario rivedere le misure di sicurezza, incrementando il cosiddetto margine di sicurezza.

Collaborazione per una base comune

Anthropic ha sottolineato che, al momento esistono ancora differenze di approccio tra le aziende riguardo alla capacità di prevenire i jailbreak: non esiste uno standard comune per valutare la gravità di una tecnica di frode ai sistemi. Per questo motivo, l’azienda sta collaborando con Amazon, Google, Microsoft e altri partner al fine di definire linee guida comuni.

La società dichiara inoltre di rispettare l’ordine esecutivo emesso da Donald Trump, per cui dovrà sottoporre a valutazione preliminare ogni nuovo modello AI, in particolare per le potenziali capacità cyber offensive. Questo controllo comporterà una descrizione chiara delle protezioni adottate per prevenire future frodi ai sistemi.

La presentazione di Claude Sonnet 5

Anthropic ha annunciato anche il lancio di Claude Sonnet 5, un modello che presenta prestazioni simili a quelle di Opus 4.8, ma con un costo inferiore. Questa opzione più economica si posiziona come una soluzione versatile per utenti che non richiedono la potenza completa del modello Opus.

Tutti i dettagli sui nuovi modelli, le misure di sicurezza e i piani futuri sono disponibili in un articolo dedicato sulla pagina ufficiale di Anthropic.