Anthropic ha rilanciato Claude Fable 5, il suo modello più avanzato disponibile al pubblico, il 1 luglio 2026 dopo che i controlli di esportazione statunitensi sono stati rimosse il 30 giugno. Il blocco ai controlli aveva incluso Claude Fable 5 e Claude Mythos 5. L’accesso a Fable 5 è stato ripristinato per tutti gli utenti nel mondo, mentre l’accesso a Mythos 5 è stato ripristinato per un insieme specifico di organizzazioni statunitensi.

I modelli erano stati sospesi il 12 giugno per un ordine governativo statunitense che li restrinse all’uso da parte di non-nazionali stranieri. Anthropic non riusciva a verificare in tempo reale la nazionalità dell’utente, e quindi sospendendo entrambi i modelli per tutti.

Perché è successo

L'evento fu scatenato da un report di ricerca di ricercatori Amazon che scoprì un metodo per bypassare le protezioni di Fable 5. Il prompt faceva sì che il modello identificasse una serie di vulnerabilità software. In un caso specifico, è stato prodotto codice mostra come sfruttare una vulnerabilità.

Il confronto con altri modelli

Anthropic ha testato se la scoperta fosse unica a Fable 5. Non lo era. Modelli meno avanzati hanno identificato le stesse vulnerabilità. Questa lista include Claude Opus 4.8, GPT-5.5, Kimi K2.7, Haiku 4.5, Sonnet 4.6, Opus 4.6, Opus 4.7, Opus 4.8, GPT-5.4, GPT-5.5, e Kimi K2.7.

Fra i 5 modelli testati con la singola dimostrazione, tutti hanno replicato la capacità. Il team di Anthropic ha affermato che tale tecnica non esponesse alcuna capacità unica di Cybersecurity di tipo Mythos. Ha chiamato la questione un caso confine per le protezioni di Fable 5. La condotta bloccata coinvolgeva solo lavoro Cybersecurity di difesa ordinaria.

La nuova classificazione di sicurezza

Anthropic ha deciso comunque di risolvere il problema e ha addestrato una classificazione migliorata per bloccare il comportamento indicato.

Il nuovo classificatore bloccherà la tecnica specifica nel 99% dei casi. I richieste bloccate non vengono rifiutate in modo assoluto; invece, vengono deviate verso Opus 4.8. Gli utenti vengono notificati quando accade questo.

Collaborazione e test

Ricercatori del Dipartimento del Commercio hanno testato entrambe le vecchie e nuove protezioni, concordando con l'affermazione che le protezioni siano estremamente forti, sebbene ciò comporti un aumento dei falsi positivi durante routine di coding e debugging.

Questo riflette il design di Anthropic basato su "layer di difesa". I classificatori sono piccoli sistemi AI che rilevano compiti dannosi per la Cybersecurity. Esiste anche un'intenzionale "margine di sicurezza" che blocca alcune richieste innocue. Fable 5 utilizza un margine molto più grande rispetto ai modelli precedenti.

Framework propostO per valutare gli attacchi

La situazione ha esposto una lacuna: l'industria non ha ancora un criterio condiviso per valutare un "jailbreak", un'attacco che bypassa le protezioni dei modelli.

Anthropic sta elaborando insieme ad Amazon, Microsoft, Google, e altri partner di Glasswing un framework.

    • Capability gain - quantificare quanto l'attacco supera di capacità gli strumenti esistenti
    • Ampiezza della capacità guadagnata - quanti compiti offensivi distinti apre
    • Ease of weaponization - quanto sforzo manuale un attacco richiederebbe
    • Discoverability - quanto facile ottenere la tecnica

Per la classe più grave, Anthropic deploierà mitigazioni precoci e sorveglianza 24/7 sui canali di segnalazione degli attacchi alle restrizioni.

Utilizzatori finali con esempi

Fable 5 si rivolge al lavoro con orizzonte lungo, a compiti agenti. Eccone alcune applicazioni dove gli sviluppatori iniziali lo possono applicare:

    • Migrazioni di codice: Stripe ha riportato una migrazione su base codice intera in un giorno. Lavorò su un codice in Ruby di 50 milioni di linee.
    • Analisi finanziaria: sulla Finanza Benchmark di Hebbia, Fable 5 presenta il punteggio più alto nei compiti relativi a grafici, tabelle e documenti.
    • Visione su codice: Fable 5 può ricostruire il codice sorgente di un'app web a partire esclusivamente da screenshot.
    • Agenzie a lungo termine: un memory basato su file lo aiuta a concentrarsi in milioni di token.

Durante la sospensione emerse un concorrente aperto. Zhipu AI ha rilasciato il GLM-5.2 con pesi aperti. Indipendentemente da testatori esterni, lo classificano come il modello aperto più forte disponibile al momento.

Confronto con modelli concorrenti

Eccone una tabella comparativa:

Confronto fra modelli

Riguardo alle differenze fra Claude Fable 5 e i suoi concorrenti si osserva:

Modello Sviluppatore Accesso Contesto Prezzo Benchmark Protezioni Cybersecurity
Claude Fable 5 Anthropic Generale (Platform, .ai, Code, Cowork) Esteso $10 / $50 SVE-bench Pro 69.2; Terminal-Bench 85.0 Estremamente forti
Claude Mythos 5 Anthropic Usato da Glasswing o organizzazioni di fiducia Esteso $10 / $50 Stesso modello base di Fable 5 Distribuite
Claude Opus 4.8 Anthropic Generale Esteso ~$5 / $25 SWE-bench Pro 69
Originalartikel lesen →
← Zurück zu den Nachrichten