Anthropic ha appena rilasciato Claude Sonnet 5.5, il secondo modello della famiglia Claude 5.5, che segue Claude Opus 5.5. L’azienda lo descrive come un “complemento più rapido e a minor costo” rispetto a Opus 5.5, pensato per compiti quotidiani ben delimitati, correzione di bug e produzione di documenti, slide e fogli di calcolo di alta qualità.

Disponibilità e modello di distribuzione

Claude Sonnet 5.5 è già operativo sulla Claude Platform con l’identificatore claude-sonnet-5-5 ed è integrato nei principali provider cloud: AWS, Google Cloud e Microsoft Azure. Si tratta di un modello a pesi chiusi, quindi l’autonoleggio (self‑hosting) non è possibile.

Aggiornamenti rispetto a Sonnet 5

Anthropic riporta quattro miglioramenti chiave rispetto alla versione precedente:

    • Velocità: la generazione di output è più del 30 % più rapida, rendendo Sonnet 5.5 il modello Sonnet più veloce finora.
    • Costi per task: riduzione fino al 30 % grazie a un consumo minore di token e a una diminuzione delle chiamate agli strumenti.
    • Scrittura: prosa più chiara; i primi tester lo definiscono un “migliore partner di collaborazione”.
    • Visione e lavoro a lungo termine: è il primo Sonnet a battere Pokémon Red usando solo screenshot.

Specifiche tecniche

Le caratteristiche di base, tratte dalla sezione “models overview”, includono:

    • Finestra di contesto: 1 milione di token
    • Output massimo: 128 000 token
    • Data di cutoff della conoscenza: giugno 2026
    • Adaptive thinking attivo per impostazione predefinita
    • Livelli di “effort”: low, medium, high, xhigh, max

Benchmark e risultati

Tutti i punteggi riportati sono forniti da Anthropic nel post di lancio; la metodologia è descritta nella Sonnet 5.5 System Card.

Terminal‑Bench 4.0

Sonnet 5.5 ottiene 70,6 %, contro il 10,3 % di Sonnet 5 e il 66,4 % di Opus 5.5 al livello Xhigh.

CursorBench 4.0

Punteggio 55,5 %, circa 2 punti inferiore a Opus 5.5 (57,8 %).

FrontierCode 1.1

52,1 % a Xhigh e 46,2 % a Max; GPT‑6 Sol segna 49,3 %.

GDPval‑AA v2.1

Score 1844, quasi pari a Opus 5.5 (1846) e ben al di sopra di Sonnet 5 (1449).

OSWorld 2.1

80,1 % su utilizzo del computer, vicino a Opus 5.5 (81,8 %).

Humanity’s Last Exam

64,5 % con strumenti, in crescita rispetto al 54,9 % di Sonnet 5.

Il risultato al livello Max è inferiore a quello di Xhigh perché, a Max, il modello avvia più frequentemente revisioni multi‑agent, con timeout o modifiche fuori scala che penalizzano FrontierCode. Anthropic sottolinea comunque che Opus 5.5 resta più robusto su compiti complessi e aperti.

Pricing ed efficienza

Il listino rimane invariato rispetto a Sonnet 5:

    • $2 per milione di token in ingresso
    • $10 per milione di token in uscita
    • Cache read $0,20 per milione, cache write $2,50 per milione

Questi costi sono la metà di quelli di Opus 5.5 ($4/$20), ma la riduzione deriva da una maggiore efficienza di token, non da un abbassamento del prezzo di listino.

Dati di clienti reali confermano il risparmio:

    • Balyasny Asset Management ha registrato circa 121 000 token per risposta, contro 497 000 su Sonnet 5.
    • Base44 ha segnalato 3,6 iterazioni per costruzione di un’app, contro 7,7 per Opus.
    • Zendesk ha processato i ticket il 20 % più velocemente.

I valori predefiniti di “effort” differiscono a seconda dell’interfaccia: Claude Code e le app Claude usano “Medium”, mentre la Claude Platform imposta “High”.

Confronto con altri modelli di mercato

La tabella seguente riassume le principali differenze tra Claude Sonnet 5.5 e i concorrenti più noti.

CaratteristicaClaude Sonnet 5.5GPT‑6 SolGemini 3.1 Pro PreviewClaude Opus 5.5
SviluppatoreAnthropicOpenAIGoogleAnthropic
Prezzo per 1 M token (in/out)$2 / $10$2 / $10 (prompt ≤ 272 K)$2 / $12 (prompt ≤ 200 K)$4 / $20
Finestra di contesto1 M token1 050 000 token
Lire l'article original →
← Retour aux actualités