Anthropic ha appena rilasciato Claude Sonnet 5. Lo descrive come il modello con agenticità più alta nella serie Sonnet. Il modello può pianificare, guidare browser e terminali e svolgere compiti autonomamente per lungo tempo.
Agenticità e novità
Sonnet 5 è il modello predefinito per piani Gratuiti e Pro oggi. Gli utenti Max, Team ed Enterprise possono selezionarlo. È anche disponibile in Claude Code e su Claude Platform.
TL;DR
- Sonnet 5 è il modello con maggiore agenticità intermedia di Anthropic e riduce notevolmente il divario rispetto a Opus 4.8.
- Vince su Sonnet 4.6 su tutti i benchmark pubblicati.
- Costi di utilizzo più bassi: prezzo introduttivo di $2/$10 per MTok fino al 31 agosto, dopodiché $3/$15; Opus 4.8 costa $5/$25.
- Offre il miglior rapporto di valore a sforzo basso o medio; a sforzo estremo può costare di più rispetto a Opus 4.8 a parità di qualità.
- Sicuro rispetto a 4.6, con capacità di cyber bassa. Opus rimane la scelta per lavori critici per l’accuratezza.
Claude Sonnet 5: posizionamento
Sonnet si trova nel mezzo della gamma di Anthropic. È superiore al più economico Haiku 4.5 e inferiore al modello principale Opus 4.8.
Sonnet 5 è un aggiornamento rispetto a Sonnet 4.6 lanciato a febbraio 2026. Anthropic presenta questa versione in base alla sua agenticità e alla capacità di svolgere compiti in modo più affidabile, non solo su un singolo benchmark.
In pratica, significa compiti complessi senza perdere contesto, correggersi meglio quando una richiesta fallisce e comportamento più stabile durante sessioni lunghe in Claude Code o Cowork.
Livelli di sforzo e tokenizzazione
Il modello offre livelli di sforzo: basso, medio, alto e xalto (altissimo). Maggiore è lo sforzo maggiore sono i token processati, il che influenza qualità e costo.
Bisogna notare che Sonnet 5 utilizza un nuovo tokenizzatore, lo stesso introdotto con Opus 4.7. Lo stesso testo può essere mappato a circa 1,0–1,35 volte più token, applicando quindi il fattore esclusivamente a Sonnet 5.
Pubblicazione di benchmark
Il team di Anthropic ha pubblicato una tabella di benchmark che confronta Sonnet 5, Sonnet 4.6 e Opus 4.8. Sonnet 5 vince su ogni categoria testata.
- Nel test di coding agente (SWE-bench Pro), Sonnet 5 raggiunge il 63,2%. Sonnet 4.6 si fermava al 58,1%, Opus 4.8 al 69,2%.
- Nel uso del computer (OSWorld-Verified), Sonnet 5 ha il 81,2% contro il 78,5% di Sonnet 4.6. Nel Terminal-Bench 2.1 raggiunge l’80,4% rispetto al 67,0%.
- Nell’esame finale del test (Humanity’s Last Exam), Sonnet 5 arriva al 57,4%, quasi pari a Opus 4.8 al 57,9%.
- Tra i test di lavoro intellettuale (GDPval-AA v2), Sonnet 5 ha 1.618 contro gli 1.615 di Opus 4.8.
Trade-off sul costo-prestazione
La storia del rapporto costo-prestazione è cruciale per gli sviluppatori. Sonnet 5 è un miglioramento rigoroso rispetto a Sonnet 4.6 a ogni livello di sforzo. Il massimo valore è evidente a livello basso e medio.
In questi livelli, Sonnet 5 offre una qualità che il prezzo precedente di Sonnet non permetteva. Opus 4.8 rimane leader di accuratezza ai livelli alti.
Da qui si deduce una politica di routing pratica. Invia la maggior parte del coding autonoma, utilizzo di strumenti e lavoro intellettuale a Sonnet 5. Riserva a Opus 4.8 i compiti critici per l’accuratezza. Usa Haiku 4.5 per richieste ad alto volume e sensibili ai tempi.
Usi comunemente notati
Gli utenti in anteprima hanno descritto flussi di lavoro concreti. Questi mappano a compiti ingegneristici comuni.
- In software engineering multi-step: un tester chiese a Sonnet 5 di investigare un bug. Il modello scrisse un test per riprodurlo, implementò la correzione, e confermò il bug ricomparire senza il cambiamento, in un’unica operazione.
- Nel debugging di sistemi esistenti: un partner lo eseguì su complesse richieste di pull. Il modello individuò le fallure, corresse radicalmente il problema e non solo i sintomi.
- Nella business automation: Zapier gli affidò un compito a due step. Il modello aggiornò i livelli degli account Salesforce, poi inviò una email all’avvio ai contatti importanti. Completò il task da inizio a fine.
- Negli agenti per l’utilizzo del computer: l’azienda Pace gestisce lavori assicurativi come inoltrare richieste e valutare perdite. Gli agenti operano su sistemi operativi già in uso.
- Nella esplorazione dati: agenti per ClickHouse interrogano dati in tempo reale e producono informazioni istantaneamente. La più rapida capacità di ragionamento riduce il tempo di attesa per gli analisti.
Confronto tabellare
| Metrica / Specifica | Sonnet 4.6 | Sonnet 5 | Opus 4.8 |
|---|---|---|---|
| Agentic coding (SWE-bench Pro) | 58.1% | 63.2% | 69.2% |
| Terminal-Bench 2.1 | 67.0% | 80.4% | Non riportato |
| Computer use (OSWorld-Verified) | 78.5% | 81.2% | Non riportato |
| Humanity’s Last Exam (con strumenti) | 46.8% | 57.4% | 57.9% |
| Work intellettuale (GDPval-AA v2) | Non riportato | 1,618 | 1,615 |
| Prezzo input ($/MTok) | ← Volver a las noticias