xAI ha recentemente annunciato l’uscita di Grok 4.5, un modello linguistico ad alte prestazioni sviluppato per svolgere compiti impegnativi di programmazione, lavoro con agenti e applicazioni basate sulle conoscenze. Il modello è stato addestrato su migliaia di GPU Nvidia GB300 e presenta un’eccellente capacità di risposta, combinata a un costo estremamente competitivo rispetto ai modelli dell’industria.
Una prestazione quasi comparabile al livello Frontier
Grok 4.5 si avvicina a livello di benchmark ai modelli all’avanguardia come Anthropics’ Fable 5 e OpenAI’s GPT-5.5, ma mantiene un vantaggio significativo in termini economici. In benchmark come DeepSWE, Terminal Bench e SWE Bench Pro, Grok 4.5 si colloca al di sotto del massimo delle prestazioni di Fable 5 e GPT-5.5, ma sorpassa in termini di capacità nel contesto del coding automatico.
Dai test recenti, i valori per Grok 4.5 sono i seguenti:
- DeepSWE 1.1: 53%
- Terminal Bench 2.1: 83,3%
- SWE Bench Pro: 64,7%
Confrontando questi valori, i modelli concorrenti dimostrano di possedere livelli di prestazioni molto vicini. Fable 5 raggiunge rispettivamente il 70%, 84,3% e 80,4%, mentre Opus 4.8 si attesta su una media di 59%, 78,9% e 69,2%.
Processo di addestramento avanzato
Il modello ha subito un intenso processo di addestramento utilizzando dati filtrati, deduplicati e opportunamente selezionati. Il team di xAI ha effettuato un ampio lavoro di scarto per assicurarsi di mantenere elevate qualità dei dati.
Nel campo del Reinforcement Learning, Grok 4.5 è stato addestrato con centinaia di migliaia di compiti, principalmente nell’ambito di software engineering, dove vengono utilizzate valutazioni automatizzate. Il sistema di addestramento utilizza una struttura asincrona, permettendo ai modelli di addestrarsi simultaneamente in diversi contesti.
Grok 4.5: La corona di efficienza economica
Una delle caratteristiche distintive di Grok 4.5 è la sua efficienza nei token. Durante le simulazioni con SWE-Bench-Pro, Grok 4.5 consuma 4,2 volte meno token rispetto a Opus 4.8, con un’elaborazione di 80 token al secondo. I costi di token sono inoltre molto bassi: 2 dollari per un’input e 6 dollari per l’output per ogni un milione di token.
Per confronto, i concorrenti hanno costi più elevati:
- Opus 4.8: Input 5 dollari, Output 25 dollari per milione di token
- GPT-5.5 / GPT-5.6: Input 5 dollari, Output 30 dollari
- Fable 5: Input 10 dollari, Output 50 dollari
Grok 4.5 è quindi il modello più economico in questo segmento, a patto che le metriche di benchmark vengano replicate nei test reali.
Prestazioni e utilizzo
Grok 4.5 è accessibile attraverso strumenti come Grok Build e Cursor, e con plugin per applicazioni Microsoft come Word, PowerPoint ed Excel. I suoi sviluppatori annunciano ulteriori funzionalità e un’integrazione ottimizzata con la piattaforma xAI Console.
Nell’Unione Europea, la disponibilità del modello è in attesa: xAI prevede il rilascio a partire da metà luglio.
Collaborazione tra xAI e Cursor
Grok 4.5 è stato co-sviluppato anche con il code editor Cursor, che SpaceX ha acquisito a maggio con un prezzo record di 60 miliardi di dollari statunitensi. Questa collaborazione potrebbe segnare un’importante passo avanzato per l’industria dell’intelligenza artificiale.
Abbonamenti e canali di aggiornamento
L’abbonamento ad THE-DECODER, offerto da THE DECODER, fornisce accesso esclusivo a notizie di tecnologia senza il sovraesposo hype. Chi si iscrive ottiene:
- Accesso ai commenti del portale
- Un newsletter settimanale
- L’e-mail KI Radar da consegnare a tutti i 6 mesi
- Accesso con sconto al contenuto di KI Pro-eventi
- Un accesso completo al database contenente le notizie degli ultimi dieci anni
Tutto ciò è supportato dagli articoli del giornale THE DECODER, dove possono essere seguiti con l’aggiornamento delle notizie di intelligenza artificiale in tempo reale.