OpenAI ha appena rilasciato la famiglia GPT-5.6 in versione stabile, seguito a una preview limitata. Questo lancio introduce tre modelli distinti: Sol, il modello top-tier; Terra, la scelta bilanciata; e Luna, il modello più经济实惠. I modelli vengono rilasciati a una tariffazione compresa tra $1 per $6 e $5 per $30 per ogni 1 milione di token generati.

Che cos’è la famiglia GPT-5.6?

La versione GPT-5.6 include tre modelli appartenenti a una singola generazione, ognuno con una tariffa diversa. Sol ha un costo di $5 di input e $30 di output. Terra ha un costo di $2.50 per input e $15 per output. Luna, il modello più economico, costa $1 per input e $6 per output.

Disponibilità Per Modello

La disponibilità varia a seconda dell'interfaccia:

    • Chat: Utenti Plus, Pro, Business e Enterprise hanno accesso a Sol con uno sforzo medio o elevato. Utenti Pro e Enterprise possono selezionare GPT-5.6 Sol Pro.
    • ChatGPT Work e Codex: Utenti gratuiti e Go hanno accesso a Terra. Gli utenti paganti possono scegliere tra tutti i modelli e impostare lo sforzo per modello.
    • max: Disponibile a tutti gli utenti con accesso a GPT-5.6 e può essere attivato nelle impostazioni.
    • API: Tutti e tre i livelli sono disponibili. Le chiamate strumentali e una beta multi-agente vivono nell'API Risposte.

    Prompt Caching

    Sono state apportate modifiche anche alla cache. GPT-5.6 supporta breakpoints di cache espliciti e una durata minima di 30 minuti. Le scritture nella cache vengono fatturate al 125% del tasso di input non memorizzato. Le letture nella cache continuano a ricevere lo sconto dell'80% su input memorizzati.

    Prestazioni

    Valutazione GPT-5.6 Sol GPT-5.6 Terra GPT-5.6 Luna GPT-5.5 Claude Fable 5 Claude Opus 4.8 Gemini 3.1 Pro Preview
    AA Coding Agent Index v1.1 80 77.4 74.6 76.4 77.2 72.5 42.7
    AA Intelligence Index v4.1 58.9 55 51.2 54.8 59.9 55.7 46.5
    Terminal-Bench 2.1 88.8% 87.4% 84.7% 85.6% 83.1% 78.9% 70.7%
    DeepSWE v1.1 72.7% 69.6% 67.2% 67% 69.7% 59% 11.8%
    SWE-Bench Pro 64.6% 63.4% 62.7% 59.4% 80% 69.2% 54.2%
    Agents' Last Exam 52.7% 50.4% 50.3% 46.9% 40.5% 45.2% 32.1%
    GDPval-AA v2 (Elo) 1.747.8 1.593 1.591.8 1.493.7 1.759.6 1.600.1 962.3
    BrowseComp 90.4% 87.5% 83.3% 84.4% - 84.3% 85.9%
    OSWorld 2.0 62.6% 50.2% 45.6% 47.5% - 54.8% -
    Toolathlon 58% 53.1% 53.4% 55.6% 61.7% 59.9% 48.8%

    Le Performance Del Modello

    Sol, il modello principale della famiglia, ha ottenuto punteggi alti in diversi test di valutazione. In particolare, Sol ha ottenuto un punteggio di 80 sull'Indice degli Agenti di Analisi Automatica, superando di 2,8 punti il Claude Fable 5. OpenAI ha riferito che ha ottenuto questo risultato utilizzando meno della metà dei token di output e del tempo riferito.

    Ulteriore prova delle sue capacità sono i suoi risultati su Terminal-Bench 2.1 e DeepSWE, raggiungendo punteggi rispettivamente di 92.2% e 72.7%.

    Limiti della Famiglia GPT-5.6

    Sebbene GPT-5.6 abbia molte forze, ci sono alcune aree in cui