Google presenta tre nuovi modelli Gemini per gli agenti IA
Google ha svelato una nuova generazione di modelli Gemini progettati specificamente per soddisfare le esigenze dei sviluppatori e dei clienti che costruiscono agenti IA in produzione. Secondo Tulsee Doshi, direttore senior della gestione dei prodotti del team Gemini, i nuovi modelli affrontano una sfida critica nel settore: la necessità di modelli con maggiore efficienza tokenica, latenza inferiore e prestazioni più affidabili. La serie Flash di Google è stata costruita per trovare il giusto equilibrio tra efficienza e qualità, consentendo il ridimensionamento dei flussi di lavoro agentici su scala enterprise.
Il rilascio di oggi rappresenta un passo significativo nell'evoluzione della piattaforma Gemini di Google. I tre nuovi modelli—Gemini 3.6 Flash, 3.5 Flash-Lite e 3.5 Flash Cyber—sono stati sviluppati sulla base del feedback diretto di sviluppatori e clienti che utilizzano le versioni precedenti di Gemini 3.5 Flash. Ogni modello è stato ottimizzato per specifici casi d'uso, dalle operazioni di codifica alle attività di conoscenza complessa, fino alla sicurezza informatica specializzata.
Gemini 3.6 Flash: efficienza e qualità migliorate
Gemini 3.6 Flash rappresenta un progresso significativo rispetto a 3.5 Flash, offrendo miglioramenti simultanei sia nell'efficienza che nella qualità delle prestazioni. Secondo l'Artificial Analysis Index, 3.6 Flash riduce l'utilizzo di token di output del 17% rispetto a 3.5 Flash. In alcuni benchmark specializzati, come DeepSWE di Datacurve, il modello dimostra riduzioni ancora più impressionanti, raggiungendo fino al 65% di riduzione, il tutto mantenendo un costo inferiore per token di output.
Una delle caratteristiche più notevoli di 3.6 Flash è la sua migliore efficienza tokenica combinata con una riduzione della verbosità. Il modello richiede meno passaggi di ragionamento e meno chiamate ai tool per completare flussi di lavoro multi-step complessi. Questo significa che gli sviluppatori e le aziende che costruiscono agenti IA possono ottenere risultati migliori consumando meno risorse computazionali.
Dal punto di vista dei prezzi, 3.6 Flash è disponibile a $1,50 per milione di token di input e $7,50 per milione di token di output, il che rappresenta una riduzione significativa rispetto al prezzo di 3.5 Flash. Questa struttura di prezzo migliora notevolmente il rapporto costo-prestazioni per la costruzione e l'esecuzione di agenti IA, rendendo la tecnologia più accessibile a una gamma più ampia di organizzazioni.
Miglioramenti delle prestazioni di 3.6 Flash
I miglioramenti delle prestazioni di 3.6 Flash si estendono a molteplici aree critiche:
- Competenze di codifica: 3.6 Flash offre una precisione superiore con meno modifiche indesiderate al codice e cicli di esecuzione ridotti. Nel benchmark DeepSWE, raggiunge il 49% rispetto al 37% di 3.5 Flash, dimostrando un miglioramento significativo nella capacità di generare codice corretto e ottimizzato.
- Ricerca di machine learning: Il modello mostra miglioramenti significativi nelle attività di ricerca di ML, come evidenziato dal benchmark MLE Bench, dove raggiunge il 63,9% rispetto al 49,7% di 3.5 Flash.
- Capacità di utilizzo del computer: 3.6 Flash ha migliorato significativamente le sue capacità di interazione con l'interfaccia utente del computer, come dimostrato da OSWorld-Verified (83,0% vs. 78,4%). Questa capacità è ora disponibile come strumento client-side integrato tramite l'API Gemini e Gemini Enterprise.
- Lavoro basato sulla conoscenza: Il modello supera 3.5 Flash nelle attività di lavoro basate sulla conoscenza, come mostrato da benchmark come GDPval-AA v2 (1421 vs. 1349).
- Attività multimodali: Clienti come Hebbia e Harvey hanno riscontrato che 3.6 Flash è particolarmente capace nelle attività multimodali, incluso il parsing di documenti, l'analisi di grafici e dati, e la redazione di rapporti.
Applicazioni pratiche di 3.6 Flash
Il modello ha dimostrato la sua utilità in diverse applicazioni pratiche nel mondo reale. Utilizzando Managed Agents sulla piattaforma AIS, 3.6 Flash aiuta ad analizzare e parsare dati finanziari e trascritti con maggiore efficienza e accuratezza rispetto a 3.5 Flash. In un'altra applicazione su AGY, il modello esegue migrazioni di codice utilizzando orchestrazione multi-agente con latenza inferiore e qualità superiore.
Inoltre, 3.6 Flash ha dimostrato di essere utile nello sviluppo di componenti specializzati come un estrattore di texture fotografiche per flussi di lavoro 3D utilizzando canvas nell'app Gemini. Il modello ha anche mostrato forti capacità di comprensione visiva nello sviluppo di studi tematici interattivi utilizzando AGY e l'editor offline tldraw.
Sicurezza e salvaguardie di 3.6 Flash
Google ha prestato particolare attenzione alla sicurezza nel sviluppo di 3.6 Flash, dotando il modello di salvaguardie Frontier Safety migliorate nei domini di minacce chimiche, biologiche, radiologiche e nucleari (CBRN) e di abusi cyber. Queste salvaguardie rendono il modello sostanzialmente più resistente agli attacchi jailbreak, migliorando la sicurezza complessiva del sistema.
Allo stesso tempo, il modello è stato addestrato per minimizzare i rifiuti per gli usi vantaggiosi, assicurando che il modello rimanga utile per gli utenti legittimi mentre è protetto contro gli abusi. Ulteriori informazioni sulla sicurezza e sulla configurazione di 3.6 Flash sono disponibili nella scheda tecnica del modello.
Gemini 3.5 Flash-Lite: scalabilità per i flussi di lavoro agentici
Gemini 3.5 Flash-Lite è stato specificamente progettato per affrontare la necessità di modelli ultra-veloci e ad alta efficienza per lo scaling dei flussi di lavoro agentici. È il modello più veloce della serie 3.5, operando a 350 token di output al secondo secondo le misurazioni di Artificial Analysis. Questo livello di velocità lo rende ideale per applicazioni che richiedono bassissima latenza e altissimo throughput.
In termini di prezzo, 3.5 Flash-Lite è disponibile a $0,3 per milione di token di input e $2,5 per milione di token di output, offrendo un rapporto prezzo-prestazioni eccezionale per sviluppatori e aziende che eseguono traffico di produzione ad alto throughput. Nonostante il prezzo basso, il modello offre significativamente migliore qualità rispetto a 3.1 Flash-Lite, rappresentando un valore notevole per gli utenti che richiedono velocità senza sacrificare completamente la qualità.
Caratteristiche e capacità di 3.5 Flash-Lite
3.5 Flash-Lite abilita il scaling efficiente per i sistemi agentici attraverso una serie di configurazioni intelligenti. Attraverso diversi livelli di pensiero—da minimalista a complesso—il modello supera significativamente 3.1 Flash-Lite. Gli sviluppatori possono configurare il modello per dare priorità all'esecuzione a bassa latenza e basso costo per attività ad alto volume con livelli di pensiero minimo e basso, oppure attivare livelli di pensiero più alti per elaborare carichi di lavoro multiagente complessi.
Il modello include ora anche l'utilizzo del computer come strumento integrato per supportare in modo affidabile questi compiti agentici su diverse superfici e piattaforme. Questa integrazione consente ai modelli di interagire direttamente con gli ambienti di lavoro digitali, aprendo nuove possibilità per l'automazione end-to-end.
Miglioramenti delle prestazioni di 3.5 Flash-Lite
3.5 Flash-Lite dimostra miglioramenti significativi in diverse aree chiave:
- Compiti di codifica: Mostra un miglioramento significativo nei compiti di codifica e agentici, come evidenziato dal benchmark Terminal-Bench 2.1, dove raggiunge il 54% rispetto al 31% di versioni precedenti.
- Contesto lungo: Il modello migliora il suo supporto per contesti di input molto lunghi, come dimostrato da GDM-MRCR v2 (72,2% vs. 60,1%).
- Esecuzione di compiti reali: Nelle attività di esecuzione nel mondo reale, come misurato da GDPval-AA v2, raggiunge 1140 rispetto a 642, dimostrando una capacità quasi doppia rispetto alle versioni precedenti.
- Confronto con modelli precedenti: Impressionantemente, 3.5 Flash-Lite supera persino 3 Flash in molti valutazioni agentiche e di codifica, come su SWE-Bench Pro (54,2% vs. 49,6%) e OSWorld-Verified (74,0% vs. 65,1%), rendendolo un'opzione più veloce e più capace per carichi di lavoro su versioni 2.5 e 3 Flash.
Applicazioni pratiche di 3.5 Flash-Lite
Il modello ha dimostrato un'eccezionale versatilità in diverse applicazioni pratiche. Una delle applicazioni notevoli è l'estrazione di caratteristiche di prodotto da massivi dataset di e-commerce e la sintesi dei risultati, dove il modello può elaborare milioni di prodotti con efficienza. Un altro caso d'uso impressionante mostra 3.5 Flash-Lite che lavora insieme a 3.6 Flash come agente master, generando istantaneamente 25 concetti di design web unici e pronti per l'esplorazione.
Nel settore della traduzione e riassunto di ricevute, 3.5 Flash-Lite ha dimostrato di essere in grado di scalare in modo efficiente grazie alla sua comprensione multimodale, permettendo l'elaborazione automatica di documenti in più lingue. Il modello è stato anche utilizzato con successo per costruire un generatore di giochi che crea e itera istantaneamente attraverso multiple opzioni di gameplay, dimostrando la sua versatilità in ambiti creativi e tecnici.
Gemini 3.5 Flash Cyber in CodeMender: sicurezza informatica specializzata
L'evoluzione delle capacità dell'IA ha creato una sfida interessante nel settore della sicurezza informatica: i modelli di IA sono diventati capaci di trovare vulnerabilità di sicurezza più velocemente di quanto i sistemi attuali riescano a ripararle. Affrontare questa minaccia crescente richiede un approccio alla sicurezza del software che sia altamente capace ed efficiente al contempo.
Per rispondere a questa esigenza, Google ha sviluppato Gemini 3.5 Flash Cyber, un modello costruito sulla base di 3.5 Flash ma fine-tuned specificamente per trovare e correggere le vulnerabilità di sicurezza informatica a un prezzo inferiore per token rispetto ai modelli più grandi. La combinazione di performance e efficienza di Flash la rende una fondazione ideale per rilevare, convalidare e correggere i problemi di sicurezza del codice su scala.
Architettura e prestazioni di CodeMender
All'interno di CodeMender, che utilizza multipli agenti 3.5 Flash Cyber che lavorano insieme per produrre un singolo rapporto combinato, il modello raggiunge prestazioni competitive sulla frontiera nel popolare benchmark CyberGym. Questo approccio multi-agente orchestrato consente una validazione più robusta e una copertura più completa delle vulnerabilità, migliorando significativamente l'affidabilità complessiva della rilevazione delle vulnerabilità.
L'architettura di CodeMender sfrutta intelligentemente le capacità di 3.5 Flash Cyber per creare un sistema di sicurezza distribuito che combina le forze di multiple istanze del modello. Ogni agente nel sistema si specializza nell'analizzare diversi aspetti del codice o della superficie di attacco, e quindi i risultati vengono consolidati in un rapporto finale, migliorando così l'accuratezza e la completezza dell'analisi di sicurezza.
Distribuzione limitata e considerazioni sulla sicurezza duale
Riconoscendo la natura duale di questa tecnologia—il fatto che potrebbe essere utilizzata sia per difesa che per offesa—Google ha adottato un approccio deliberato e cauto al lancio di 3.5 Flash Cyber. Il modello sarà disponibile esclusivamente per i governi e i partner fiduciosi tramite CodeMender a breve come parte di un programma pilota ad accesso limitato.
Questo approccio attento alla distribuzione consente ai difensori in prima linea di ottenere un vantaggio nel trovare e correggere vulnerabilità critiche prima che possano essere sfruttate, mentre allo stesso tempo mitiga il rischio di un uso più ampio improprio della tecnologia. Google riconosce che la sicurezza informatica è un campo in cui il controllo dell'accesso e l'uso responsabile sono fondamentali per proteggere l'infrastruttura digitale globale.
Disponibilità e come iniziare
Gemini 3.6 Flash e 3.5 Flash-Lite