L'importanza della sicurezza informatica nell'era dell'IA

Google ha investito nella sicurezza informatica per molti anni, pioniere nella scoperta automatizzata di vulnerabilità per proteggere i database di codice mondiali. In un contesto in cui gli agenti di intelligenza artificiale stanno diventando sempre più capaci di trovare vulnerabilità più velocemente di quanto i difensori possano ripararle, affrontare questa minaccia globale richiede un approccio altamente capace, conveniente e scalabile. Negli ultimi anni, Google ha sviluppato strumenti come CodeMender, un agente di sicurezza del codice che può automaticamente trovare e risolvere vulnerabilità critiche nel software. Tuttavia, il panorama della sicurezza informatica sta cambiando rapidamente, e la necessità di soluzioni più sofisticate e efficienti è diventata sempre più pressante.

Introduzione di Gemini 3.5 Flash Cyber

Per affrontare questa sfida crescente, Google ha annunciato l'introduzione di Gemini 3.5 Flash Cyber, un modello leggero specializzato in sicurezza informatica costruito sulla base di 3.5 Flash e fine-tuned per trovare, convalidare e correggere le vulnerabilità in modo rapido ed efficiente. Questo nuovo modello è significativamente più efficace nei compiti di identificazione e risoluzione delle vulnerabilità rispetto ai modelli mainline Flash di Gemini. La scelta di costruire su 3.5 Flash è strategica: le prestazioni e l'efficienza di Flash lo rendono una base ideale per gli sforzi nel campo della sicurezza informatica. Costruendo su Flash, 3.5 Flash Cyber offre un'alternativa conveniente e altamente capace ai grandi e costosi modelli di sicurezza informatica disponibili attualmente sul mercato.

Un approccio intenzionale al dispiegamento della tecnologia

Data la natura dual-use di questa tecnologia, Google ha adottato un approccio intenzionale al modo in cui distribuisce 3.5 Flash Cyber. Come parte di un programma pilota ad accesso limitato, 3.5 Flash Cyber sarà esclusivamente disponibile per governi e partner affidabili tramite CodeMender nel prossimo futuro, con l'intenzione di espandersi nel tempo. Questo approccio è stato scelto per dare ai difensori in prima linea un vantaggio nel trovare e correggere le vulnerabilità critiche prima che possano essere sfruttate, mentre si mitiga contro abusi più ampi. Parallelamente, Google sta anche portando le capacità fondamentali di CodeMender direttamente ai clienti attraverso modelli Gemini generalmente disponibili tramite la piattaforma Gemini Enterprise Agent.

Tecnologia e architettura del modello

Trovare difetti profondamente radicati richiede l'esplorazione di uno spazio di esecuzione immenso. Affidandosi a una singola chiamata costosa a un grande modello linguistico, è possibile creare un collo di bottiglia. 3.5 Flash Cyber è particolarmente adatto per trovare vulnerabilità dove l'agente deve scansionare un ampio database di codice e analizzare un gran numero di percorsi di codice. CodeMender invoca 3.5 Flash Cyber più volte, consentendo agli agenti di analizzare una vastità maggiore di percorsi di codice per scoprire e convalidare le vulnerabilità. I sub-agenti producono quindi un singolo report di alta qualità. Grazie alla sua velocità e convenienza economica, 3.5 Flash Cyber può essere facilmente integrato in scansioni frequenti, processi di lancio sensibili al tempo o pipeline di commit scanning su larga scala.

Risultati dei benchmark e test di performance

Google ha testato 3.5 Flash Cyber su una varietà di benchmark. In particolare, il modello è stato testato sul benchmark CyberGym, che valuta gli agenti di intelligenza artificiale rispetto a centinaia di vulnerabilità software reali. Sfruttando il basso costo di 3.5 Flash Cyber configurando CodeMender per invocare 3.5 Flash Cyber fino a cinque volte per un singolo report finale, l'agente complessivo ha raggiunto prestazioni competitive rispetto a modelli significativamente più grandi su CyberGym. Va notato che i risultati dei competitor sono originati da punteggi auto-segnalati dai fornitori.

Google ha anche sottoposto a stress test le capacità del modello oltre CyberGym senza protezioni di sicurezza. Il team Big Sleep di Google ha costruito indipendentemente una valutazione focalizzata sulla ricerca di vulnerabilità critiche e difficili da trovare in alcuni dei database di codice più complessi del mondo, come Chrome e Safari. In questo test, 3.5 Flash Cyber ha significativamente superato il mainline 3.5 Flash e 3.6 Flash.

Valutazione sulla pipeline di commit scanning di Google Chrome

3.5 Flash Cyber è stato anche valutato sulla pipeline di commit scanning di produzione di Google Chrome. Le vulnerabilità non sono state divulgate pubblicamente, il che ha garantito che questo benchmark rimanesse libero da contaminazione per Gemini e i modelli competitor. I risultati hanno mostrato un miglioramento significativo di 3.5 Flash Cyber rispetto a 3.5 Flash. È importante notare che le versioni più recenti dei modelli competitor successivi a Opus 4.6 si rifiutano di completare i compiti a causa di protezioni di sicurezza integrate, e quindi non vengono mostrate nei confronti.

Scoperta di vulnerabilità uniche

Inoltre, 3.5 Flash Cyber ha scoperto in modo consistente più vulnerabilità uniche rispetto al mainline 3.5 Flash e Claude Opus 4.6. Quando testato sulla altamente complessa V8 JavaScript Engine su un numero fisso di invocazioni, 3.5 Flash Cyber ha trovato 55 problemi unici confermati, rispetto ai 47 trovati dal mainline 3.5 Flash e ai 36 trovati da Opus 4.6, includendo 10 problemi che gli altri due modelli testati non hanno catturato.

I modelli di sicurezza informatica di base possono rimanere bloccati in un loop, trovando lo stesso problema ripetutamente mentre perdono vulnerabilità critiche. Un modello forte getta una rete più ampia, trovando un numero più elevato di problemi unici. Man mano che Google scala il numero di invocazioni, scopre che 3.5 Flash Cyber continua a scoprire nuovi percorsi di codice e vulnerabilità. Questo dimostra la capacità del modello di fornire risultati coerenti e progressivamente migliori con l'aumento delle risorse computazionali allocate.

Applicazioni pratiche nei sistemi di Google

I benchmark rappresentano solo una parte della storia. 3.5 Flash Cyber in CodeMender sta già trovando e correggendo vulnerabilità nei database di codice interni di Google, inclusi Chrome, Android, Cloud, Ads e YouTube. La velocità della scoperta resa possibile da un modello leggero ha fornito un impatto misurabile e tangibile sui sistemi di Google.

Ad esempio, il team di Ricerca Vulnerabilità di Google Cloud ha utilizzato 3.5 Flash Cyber per proteggere i propri sistemi in tempo record. In sole 2 ore, il modello ha scoperto vulnerabilità di remote code execution nelle API pubbliche e trovato una vulnerabilità di corruzione della memoria in un servizio di produzione sensibile. Ha quindi generato un exploit di remote code execution affidabile al 100% che ha bypassato tecniche di mitigazione standard come Address Space Layout Randomization (ASLR) e Write XOR Execute (W^X). Questi risultati dimostrano la capacità pratica e la velocità di 3.5 Flash Cyber nell'identificare e caratterizzare vulnerabilità critiche.

Feedback da partner tecnologici

I feedback iniziali da testatori di Wiz e Cloud CISO Security Engineering confermano il significativo miglioramento di capacità di 3.5 Flash Cyber rispetto al modello mainline 3.5 Flash. I partner che hanno avuto accesso anticipato al modello hanno riportato risultati positivi e promettenti, suggerendo che il modello è pronto per il dispiegamento in ambienti di produzione e può fornire valore reale ai team di sicurezza informatica.

Vantaggi competitivi di Google nella sicurezza del software

La leadership di Google nella sicurezza del software conferisce un vantaggio unico nella realizzazione di 3.5 Flash Cyber. Diverse risorse e database di cui Google dispone contribuiscono significativamente al successo di questo modello:

  • OSV.dev: Un database di vulnerabilità gestito da Google che copre oltre 700.000 vulnerabilità open-source, fornendo una risorsa inestimabile per l'addestramento del modello
  • OSS-Fuzz: Più di 10 anni di risultati di fuzzing open-source, che aiutano Google a identificare le vulnerabilità di maggiore qualità e più rilevanti
  • Esperienza con progetti complessi: L'esperienza di Google nel gestire e proteggere progetti di code base estremamente grandi come Chromium consente di addestrare modelli che comprendono la complessità reale

Questi vantaggi consentono a Google di andare oltre gli esempi sintetici di sicurezza informatica e insegnare ai propri modelli come lavorano i professionisti della sicurezza reali. I modelli di Google imparano a operare strumenti standard del settore, a leggere milioni di righe di codice in progetti di larga scala come Chromium, e ad affrontare in modo indipendente compiti di sicurezza complessi che richiedono ore di analisi continua e approfondita.

Il modello di addestramento e la qualità dei dati

La qualità dei dati di addestramento è fondamentale per il successo di qualsiasi modello di machine learning, e specialmente per un modello specializzato come 3.5 Flash Cyber. Google ha investito considerevoli risorse nel raccogliere e curare dataset di addestramento di alta qualità che rappresentano vulnerabilità reali e scenari di sicurezza complessi. L'accesso a OSV.dev con oltre 700.000 vulnerabilità open-source e a più di un decennio di risultati di OSS-Fuzz ha permesso a Google di creare set di dati di addestramento straordinariamente ricchi e rappresentativi.

Questo approccio basato su dati reali e vulnerabilità autentiche permette a 3.5 Flash Cyber di comprendere i pattern e le caratteristiche delle vulnerabilità nel mondo reale, anziché affidarsi esclusivamente a esempi sintetici. Questo è un aspetto cruciale che distingue 3.5 Flash Cyber da altri approcci alla sicurezza informatica basati su intelligenza artificiale, poiché il modello è addestrato su quello che i professionisti della sicurezza realmente incontrano nelle loro attività quotidiane.

Implicazioni per la sicurezza globale e la difesa proattiva

L'introduzione di 3.5 Flash Cyber ha implicazioni significative per la sicurezza informatica globale. Fornendo ai difensori uno strumento capace e conveniente per trovare e correggere automaticamente le vulnerabilità, Google sta contribuendo a cambiare il panorama della sicurezza informatica verso un modello più proattivo e preventivo. Invece di aspettare che le vulnerabilità vengano scoperte dagli attaccanti e poi correggere i danni, le organizzazioni possono ora utilizzare 3.5 Flash Cyber per identificare e risolvere le vulnerabilità prima che possano essere sfruttate.

Questo è particolarmente importante considerando la crescente sofisticazione degli attacchi informatici e la velocità sempre maggiore con cui le minacce emergono e si diffondono. Avendo accesso a uno strumento che può analizzare il codice in modo estremamente veloce e identificare anche vulnerabilità difficili da trovare, i team di sicurezza informatica possono mantenere un livello di protezione più elevato e ridurre significativamente la finestra di tempo durante la quale un'organizzazione è vulnerabile a una minaccia sconosciuta.

Scalabilità e integrazione nei processi di sviluppo

Un aspetto particolarmente importante di 3.5 Flash Cyber è la sua idoneità per l'integrazione direttamente nei processi di sviluppo del software. Grazie alla sua velocità e convenienza economica, il modello può essere facilmente integrato in:

  • Scansioni frequenti: Permettendo scansioni regolari del codice senza aggiungere costi proibitivi
  • Processi di lancio sensibili al tempo: Garantendo che le vulnerabilità critiche non blocchino i rilasci importanti
  • Pipeline di commit scanning: Analizzando il codice nuovo non appena viene sottomesso al repository, prima che venga integrato nel codebase principale

Questa integrazione profonda nei workflow di sviluppo significa che 3.5 Flash Cyber può fornire feedback quasi in tempo reale agli sviluppatori su potenziali vulnerabilità, creando un ciclo di feedback immediato che incoraggia pratiche di coding più sicure. Gli sviluppatori possono imparare dai problemi che 3.5 Flash Cyber identifica nei loro commit e migliorare gradualmente la qualità e la sicurezza del loro codice nel tempo.

Mitigazione dei rischi di dual-use e governance responsabile

Google ha affrontato responsabilmente le preoccupazioni riguardanti il potenziale uso improprio della tecnologia 3.5 Flash Cyber. Dato il potenziale dual-use di un modello così potente nella scoperta di vulnerabilità, Google ha scelto di limitare inizialmente l'accesso a governi e partner affidabili tramite il programma pilota. Questo approccio conservativo è inteso a permettere al modello di fornire benefici significativi per la difesa mentre si mitiga il rischio che possa essere utilizzato per scopi offensivi.

Nel tempo, man mano che il modello si dimo

Read original article →
← Back to news