Lo scorso anno Google AI Edge ha introdotto il supporto per modelli di linguaggio su dispositivo (SLMs), con quattro modelli iniziali disponibili su Android, iOS e Web. Oggi, siamo entusiasti di ampliare il supporto a oltre una dozzina di modelli, inclusi i nuovi Gemma 3 e Gemma 3n, ospitati nel nostro nuovo spazio open-source LiteRT su Hugging Face community.

Gemma 3n – Primo modello multimodale

Gemma 3n, disponibile in anteprima tramite Google AI Edge, è il primo modello di linguaggio su dispositivo (SLM) multimodale di Gemma, che supporta input di testo, immagine, video e audio. Abbiamo integrato la tecnologia Retrieval Augmented Generation (RAG) e l’architettura Funzione di chiamata, per fornire agli sviluppatori gli strumenti necessari per creare funzioni AI locali di alto valore.

Gli sviluppatori possono accedere alla lista crescente di modelli nel LiteRT Hugging Face Community. È semplice scaricare qualsiasi modello e utilizzarlo su dispositivi con poche righe di codice. I modelli sono interamente ottimizzati e convertiti per mobilità e web. Le istruzioni dettagliate su come implementarli si trovano nella documentazione ufficiale di Google ed in ogni pagina dei modelli su Hugging Face.

Customizzazione con sottomodelli

Gli utenti possono personalizzare i modelli utilizzando il finetuning su base originale, seguito da conversione e quantizzazione con le librerie appropriate di AI Edge. Forniamo un Colab che guida ogni passo nel processo per finetuning e conversione del modello Gemma 3 1B.

Prestazioni e riduzione dimensionale

Nei nostri nuovi strumenti di quantizzazione, abbiamo adottato schemi di quantizzazione che migliorano drasticamente la qualità. Gli schemi int4 permettono una riduzione compresa tra 2,5 e 4 volte le dimensioni del modello rispetto a bf16, migliorando anche la velocità e diminuendo l’uso di memoria.

Gemma 3 1B

All’inizio dell’anno abbiamo presentato Gemma 3 1B. Con un peso di soli 529 MB, questo modello processa fino a 2.585 token al secondo in pre-filling su GPU mobile, permettendo di elaborare circa una pagina di contenuto in meno di un secondo. I piccoli dimensioni lo rendono compatibile su una vasta gamma di dispositivi, limitando il consumo di dati degli utenti finali.

Introduzione al modello Gemma 3n

Gemma 3n è ora disponibile come anteprima iniziale. Le versioni a 2 e 4 miliardi di parametri supporteranno input nativi su testo, immagine, video e audio. Modalità testo e immagine sono disponibili già ora su Hugging Face con il supporto audio in arrivo a breve.

Gemma 3n è particolarmente adatto a casi d'uso aziendali dove i programmatori possono utilizzare le risorse complete del dispositivo, supportando modelli più complessi su dispositivi mobili. Tecnici di campo potrebbero scattare una foto di una parte e chiedere informazioni aggiuntive. Lavoratori in magazzino o cucina possono registrare l’inventario con la voce mentre hanno le mani occupate.

Supporto per Retrieval Augmented Generation (RAG)

Un’innovazione chiave introdotta nel sistema Google AI Edge è il RAG (Retrieval Augmented Generation) su dispositivo. Questo consente di migliorare i modelli piccoli fornendo dati specifici dell’applicazione, senza modifiche complesse. Che si tratti di mille pagine di informazioni o di mille foto, RAG riesce a individuare i dati rilevanti per il modello.

La libreria AI Edge RAG funziona con qualsiasi modello piccolo che supportiamo. Offre inoltre la flessibilità per modificare qualsiasi parte del processo RAG, inclusi metodi di elaborazione dati, chunking e funzioni di ricerca. La libreria RAG è ora disponibile su Android, con supporto per altre piattaforme in sviluppo. Questa funzionalità consente alle app di generare risposte intelligenti basate su informazioni specifiche e pertinenti.

Funzioni di chiamata locale

Per rendere i modelli linguistici su dispositivo interattivi, introduciamo la Funzione di chiamata del sistema AI Edge. La libreria AI Edge Function Calling è disponibile oggi su Android con altri sistemi in arrivo. La libreria include gli strumenti per integrare un modello linguistico all’applicazione, registrare funzioni, analizzare la risposta, e lanciare le azioni in tempo reale.

Funzionalità di esempio

Nella nostra applicazione di esempio, mostriamo come la funzione di chiamata può essere usata per completare moduli in tempo reale tramite linguaggio naturale. In contesto medico, l’utente potrebbe indicare informazioni personali a voce, e l’applicazione estrae i dati, completando i campi specifici grazie al modello linguistico su dispositivo.

La libreria può essere combinata con la libreria python per simulazione di strumenti che permette di creare modelli linguistici adatti alle particolari funzioni dell’app, migliorando la precisione e la velocità della risposta sul dispositivo.

Sviluppi futuri per Google AI Edge

Continueremo ad aggiornare supporto su dispositivi per i nuovi modelli di AI, incluso il supporto per nuove funzioni. Monitorate la Hugging Face Community LiteRT per nuovi modelli in arrivo. Le nostre librerie RAG e Funzione di chiamata proseguiranno l'espansione dei loro strumenti e delle loro piattaforme di supporto.

Per ulteriori aggiornamenti su AI Edge, visitate la pagina dedicata ai nuovi API LiteRT e ai nuovi servizi AI Edge Portals per benchmark e valutazioni su larga scala sui dispositivi.

Più aggiornamenti Google I/O 2025

Scoprite questa e altre novità relative a Google I/O 2025 sul sito ufficiale: io.google, a partire da maggio 22.

Vogliamo ringraziare i Googlers che hanno contribuito a questi lanci, tra cui Advait Jain, Akshat Sharma, Alan Kelly, Andrei Kulik e molti altri coinvolti.