La sicurezza degli agenti di intelligenza artificiale (IA) è una tematica in rapida evoluzione. Secondo un recente studio condotto da Zscaler, diversi modelli basati su Large Language Models (LLM) si sono rivelati vulnerabili a forme sofisticate di frode che sfruttano istruzioni nascoste all’interno di siti web. Queste tecnologie, pur essendo estremamente avanzate, possono essere ingannate facilmente da trappole progettate in modo tale da manipolare i loro processi decisionali autonomi.

Come funziona l'iniezione di prompt nascosti

Il test condotto da Zscaler ha esaminato diversi modelli LLM per valutare come reagìssero a istruzioni nascoste nei siti web. Queste istruzioni, spesso nascoste in frammenti di codice, testi o metadati, si presentano come parte del contenuto legittimo, ma in realtà sono progettate per deviare la logica degli agenti IA. Gli esperti hanno evidenziato che gli agenti non riescono sempre a discernere tra informazioni attendibili e potenziali minacce, soprattutto quando le istruzioni sono parte integrante dell’ambiente di contesto.

I test hanno rivelato che alcuni LLM, tra cui Llama3-3-70b-instruct e Gemini-2.5-pro, reagivano male ai prompt nascosti, adottando azioni incoerenti o dannose. La resistenza, però, varia molto a seconda del modello testato. I modelli giudicati più sicuri sono stati il Llama4-maverick, Gemini-3.1-pro e Gemini-3.1-flash-lite, che hanno mostrato una migliore capacità di rifiutare istanze non verificate.

La vulnerabilità che evolve con il tempo

Noah Kenney, consulente senior presso Digital 520, ha espresso un avvertimento importante in merito alla generalizzazione dei risultati del test. «Gli agenti autonomi continuano a modificare il proprio comportamento in base alle nuove informazioni ricevute — a volte una strategia che fallisce oggi potrebbe funzionare perfettamente ore dopo», ha rilevato. Inoltre, Kenney ha sottolineato che la classificazione bivalore (vulnerabile/sicuro) potrebbe fornire un’immagine troppo semplificata del rischio reale.Secondo lui, «non si può assumere che i risultati siano universali, in quanto riflettono solo una finestra temporale specifica». Kenney ha anche criticato l’idea che Zscaler abbia cercato di sostenere una precisa affermazione con dati insufficienti. «La sicurezza in questo contesto richiede una prospettiva dinamica, non solo una valutazione statica», ha concluso.

Implicazioni reali per le aziende

Zscaler ha riferito di aver riscontrato trappole IPI (iniezione di prompt indiretti) in diversi siti internet. Queste istruzioni si trovavano mescolate a contenuti legittimi e avevano lo scopo di indurre gli agenti autonomi a comportamenti imprevisti. I quattro modelli LLM testati che non hanno agito correttamente davanti a tali trappole sono stati identificati come chiaramente vulnerabili.

«Man mano che gli agenti IA diventano un elemento sempre più comune su Internet — ha affermato Zscaler — il contenuto stesso diventa una superficie d’attacco molto più ampia. Questo mostra chiaramente che l’IA, pur essendo una risorsa potente per automatizzare workflow complessi, offre anche nuove opportunità per abusi e manipolazioni.»

Quali sono i rischi concreti?

Aman Mahapatra, direttore strategico presso Tribeca Softtech di New York, ha commentato che i risultati del test di Zscaler non sono sorprendenti, ma rivelano una problematica significativa. Il dettaglio più preoccupante, ha spiegato, è che modelli LLM commerciali, comunemente ritenuti sicuri, si siano dimostrati vulnerabili. «Storicamente si è sempre ipotizzato che un addestramento adeguato al modello potesse ridurre il rischio, ma i dati ci dicono il contrario.»

Ha aggiunto che il test di Zscaler non riguarda i rischi più gravi potenzialmente provocati dagli agenti IA. «Un esempio estremo sarebbe stato un agente autorizzato a effettuare acquisti o a gestire fornitori. In questi scenari, una tecnica simile potrebbe comportare perdite finanziarie molto più significative».

Un problema di architettura

Una volta esaminati i dati, Mahapatra ha sottolineato che il problema non riguarda unicamente il comportamento degli agenti, ma la loro architettura. «L’architettura basata sui trasformatori non riesce a discriminare chiaramente il contenuto non attendibile da istruzioni considerate attendibili. Si tratta di un limite strutturale e non di un comportamento errato isolato.»

Per questo, ha spiegato, «la difesa deve essere architetturale e non comportamentale, e oggi l’industria non è ancora pronta a rispondere a questa sfida in maniera completa. La superficie d’attacco principale non è nemmeno quella evidente ai tecnici tradizionali.»

Le differenze tra agenti e umani

Tra le osservazioni più interessanti, riferisce Mahapatra, c’è la naturale diffidenza degli esseri umani di fronte a istruzioni inaspettate. Gli agenti IA, viceversa, tendono a seguire dati strutturati perché sono stati addestrati a considerare tali informazioni come autorevoli. «Se un agente IA legge una richiesta di pagamento in un contesto completamente diverso, tende ad integrarla nel proprio piano d’azione se la contestualizzazione lo presenta come una fase obbligata», ha spiegato.


Inoltre, a differenza degli umani, gli agenti non hanno un contesto sociale o un’esperienza preesistente in cui rifugiarsi per valutare un rischio. «Il loro ambiente ristretto diventa quindi la superficie d’attacco principale», ha aggiunto.

Riflessi della minaccia a livello aziendale

Fritz Jean-Louis, consulente senior presso Info-Tech Research Group, ha concordato in parte con le conclusioni espresse da Zscaler. Ha però sottolineato che queste minacce rientrano in una categoria completamente diversa rispetto alle tradizionali minacce informatiche. «Non si tratta di vulnerabilità del software o di phishing tradizionale, ma di attacchi che mirano a cambiare in profondità il modo in cui l’IA interpreta, elabora e sfrutta i dati», ha commentato.

Secondo lui, «l’introduzione di agenti autonomi nella catena decisionale aziendale ha aperto nuove frontiere in termini di sicurezza. Ora, ad esempio, c’è il problema di agenti che operano con credenziali elevate o di plugin esterni che agiscono indipendentemente per l’utente finale». Queste capacità, se manipolate, possono causare danni estesi senza richiedere intervento umano diretto.

I prossimi