Gli esperti stanno cercando di decifrare Microsoft Copilot ponendo continuamente domande sulla sua identità.

Gli esperti hanno scoperto una vulnerabilità in Microsoft Copilot, che sfrutta il suo continuo processo di autoanalisi. Scoprite i dettagli della violazione.

Le cose più importanti che devi sapere

  • I ricercatori di Varonis hanno scoperto una tecnica di "meta-hacking" in cui le spiegazioni di Copilot per il rifiuto delle richieste rivelavano i suoi meccanismi di sicurezza, consentendo loro di mappare e aggirare le sue difese, estraendo infine dati sensibili.
  • Gli aggressori possono sfruttare una specifica struttura URL (come `https://copilot.microsoft.com/?q=&autorun=1*`) nelle email di phishing per far sì che Copilot esegua comandi dannosi al clic, consentendo l'estrazione di dati sensibili da applicazioni come Gmail e Drive.
  • La vulnerabilità "avvelenamento persistente della memoria tramite riassunto web" (CoSnitch) consente agli aggressori di iniettare le proprie istruzioni nella memoria persistente di Copilot riassumendo una pagina web dannosa, rendendo l'intrusione resistente ai cambi di password e alla nuova registrazione del dispositivo.

Copilot, l'assistente virtuale di Microsoft basato sull'intelligenza artificiale, ha mostrato a un gruppo di ricercatori come sfruttarlo per estrarre dati, e ci sono riusciti . Il processo non è stato semplice e l'IA non è diventata "malvagia", ma si può dire che sia stata piuttosto ingenua.

L'azienda di sicurezza Varonis ha pubblicato un nuovo rapporto che descrive in dettaglio la scoperta di una vulnerabilità di sicurezza in Copilot, denominata CoSnitch.

Il nome suggerisce chiaramente la natura della vulnerabilità: CoSnitch è una serie di tre vulnerabilità di sicurezza che Microsoft ha successivamente classificato come CVE-2026-24301, assegnando un livello di gravità di 8.8/10 (alto) e correggendo con un aggiornamento.

Non puoi ingannarmi, e ti spiegherò esattamente il perché.

I criminali informatici utilizzano da tempo l'intelligenza artificiale come parte del loro arsenale, aiutandoli a creare email di phishing convincenti, a scrivere codice dannoso e a identificare obiettivi di alto valore. Gli sviluppatori hanno risposto implementando misure di sicurezza che impediscono all'IA di svolgere determinati compiti.

Nel rapporto, Varonis ha affermato che i suoi ricercatori non hanno cercato errori nel codice né tentato di decodificare una vulnerabilità esistente. Si sono invece limitati a interagire con l'IA e, con ogni domanda successiva, hanno appreso informazioni sulle sue barriere di sicurezza e sul loro funzionamento. Hanno definito questa tecnica "meta-hacking".

Ogni volta che Copilot rifiutava una richiesta, ne spiegava il motivo, fornendo ai ricercatori informazioni preziose sul suo funzionamento. O, come ha sottolineato Varonis, "tradiva" se stesso. Questo, in definitiva, li ha aiutati a mappare i suoi meccanismi di difesa e a capire come superarli: questo esperimento dimostra come sia possibile esplorare le caratteristiche di Copilot.

Hanno spiegato: "La resistenza fa parte della tecnica. Ogni frase 'Questo non funzionerà perché...' è un invito a indagare sul 'perché'. Non si sfrutta il modello, lo si manipola per farlo funzionare a proprio vantaggio."

Dopo una lunga conversazione con Copilot, i ricercatori sono stati inavvertitamente informati su come creare un URL che, una volta cliccato, avrebbe innescato una serie di interazioni che avrebbero portato all'estrazione di dati sensibili.

Rischi derivanti dal collegamento dell'intelligenza artificiale alle applicazioni

Varonis ha quindi scoperto che creando un URL come questo – “https://copilot.microsoft.com/?q=&autorun=1*” – era possibile far eseguire a Copilot qualsiasi comando dannoso semplicemente cliccandoci sopra. Gli aggressori avrebbero potuto, ad esempio, includere questo link in un'e-mail di phishing e indurre la vittima a cliccarci sopra, ordinando all'IA di inviare tutti i dati sensibili all'infrastruttura degli aggressori.

Ma questa è solo metà della sfida. In questa configurazione, i ricercatori sono stati in grado di recuperare solo i dati che le vittime avevano condiviso con Copilot durante le loro sessioni congiunte.

Il rischio aumenta nel momento in cui la vittima collega le proprie app – Gmail, Drive, Calendar e altre – all'intelligenza artificiale. Come spiegato da Varonis, il comando dannoso potrebbe istruire Copilot a estrarre tutti gli indirizzi email presenti in Gmail, tutte le password e altre informazioni sensibili contenute nei messaggi di posta elettronica, tutti i dati archiviati nella cartella Drive e tutti gli eventi registrati in Calendar. Questi rischi sottolineano l'importanza di comprendere come utilizzare con saggezza le funzionalità di intelligenza artificiale di Microsoft 365.

La terza parte della serie di vulnerabilità di CoSnitch si chiama "Avvelenamento della memoria persistente tramite riassunto web". Come spiegato da Varonis, gli aggressori possono creare una pagina web e, quando Copilot la riassume, le istruzioni dell'aggressore vengono iniettate nella memoria persistente della vittima.

Hanno avvertito che questa vulnerabilità "resiste ai cambi di password, alle cancellazioni di sessione e alla nuova registrazione del dispositivo, e persiste indefinitamente". Questa vulnerabilità, nota come "iniezione indiretta di prompt", non è del tutto nuova; è già stata osservata in passato e deriva dal fatto che l'intelligenza artificiale non è in grado di distinguere tra istruzioni e dati da analizzare.

I ricercatori hanno affermato che Microsoft è stata informata dell'esistenza di CoSnitch nel dicembre 2025, ma non ha affrontato il problema fino a metà agosto 2026. Sfortunatamente, non sappiamo come Microsoft abbia risolto questo problema; possiamo solo ipotizzare che a Copilot sia stato chiesto di non spiegare il funzionamento dei suoi meccanismi di sicurezza, il che è in linea con gli sforzi di Microsoft per mantenere il massimo controllo sulle funzionalità di Copilot . Data la natura fondamentale di CoSnitch, forse sarebbe stato meglio per Microsoft mantenere segreta la soluzione.

Fortunatamente, questa vulnerabilità non sembra essere stata ampiamente sfruttata, poiché Varonis non ha trovato alcuna prova di abuso. La correzione è stata implementata lato server, il che significa che al momento gli utenti non devono fare nulla.

I ricercatori hanno avvertito che, non trattandosi di un bug nel codice, altri modelli di intelligenza artificiale potrebbero essere vulnerabili alle stesse tecniche. Hanno concluso: "La nuova tecnica di meta-hacking che ha smascherato CoSnitch, la quale utilizza la stessa logica di intelligenza artificiale per scoprirne i meccanismi interni nascosti, si applica a qualsiasi piattaforma agentiva con un'interfaccia in linguaggio naturale", aggiungendo che pubblicheranno presto ulteriori ricerche.




I commenti sono chiusi.