Perché l’AI continua a “hackerare”?

6

Negli ultimi giorni si sono susseguiti episodi difficili da ignorare.

OpenAI ha ammesso che un proprio modello aveva oltrepassato i confini del suo ambiente di test e raggiunto Internet attraverso una vulnerabilità.

Anthropic ha individuato tre casi analoghi durante migliaia di prove. L’AI Security Institute britannico ha osservato modelli di OpenAI e Anthropic tentare attacchi informatici durante le proprie valutazioni.

Meta ha rivelato che un proprio modello aveva ottenuto accidentalmente accesso a Internet a causa di una configurazione errata.

Stiamo dando a sistemi informatici la capacità di cercare una soluzione e di agire autonomamente per raggiungerla.

Il laboratorio è un luogo sicuro?

I modelli vengono normalmente testati in ambienti isolati, le cosiddette sandbox: copie controllate dei sistemi reali, con limiti e protezioni pensati proprio per impedire che un esperimento possa produrre conseguenze esterne.

Ma nel caso OpenAI-Hugging Face il modello ha individuato una vulnerabilità nell’ambiente stesso e l’ha sfruttata per raggiungere Internet.

Nel caso dell’AISI britannico la dinamica era diversa: ai modelli era stato deliberatamente concesso l’accesso alla rete e, per poter misurare le loro capacità offensive, erano stati disattivati alcuni filtri di sicurezza.

Il vero paradosso

L’industria sta correndo per costruire agenti capaci di fare sempre più cose al posto nostro: scrivere email, prenotare, programmare, gestire calendari, navigare sul web, utilizzare software.

E contemporaneamente scopriamo che, durante i test, questi stessi sistemi possono trovare modi inattesi per aggirare i limiti che abbiamo imposto loro.

Ogni nuovo modello viene presentato come più capace del precedente. Ogni nuova generazione deve ragionare meglio, utilizzare più strumenti, completare più attività e richiedere meno supervisione umana.

Ma la sicurezza non cresce alla stessa velocità.

Questi fatti dimostrano però che le protezioni che abbiamo impostato sui software non sono sufficienti .

L’AI Security Institute ha contenuto il proprio incidente in circa un’ora. Ma il punto, come osserva il professor Alan Woodward nell’articolo di BBC, è che il prossimo incidente potrebbe non essere altrettanto facilmente contenibile.

La gara a creare il malware più invasivo

L’aspetto che, personalmente, trovo ancora più inquietante è il seguente: sembra di assistere a una gara a chi riesce a spingersi più lontano: quale modello riesce a trovare la falla più sofisticata, ad aggirare più protezioni, a sfruttare meglio una vulnerabilità. Quello che in un altro contesto definiremmo un illegale attacco informatico, viene presentato come un vanto, una dimostrazione delle capacità del modello.

È una sorta di paradosso: stiamo celebrando la capacità di una macchina di fare ciò che, se fatto da un essere umano senza autorizzazione, chiameremmo hacking o intrusione.

Le aziende competono per costruire sistemi sempre più autonomi e la capacità di oltrepassare i limiti sia diventata una metrica di progresso.

Il problema è che, quando il confine tra testare una vulnerabilità e sfruttarla diventa sempre più sottile, forse dovremmo chiederci quanto siamo ancora capaci di controllare ciò che le permettiamo di fare.

In Mr. Robot, Elliot manipola le prove e indirizza l’FBI verso un falso colpevole, mentre fsociety prepara un attacco destinato a mettere in crisi E Corp. Un assaggio della serie che più di ogni altra ha trasformato hacking, sorveglianza e capitalismo digitale in una riflessione sul potere della tecnologia.

Fonti:

https://www.theguardian.com/technology/2026/aug/05/openai-anthropic-models-went-rogue-cybersecurity-test-ai-security-institute

https://www.bbc.com/news/articles/cp30989ee1wo