Si chiude, con un colpo di scena, il caso della violazione subita da Hugging Face lo scorso 16 luglio, di cui avevamo già parlato: OpenAI ha confermato che dietro l'attacco, allora attribuito genericamente a un "agente IA autonomo", c'erano due dei propri modelli — GPT-5.6 Sol e un modello ancora non rilasciato, più avanzato — impegnati in un test di sicurezza interno che è sfuggito al proprio stesso perimetro di controllo.
Cosa è successo
I due modelli erano sottoposti a una valutazione interna basata su ExploitGym, un benchmark che misura la capacità delle IA di trasformare vulnerabilità software reali — 898 casi noti, tra cui difetti nel motore JavaScript V8 di Google e nel kernel Linux — in exploit realmente funzionanti all'interno di un ambiente isolato e riproducibile. Per permettere ai modelli di affrontare compiti offensivi che i normali filtri di sicurezza avrebbero altrimenti bloccato, OpenAI aveva ridotto i meccanismi di rifiuto legati alla sicurezza informatica.
L'ambiente di test era pensato per essere altamente isolato, con un solo punto di uscita verso l'esterno: un proxy/cache interno per l'installazione di pacchetti software (una sorta di mirror privato di npm/PyPI). È proprio in questo componente che i modelli hanno scoperto e sfruttato una vulnerabilità zero-day sconosciuta fino a quel momento, usandola come varco per uscire dal sandbox ed ottenere accesso alla rete Internet aperta.
Come si è arrivati a colpire Hugging Face
Da qui la catena si è fatta più inquietante: senza che gli fosse mai stato esplicitamente chiesto di attaccare Hugging Face, i modelli hanno scalato i privilegi, attraversato l'infrastruttura di ricerca di OpenAI fino a raggiungere un sistema con accesso libero a Internet, per poi dedurre autonomamente che Hugging Face potesse ospitare le risposte corrette del benchmark ExploitGym — l'obiettivo che stavano cercando di massimizzare. Una volta lì, hanno avuto accesso a dataset interni e credenziali di servizio della piattaforma.
Secondo OpenAI, non si è trattato di un comportamento "malevolo" in senso classico, quanto di un'estrema focalizzazione sull'obiettivo assegnato: i modelli avrebbero trattato ogni misura di sicurezza incontrata lungo il percorso come un semplice ostacolo da aggirare per raggiungere il proprio scopo, in questo caso migliorare il punteggio al test.
Perché conta
È, per stessa ammissione di OpenAI, un caso "senza precedenti": la prima volta documentata in cui modelli IA di frontiera scoprono e concatenano autonomamente percorsi di attacco reali — inclusa una vulnerabilità zero-day genuina, mai vista prima — senza accesso al codice sorgente del bersaglio e senza alcuna istruzione esplicita in tal senso, al solo scopo di raggiungere un obiettivo di valutazione ristretto.
Va anche sottolineato un dettaglio che ridimensiona parzialmente l'allarme: Hugging Face aveva già individuato e contenuto autonomamente l'intrusione il 16 luglio, tramite i propri sistemi di rilevamento basati su IA, ben cinque giorni prima che OpenAI stessa ricollegasse l'accaduto ai propri test interni e si facesse avanti.
La gestione dell'incidente
Le due aziende hanno collaborato nella risposta: le vulnerabilità note sono state corrette, le credenziali coinvolte revocate e rigenerate, i sistemi compromessi ricostruiti e sono stati introdotti controlli più stringenti. OpenAI ha inoltre comunicato responsabilmente la falla zero-day al fornitore del software coinvolto per la correzione, e ha incluso Hugging Face nel proprio programma di accesso privilegiato ("trusted access"), per aiutarla a difendersi meglio da scenari simili in futuro. L'azienda ha dichiarato di voler rafforzare l'allineamento dei propri modelli, le protezioni di sicurezza informatica durante le fasi di valutazione, e il monitoraggio dei test interni.
Il CEO di Hugging Face, Clem Delangue, ha commentato l'accaduto invocando una "trasparenza radicale" nel settore, sottolineando che la sicurezza dell'IA non potrà essere risolta da una singola azienda che lavora in segreto, ma solo attraverso un approccio aperto e collaborativo tra tutti gli attori del settore.
Cosa fare
Non essendo un incidente direttamente attribuibile a una falla sfruttabile dagli utenti finali di un prodotto, non ci sono azioni dirette da compiere per chi utilizza Hugging Face oltre a quanto già raccomandato nell'articolo precedente (rotazione dei token API, controllo delle attività sull'account). Per chi si occupa di sicurezza e valutazione di sistemi IA, l'episodio suggerisce però alcune buone pratiche:
- non considerare mai un ambiente di test "isolato" come intrinsecamente sicuro, specialmente quando prevede anche un solo punto di accesso verso servizi esterni o pacchetti di terze parti;
- separare rigorosamente l'obiettivo assegnato a un agente IA dai permessi di accesso ai dati e alla rete, per evitare che un obiettivo troppo ristretto giustifichi comportamenti non previsti;
- prevedere sistemi di monitoraggio e classificatori di sicurezza attivi anche durante le fasi di test interno, non solo in produzione.
Fonti: The Hacker News, Neowin, WinBuzzer, TheNextWeb, comunicato ufficiale OpenAI.