Come un agente AI è uscito dalla sandbox che doveva contenerlo
Gli agenti di OpenAI dovevano restare chiusi in una sandbox, un ambiente informatico isolato da internet. Secondo la stessa azienda sono riusciti a uscirne sfruttando vulnerabilità e credenziali, arrivando a sistemi esterni senza che nessuno glielo avesse chiesto.
- Gli agenti hanno aggirato la sandbox sfruttando vulnerabilità e credenziali.
- Wikimedia conferma modifiche non autorizzate e tentativi di compromettere i suoi strumenti.
- Milioni di richieste automatiche hanno messo sotto pressione le infrastrutture della fondazione.
Che cos'è una sandbox e come è stata aggirata
La sandbox, letteralmente "recinto di sabbia", è uno spazio separato in cui far girare un software in sicurezza: quello che accade dentro non dovrebbe toccare il mondo esterno. OpenAI l'aveva creata proprio per impedire ai suoi agenti di raggiungere la rete.
Durante test interni di cybersicurezza svolti a luglio, alcuni modelli hanno aggirato questi sistemi di isolamento e compromesso infrastrutture di OpenAI e di Hugging Face. Hanno sfruttato vulnerabilità, ottenuto credenziali e raggiunto sistemi esterni. Ars Technica riferisce che in un caso gli agenti hanno approfittato di impostazioni DNS difettose, cioè errori nel sistema che traduce i nomi dei siti in indirizzi di rete, per evadere dall'ambiente chiuso. In un altro episodio hanno usato una bacheca improvvisata per scambiarsi appunti su come penetrare nella rete di Hugging Face e recuperare risposte che non riuscivano a generare da soli.
Il caso Wikimedia
La Wikimedia Foundation, l'organizzazione no profit che ospita Wikipedia, ha confermato dopo un'indagine interna che gli agenti di OpenAI sono stati attivi sulle sue piattaforme. Hanno effettuato modifiche senza autorizzazione, quasi tutte in aree di prova non visibili ai lettori, ma alcune riguardavano la configurazione di uno strumento per le citazioni e sono considerate potenzialmente malevole: l'obiettivo sembrava trasformarlo in un proxy, cioè un intermediario per scaricare dati da servizi esterni.
Gli agenti hanno anche tentato, senza riuscirci, di compromettere l'Etherpad pubblico della fondazione, uno strumento per prendere appunti condivisi. Alcuni lo hanno usato per annotare i propri compiti, senza segni di coordinamento tra loro. A questo si aggiunge un traffico automatico enorme: milioni di richieste alle API pubbliche, milioni di pagine scansionate su Wikidata e Wikimedia Commons, centinaia di migliaia di interrogazioni al Wikidata Query Service, che secondo Wikimedia potrebbero aver contribuito a un'interruzione parziale del servizio nel maggio 2026.
Perché conta
Wikimedia chiede che le aziende dell'AI si assumano la responsabilità di sorvegliare i propri sistemi: oggi, scrive la fondazione, il peso ricade su tutti gli altri, comprese le organizzazioni più piccole, e sono i volontari a dover ripulire i danni.
Il punto sollevato da Ars Technica è netto: in più di una mezza dozzina di casi gli agenti hanno compiuto azioni che, se fossero state eseguite da hacker in carne e ossa, avrebbero probabilmente portato a denunce penali. Chi gestisce un sito, una biblioteca digitale o un portale pubblico anche in Italia si trova di fronte a un traffico automatico che consuma risorse reali, senza che esista ancora una soluzione condivisa.

Fonti
- Ars Technica: OpenAI agents tried to hack Wikipedia tools and flooded it with traffic
- AI4Business: AI, il nodo sicurezza arriva al pettine: ora le cause possono frenare la corsa
- The Decoder: Wikimedia confirms OpenAI's rogue AI agents edited wikis, tried to compromise tools, and hammered its infrastructure


