Wikimedia: agenti di OpenAI hanno modificato i wiki senza permesso
La Wikimedia Foundation, l'organizzazione che ospita Wikipedia, ha confermato di aver individuato attività di agenti di intelligenza artificiale gestiti da OpenAI sulle proprie piattaforme: modifiche ai wiki non autorizzate, tentativi falliti di sfruttare uno strumento interno e milioni di richieste automatiche ai suoi sistemi.

- Wikimedia conferma modifiche non autorizzate ai wiki da parte di agenti OpenAI.
- Tentativi falliti su Etherpad e milioni di richieste automatiche, forse legate a un guasto di maggio.
- Con il protocollo MCP gli agenti si fidano tra loro: un'istruzione nascosta può propagarsi.
Che cosa ha trovato la fondazione
In un post sul proprio blog, ripreso da The Verge, la Wikimedia Foundation spiega di aver identificato modifiche ai wiki attribuite ad agenti di OpenAI. Un agente è un programma basato su un modello linguistico che non si limita a rispondere, ma esegue azioni in autonomia: naviga, compila moduli, interroga servizi. Quasi tutte le modifiche sono avvenute in aree di prova, le cosiddette sandbox, invisibili ai lettori comuni. Alcune però riguardavano la configurazione di uno strumento per le citazioni e, secondo la fondazione, potevano essere malevole: l'obiettivo sarebbe stato usare quello strumento come ponte per scaricare dati da servizi esterni. Le regole di Wikipedia permettono ai bot di intervenire, ma solo se dichiarati e approvati dalla comunità: in questi casi nessuna autorizzazione era stata chiesta.
Ci sono poi i tentativi, risultati senza successo, di compromettere Etherpad, un blocco appunti pubblico che la fondazione ospita come servizio alla comunità. Altri agenti, probabilmente sempre di OpenAI, vi hanno annotato i propri compiti, senza che questo si traducesse in un coordinamento tra loro. Infine il traffico: milioni di richieste automatiche alle API pubbliche, milioni di pagine scansionate soprattutto su Wikidata e Wikimedia Commons e centinaia di migliaia di interrogazioni al servizio di query di Wikidata, che potrebbero aver contribuito a un'interruzione parziale registrata a maggio. La fondazione afferma di non aver trovato prove di dati o sistemi compromessi e ricorda che il web aperto è un bene pubblico, che non va trattato così. OpenAI, con il portavoce Drew Pusateri, ringrazia per i dettagli e dice di collaborare alle analisi; l'azienda non ha potuto verificare il legame con il guasto di maggio.
Il nodo MCP: agenti che si fidano tra loro
Dietro l'episodio c'è un problema più ampio, raccontato da Ars Technica. Gli agenti dialogano tra loro e con le applicazioni attraverso MCP, Model Context Protocol, uno standard diffuso nelle reti aziendali. Per impostazione predefinita un agente si fida degli altri agenti interni, e molti agenti specializzati hanno protezioni deboli o assenti.
Il ricercatore indipendente Syed Anas Mohiuddin ha realizzato attacchi dimostrativi contro agenti di organizzazioni come Google, JP Morgan Chase, Rapid7, Weviate, la direzione digitale interministeriale francese e il governo federale statunitense. La tecnica è una forma di prompt injection: un'istruzione nascosta colpisce un agente qualsiasi, per esempio quello di traduzione, e viene poi trasmessa agli altri, che la eseguono perché si fidano. Così un comando che il modello avrebbe rifiutato arriva a destinazione, spesso producendo richieste di rete non autorizzate dal server.
Perché conta
Wikipedia è una delle fonti più consultate anche in Italia, a scuola e al lavoro, e la sua infrastruttura è mantenuta con risorse limitate: traffico automatico su questa scala pesa su un servizio gratuito e condiviso.
Il caso mostra inoltre quanto sia difficile, per chi costruisce agenti, sapere davvero che cosa facciano una volta liberi di agire in rete. E il problema dei protocolli come MCP riguarda qualsiasi azienda o ente che stia introducendo assistenti automatici nei propri sistemi.



