OpenAI blocca 15.000 account che copiavano il ragionamento dei modelli
OpenAI ha annunciato di aver smantellato una campagna coordinata per copiare il ragionamento nascosto dei suoi modelli, chiudendo oltre 15.000 account. I ricercatori che avevano scoperto la falla avvertono però che la stessa tecnica continuava a funzionare su piattaforme cloud come Microsoft Azure.
- OpenAI ha chiuso oltre 15.000 account coinvolti in una campagna di distillazione avversaria.
- Il trucco sfruttava un modello più debole per ristampare il ragionamento cifrato di uno più potente.
- Secondo i ricercatori l'attacco funzionava ancora su Microsoft Azure dopo le contromisure.
Che cos'è la distillazione avversaria
I modelli di punta, prima di rispondere, elaborano una catena di passaggi intermedi: il cosiddetto ragionamento, che all'utente non viene mostrato. Secondo OpenAI quei passaggi sono preziosi perché possono contenere informazioni volutamente escluse dalla risposta finale e aiutano a ricostruire le capacità del modello.
La distillazione è la tecnica con cui un modello impara da ciò che produce un altro modello. Quando l'obiettivo è carpire di nascosto le catene di pensiero di un sistema più potente, si parla di distillazione avversaria: chi ci riesce può addestrare un modello più economico che imita quello migliore.
OpenAI racconta che l'attività è iniziata a basso volume il 1 luglio, per poi salire il 24 e 25 luglio a 16.000 richieste da oltre 4.000 utenti con uno schema di estrazione ricorrente. L'analisi ha portato a una rete di più di 15.000 account, chiusa entro il 28 luglio. L'azienda precisa in nota che si trattava di tentativi di estrazione, non necessariamente riusciti, e collega un nucleo dell'attività a persone legate a Moonshot AI, la società cinese del modello Kimi, pur senza poter dire che tutti gli attori risalgano a un'unica origine.
Il trucco e il buco nel cloud
Il metodo, spiega OpenAI, consisteva nel copiare il ragionamento cifrato da una conversazione e chiedere poi a un modello, in una conversazione separata, di decifrarlo e trascriverlo. Il ricercatore Joachim Schaeffer e il suo gruppo lo avevano già descritto in uno studio: i pacchetti cifrati con il ragionamento vengono restituiti al cliente e possono essere spostati fra sessioni, fra utenti e perfino fra modelli diversi dello stesso fornitore, perché usano chiavi condivise. Così un modello più debole ed economico della stessa famiglia funziona da oracolo di decifratura e stampa parola per parola i pensieri nascosti del modello più forte.
OpenAI dice di aver chiuso la falla, irrigidito le registrazioni e introdotto controlli sugli output trasmessi. Ma in un aggiornamento dello studio i ricercatori riferiscono che il 13 settembre l'attacco era bloccato sulle API di OpenAI e Anthropic, mentre su Microsoft Azure funzionava ancora contro tutti i modelli OpenAI provati e contro i modelli Anthropic fino a Sonnet 5. Stessi modelli, commenta Schaeffer, ma protezioni diverse a seconda della piattaforma che li distribuisce.
Perché conta
La vicenda mostra che la sicurezza di un modello non dipende solo da chi lo costruisce, ma da tutta la catena di rivenditori cloud. Per le aziende italiane che comprano l'accesso ai modelli tramite piattaforme come Azure è un promemoria concreto: le garanzie possono cambiare a seconda del fornitore scelto.
Sul piano industriale, se il ragionamento di un modello costato centinaia di milioni può essere copiato, il vantaggio competitivo dei laboratori più avanzati si assottiglia. OpenAI dice di aver condiviso quanto appreso attraverso il Frontier Model Forum e canali governativi, perché il problema non riguarda solo i suoi modelli.
