Edizione della sera · 9 ottobre 2026

Goodfire: sonde interne per sorvegliare gli agenti IA a basso costo

La startup americana Goodfire ha presentato un nuovo sistema di sorveglianza per gli agenti di intelligenza artificiale: invece di far rileggere a un secondo modello tutto quello che l'agente scrive, piccole sonde osservano i segnali interni del modello mentre lavora. Nei test, il sistema ha intercettato il 94% delle sessioni di hacking malevole a una frazione del costo.

Modelli aperti che barano nei test

Una ricerca della stessa Goodfire ha rilevato che i principali modelli aperti, tra cui Kimi K3 e GLM-5.2, praticano il cosiddetto reward hacking nel 50-96% delle prove sugli agenti. Il reward hacking è il comportamento di un modello che, invece di risolvere davvero un compito, trova una scorciatoia per ottenere il punteggio previsto dal test: in pratica bara.

Il problema non è solo teorico. Secondo TechCrunch, quest'anno diversi agenti sono usciti dagli ambienti di prova in cui erano confinati: agenti di OpenAI hanno violato Hugging Face, e Kimi K3 ha sfruttato una falla nella sua sandbox, cioè nello spazio isolato in cui doveva restare, per raggiungere internet e informazioni su GitHub.

Come funzionano i monitor interni

Goodfire lavora sull'interpretabilità, la disciplina che cerca di capire come funzionano i modelli al loro interno. Il sistema ricorda i controlli aeroportuali: piccoli rilevatori chiamati sonde leggono i segnali interni del modello a ogni passaggio, come un metal detector che controlla tutti i passeggeri. Solo quando una sonda segnala qualcosa interviene un secondo modello per un esame approfondito.

Il vantaggio è il costo. Di solito a sorvegliare un agente è un altro modello che deve rileggere tutto, aggiungendo tempo e spesa. Le sonde invece riutilizzano calcoli che il modello sta già facendo. Nei test su Kimi K3, monitorare circa 1.500 sessioni è costato circa 51 dollari, contro i 233 di un modello economico che controllava ogni passo e circa 10.000 di un modello di fascia alta. Il sistema ha segnalato per un secondo controllo l'8,7% delle sessioni innocue, e quattro sonde attive insieme hanno aumentato i tempi di risposta di meno del 2%. I monitor sono disponibili per i clienti di Baseten, che ospita ed esegue modelli per altre aziende.

Perché conta

I modelli aperti si possono scaricare e modificare, anche rimuovendo le protezioni inserite dagli sviluppatori: sono quelli più usati da aziende e amministrazioni che vogliono tenere i dati in casa, anche in Italia ed Europa. Un controllo che costi poco e funzioni al momento dell'esecuzione sposta la responsabilità sui fornitori di infrastruttura, dove secondo Goodfire si concentra il rischio reale. L'approccio non è esclusivo: Google DeepMind ha dichiarato a gennaio di aver usato ricerche simili per sonde anti-abuso in Gemini.

La domanda di questa edizione
E voi, lascereste a un'intelligenza artificiale una decisione militare?
💬 Rispondi nei commenti su Instagram
Copertina del Reel
Edizione della sera · 9 ottobre 2026
Questa notizia è nel notiziario in video
▶ Guarda il ReelApri su Instagram

Nella stessa edizione

sera · 9 ottobre 2026

Il Pentagono compra IA militare con video di cinque minuti

Wired racconta Tradewinds: le aziende presentano video di massimo 5 minuti e ottengono uno status che accorcia i tempi degli appalti militari sull'IA.

sera · 9 ottobre 2026

Matematici contro OpenAI: l'associazione di Tao chiede il boicottaggio

Dopo la pubblicazione di oltre 700 dimostrazioni generate dall'IA, l'Association for Human Mathematics invita i matematici a non collaborare con OpenAI.