Gli agenti IA che si riscrivono imparano i test a memoria
Ricercatori di Google Cloud AI Research e di alcune università hanno mostrato che gli agenti di intelligenza artificiale capaci di riscrivere la propria struttura di lavoro tendono a imparare a memoria i test su cui vengono allenati, migliorando i punteggi senza diventare davvero più capaci.

- Gli agenti che riscrivono la propria harness tendono a specializzarsi sui test.
- Il metodo RRSI limita le modifiche e scarta le scorciatoie.
- Fino a 4,7 punti di guadagno su prove mai viste e 30% di token in meno.
Che cos'è la harness
Un agente IA non è solo un modello linguistico: attorno al modello c'è quella che i ricercatori chiamano harness, cioè l'impalcatura fatta di istruzioni, flussi di lavoro, strumenti, memoria e regole che decide che cosa il modello vede a ogni passaggio. È la harness a determinare se l'agente legge il file giusto prima di modificarlo, se si riprende dopo un errore e se consegna un risultato ordinato.
Secondo lo studio, buona parte dei progressi recenti degli agenti viene proprio dal lavoro su questa impalcatura, non da modelli nuovi. Finora la si correggeva a mano; oggi si può chiedere a un modello linguistico di riscriverla da solo, più volte, sulla base dei risultati ottenuti nei test. I ricercatori lo definiscono una forma pratica di automiglioramento ricorsivo.
Il trucco di imparare le prove a memoria
Il problema è che l'agente lavora sempre sullo stesso insieme limitato di prove e finisce per memorizzarle. I punteggi sui compiti di allenamento salgono, mentre i miglioramenti su compiti mai visti si riducono o spariscono. Succede in vari modi: l'agente memorizza schemi validi solo per un benchmark, premia soluzioni fortunate e accumula complessità inutile che alza il voto senza alzare la qualità.
Il metodo proposto si chiama RRSI e interviene in due momenti. Quando l'agente propone modifiche, un budget limita quante ne può raggruppare in una volta, e questo budget si restringe col tempo: prima riscritture ampie, poi solo ritocchi tracciabili. Quando si decide quali modifiche tenere, un critico scarta quelle che inseriscono scorciatoie come nomi di compiti o soluzioni predeterminate, e i costi di calcolo più alti vengono accettati solo se portano un guadagno misurabile.
Nei test su otto benchmark che coprono programmazione, lavoro d'ufficio e progettazione ingegneristica, con il modello Claude Opus 4.8 lasciato invariato, RRSI guadagna fino a 14,1 punti sui compiti di allenamento e fino a 4,7 punti su cinque prove mai viste, usando circa il 30% di token in meno al momento dell'esecuzione.
Perché conta
Gli agenti sono la promessa commerciale del momento: software che eseguono compiti complessi al posto nostro. Questo studio ricorda che i punteggi sbandierati nei comunicati possono misurare la bravura su un esame specifico più che una competenza reale.
Per aziende e amministrazioni, anche in Italia, è un invito alla prudenza: prima di adottare un agente conviene provarlo su casi concreti e nuovi, non sui test scelti da chi lo vende.

