Edizione della sera · 5 ottobre 2026

Gli agenti IA che si riscrivono imparano i test a memoria

Ricercatori di Google Cloud AI Research e di alcune università hanno mostrato che gli agenti di intelligenza artificiale capaci di riscrivere la propria struttura di lavoro tendono a imparare a memoria i test su cui vengono allenati, migliorando i punteggi senza diventare davvero più capaci.

Google
Immagine: Asoundd / Wikimedia Commons, CC BY-SA 4.0

Che cos'è la harness

Un agente IA non è solo un modello linguistico: attorno al modello c'è quella che i ricercatori chiamano harness, cioè l'impalcatura fatta di istruzioni, flussi di lavoro, strumenti, memoria e regole che decide che cosa il modello vede a ogni passaggio. È la harness a determinare se l'agente legge il file giusto prima di modificarlo, se si riprende dopo un errore e se consegna un risultato ordinato.

Secondo lo studio, buona parte dei progressi recenti degli agenti viene proprio dal lavoro su questa impalcatura, non da modelli nuovi. Finora la si correggeva a mano; oggi si può chiedere a un modello linguistico di riscriverla da solo, più volte, sulla base dei risultati ottenuti nei test. I ricercatori lo definiscono una forma pratica di automiglioramento ricorsivo.

Il trucco di imparare le prove a memoria

Il problema è che l'agente lavora sempre sullo stesso insieme limitato di prove e finisce per memorizzarle. I punteggi sui compiti di allenamento salgono, mentre i miglioramenti su compiti mai visti si riducono o spariscono. Succede in vari modi: l'agente memorizza schemi validi solo per un benchmark, premia soluzioni fortunate e accumula complessità inutile che alza il voto senza alzare la qualità.

Il metodo proposto si chiama RRSI e interviene in due momenti. Quando l'agente propone modifiche, un budget limita quante ne può raggruppare in una volta, e questo budget si restringe col tempo: prima riscritture ampie, poi solo ritocchi tracciabili. Quando si decide quali modifiche tenere, un critico scarta quelle che inseriscono scorciatoie come nomi di compiti o soluzioni predeterminate, e i costi di calcolo più alti vengono accettati solo se portano un guadagno misurabile.

Nei test su otto benchmark che coprono programmazione, lavoro d'ufficio e progettazione ingegneristica, con il modello Claude Opus 4.8 lasciato invariato, RRSI guadagna fino a 14,1 punti sui compiti di allenamento e fino a 4,7 punti su cinque prove mai viste, usando circa il 30% di token in meno al momento dell'esecuzione.

Perché conta

Gli agenti sono la promessa commerciale del momento: software che eseguono compiti complessi al posto nostro. Questo studio ricorda che i punteggi sbandierati nei comunicati possono misurare la bravura su un esame specifico più che una competenza reale.

Per aziende e amministrazioni, anche in Italia, è un invito alla prudenza: prima di adottare un agente conviene provarlo su casi concreti e nuovi, non sui test scelti da chi lo vende.

La domanda di questa edizione
E voi, vorreste un data center vicino a casa vostra?
💬 Rispondi nei commenti su Instagram
Copertina del Reel
Edizione della sera · 5 ottobre 2026
Questa notizia è nel notiziario in video
▶ Guarda il ReelApri su Instagram

Nella stessa edizione

sera · 5 ottobre 2026

AWS dice stop agli accordi di riservatezza sui data center

Il CEO di AWS Matt Garman annuncia la fine degli NDA con le agenzie pubbliche e risponde alle critiche sui data center.

sera · 5 ottobre 2026

Oltre cento moratorie negli Usa e nuovi sgravi per i data center rurali

Negli Stati Uniti si discutono oltre cento moratorie sui data center, mentre dal primo gennaio scattano nuovi vantaggi fiscali per le aree rurali.

sera · 5 ottobre 2026

Altman prende le distanze dalle letture religiose dell'IA

Il CEO di OpenAI dice di sentirsi a disagio quando si attribuisce una forza spirituale ai modelli: per lui è un problema di sicurezza.