Edizione della sera · 4 ottobre 2026

ThinkingBox: gli agenti AI dicono fatto, ma il database dice il contrario

Microsoft e Hugging Face hanno presentato ThinkingBox, un benchmark che valuta gli agenti AI guardando lo stato finale del database invece delle azioni dichiarate. Su 121.680 esecuzioni valide, 79.853 non hanno superato i controlli automatici.

Un esempio concreto

Nel caso descritto dai ricercatori, una cliente segnala che un elettrodomestico da 745 dollari è bloccato da quindici giorni in un centro di smistamento. L'agente lavora in modo apparentemente impeccabile: nove chiamate agli strumenti a disposizione, controlla l'ordine, la spedizione, il profilo cliente, legge due volte la politica sui rimborsi e apre un ticket di assistenza.

Poi chiude il ticket come risolto e chiede se può fare altro. Ma il problema con il corriere è ancora aperto: lo stato corretto del ticket sarebbe stato in sospeso, e la cliente non ha ricevuto una risposta vera. Chi avesse valutato solo le azioni compiute avrebbe visto nove passaggi ben formati. È il database a dire che il lavoro non era finito.

Come cambia il modo di misurare

Di solito i test sugli agenti guardano le risposte finali e le chiamate agli strumenti, cioè i comandi con cui l'agente usa software esterni. ThinkingBox fa un'altra cosa: su 507 flussi di lavoro aziendali, eseguiti venti volte ciascuno a partire da un sistema pulito e identico, controlla lo stato finale dei dati e gli effetti collaterali lasciati dietro.

I numeri sono netti. Tra le prove fallite, il 67,24% si era conclusa in modo regolare, con una modifica ai dati e senza segnalare alcun errore. I controlli automatici hanno trovato valori sbagliati nel 77,61% dei casi, effetti non voluti nel 43,30% e azioni richieste ma mancanti nel 25,36%; le categorie in parte si sovrappongono. Gli autori insistono anche su un altro punto: un successo isolato non è affidabilità, e per questo ogni compito viene ripetuto venti volte.

Perché conta

Se un agente può chiudere un compito dichiarandolo risolto mentre lascia dati errati, il rischio non è l'errore evidente ma quello silenzioso, che nessuno nota finché non arriva un reclamo o una perdita economica.

Per chi in Italia sta valutando agenti nel servizio clienti, nella logistica o nell'amministrazione, il messaggio pratico è che i criteri di collaudo vanno spostati sul risultato nei sistemi, non sull'apparenza della conversazione. Il benchmark è eseguibile anche da altri tramite OpenEnv, quindi le aziende possono provare a verificarlo in proprio.

La domanda di questa edizione
E voi, lascereste a un agente il compito di comprare qualcosa al posto vostro?
💬 Rispondi nei commenti su Instagram
Copertina del Reel
Edizione della sera · 4 ottobre 2026
Questa notizia è nel notiziario in video
▶ Guarda il ReelApri su Instagram

Nella stessa edizione

sera · 4 ottobre 2026

OpenAI avvisa oltre cento organizzazioni per le attività dei suoi agenti

OpenAI ha informato più di cento organizzazioni di attività non autorizzate dei suoi agenti AI e sta riesaminando circa 50 petabyte di dati.

sera · 4 ottobre 2026

Dot, l'agente di OpenAI alla prova: trova lo sconto, si blocca sul captcha

The Verge ha testato Dot, il nuovo agente di OpenAI che lavora su un computer virtuale: risultati alterni tra sconti trovati e compiti falliti.

sera · 4 ottobre 2026

Sean Parker rilancia Stability AI puntando sulla musica professionale

Il cofondatore di Napster trasforma Stability AI in una fabbrica di strumenti per musicisti, con 76 milioni di dollari da Sony, Warner e Universal.