ThinkingBox: gli agenti AI dicono fatto, ma il database dice il contrario
Microsoft e Hugging Face hanno presentato ThinkingBox, un benchmark che valuta gli agenti AI guardando lo stato finale del database invece delle azioni dichiarate. Su 121.680 esecuzioni valide, 79.853 non hanno superato i controlli automatici.
- ThinkingBox valuta gli agenti sullo stato finale del database, non sulle azioni dichiarate.
- Su 121.680 prove valide, 79.853 hanno fallito i controlli automatici.
- Nel 67,24% dei fallimenti l'agente aveva chiuso il compito senza segnalare errori.
Un esempio concreto
Nel caso descritto dai ricercatori, una cliente segnala che un elettrodomestico da 745 dollari è bloccato da quindici giorni in un centro di smistamento. L'agente lavora in modo apparentemente impeccabile: nove chiamate agli strumenti a disposizione, controlla l'ordine, la spedizione, il profilo cliente, legge due volte la politica sui rimborsi e apre un ticket di assistenza.
Poi chiude il ticket come risolto e chiede se può fare altro. Ma il problema con il corriere è ancora aperto: lo stato corretto del ticket sarebbe stato in sospeso, e la cliente non ha ricevuto una risposta vera. Chi avesse valutato solo le azioni compiute avrebbe visto nove passaggi ben formati. È il database a dire che il lavoro non era finito.
Come cambia il modo di misurare
Di solito i test sugli agenti guardano le risposte finali e le chiamate agli strumenti, cioè i comandi con cui l'agente usa software esterni. ThinkingBox fa un'altra cosa: su 507 flussi di lavoro aziendali, eseguiti venti volte ciascuno a partire da un sistema pulito e identico, controlla lo stato finale dei dati e gli effetti collaterali lasciati dietro.
I numeri sono netti. Tra le prove fallite, il 67,24% si era conclusa in modo regolare, con una modifica ai dati e senza segnalare alcun errore. I controlli automatici hanno trovato valori sbagliati nel 77,61% dei casi, effetti non voluti nel 43,30% e azioni richieste ma mancanti nel 25,36%; le categorie in parte si sovrappongono. Gli autori insistono anche su un altro punto: un successo isolato non è affidabilità, e per questo ogni compito viene ripetuto venti volte.
Perché conta
Se un agente può chiudere un compito dichiarandolo risolto mentre lascia dati errati, il rischio non è l'errore evidente ma quello silenzioso, che nessuno nota finché non arriva un reclamo o una perdita economica.
Per chi in Italia sta valutando agenti nel servizio clienti, nella logistica o nell'amministrazione, il messaggio pratico è che i criteri di collaudo vanno spostati sul risultato nei sistemi, non sull'apparenza della conversazione. Il benchmark è eseguibile anche da altri tramite OpenEnv, quindi le aziende possono provare a verificarlo in proprio.

Fonti
- Hugging Face: The Agent Said It Was Done. The Database Disagreed.

