Ataraxos batte il miglior giocatore di Stratego di sempre
Un sistema di intelligenza artificiale chiamato Ataraxos ha battuto Pim Niemeijer, considerato il miglior giocatore di Stratego di tutti i tempi, con 15 vittorie, una sconfitta e quattro pareggi in una serie ufficiale di 20 partite. L'addestramento, secondo i ricercatori, è costato meno di 8.000 dollari.
- Ataraxos ha battuto il campione Pim Niemeijer 15 a 1 con quattro pareggi.
- L'addestramento è costato meno di 8.000 dollari, contro i milioni stimati per DeepNash.
- Lo Stratego era uno degli ultimi giochi da tavolo dominati dagli umani.
L'ultima roccaforte dei giochi da tavolo
Ataraxos è stato sviluppato da un gruppo di ricercatori della Carnegie Mellon University, della New York University, di Stanford e del MIT, e il lavoro è stato pubblicato sulla rivista Nature. Secondo gli autori è la prima intelligenza artificiale a raggiungere prestazioni sovrumane in questo gioco.
Nello Stratego ogni giocatore schiera 40 pedine coperte, dal maresciallo alla spia, piĂš bombe e una bandiera da catturare. L'avversario vede dove sono i pezzi ma non quali siano: l'identitĂ si scopre solo nello scontro. È quindi un gioco a informazione imperfetta, come il poker, ma con una quantitĂ enormemente maggiore di dati nascosti: oltre 10 alla 33 schieramenti iniziali possibili, contro le 1.326 mani di partenza del Texas Hold'em. Inoltre, spiega il ricercatore del MIT Gabriele Farina, una partita può durare 2.000 mosse contro le circa 40 degli scacchi, e il bluff è parte integrante della strategia. Niemeijer, olandese, ha vinto quattro campionati mondiali, 15 titoli nazionali e due mondiali online, restando piĂš di 600 settimane in testa alla classifica.
Poca potenza, molta efficienza
Il dato piĂš sorprendente riguarda i costi. DeepMind, con il sistema DeepNash presentato nel 2022, non era riuscita a superare stabilmente i migliori umani: l'addestramento aveva richiesto 1.024 nodi TPU per due o tre mesi, un impegno che gli autori di Ataraxos stimano tra 3 e 4,5 milioni di dollari ai prezzi del 2025. Ataraxos ha invece usato 16 GPU Nvidia H100 per una settimana, piĂš quattro giorni su quattro GPU per la sua rete di credenze: meno di 8.000 dollari, circa un cinquecentesimo del costo di calcolo.
Il sistema impara solo giocando contro se stesso, senza dati umani. La chiave, spiegano gli autori, è una tecnica di regolarizzazione che costringe l'AI a variare schieramenti e mosse invece di irrigidirsi su una strategia prevedibile, allentando poi gradualmente questa pressione. Non esiste un confronto diretto con DeepNash: secondo i ricercatori, DeepMind ha risposto che il vecchio codice non funziona piĂš.
PerchĂŠ conta
Il risultato segna la caduta di uno degli ultimi giochi da tavolo competitivi in cui gli esseri umani erano ancora superiori alle macchine, dopo gli scacchi nel 1997 e il Go nel 2016. Ma il messaggio piĂš rilevante è un altro: un gruppo accademico con risorse di calcolo limitate ha ottenuto, grazie a un simulatore scritto su misura e a una maggiore efficienza nell'uso dei dati, ciò che non era riuscito a un laboratorio con budget enormi. Un segnale incoraggiante per universitĂ e centri di ricerca europei e italiani, spesso esclusi dalla corsa alla potenza di calcolo.
