U Strategu igrač ne vidi koje su protivnikove figure, a umjetna inteligencija sada u njemu pobjeđuje najbolje ljude. Sustav Ataraxos protiv najbolje rangiranog igrača na svijetu ostvario je 15 pobjeda, jedan poraz i četiri remija, a na svjetskom prvenstvu protiv vrhunskih igrača omjer 39 prema 2. Istraživači s MIT-a, Carnegie Mellona, Sveučilišta New York i Stanforda opisali su ga 30. rujna u časopisu Nature.

U šahu i gou oba igrača vide cijelu ploču. Stratego skriva čin svake protivničke figure dok ne dođe do borbe, pa igrač mora nagađati, blefirati i planirati oko onoga što bi moglo biti ondje. Mogućih rasporeda figura ima više od 10⁶⁶, daleko više nego u šahu.

Manje vježbe, jača igra

Ataraxos igra bolje i od DeepNasha, ranijeg Google DeepMindova sustava za Stratego, a trenirao je mnogo manje, navodi tim.

„Naš sustav postiže strogo veću snagu igre od DeepNasha, uz manje od stotinke primjera za treniranje i manje od tridesetine partija protiv samoga sebe”, kaže Gabriele Farina s MIT-a.

Plan u hodu

Ataraxos osnovnu strategiju najprije uči igrajući protiv sebe, metodom koja se zove podržano učenje. U pravoj partiji dodaje drugi korak. Generativni model procjenjuje gdje bi skrivene figure mogle biti, a sustav oko tih procjena planira sljedeći potez.

„U Strategu se pojavi eksplozija mogućih svjetova s kojima se možda morate nositi”, kaže Farina. Metode razvijene za poker, drugu igru sa skrivenim informacijama, ne mogu se nositi s takvim razmjerom.

Istraživači misle da bi pristup mogao pomoći i drugdje gdje su podaci skriveni, u pregovorima ili kibernetičkoj sigurnosti. Te primjene nitko još nije testirao.