ИИ Ataraxos стабильно победил чемпиона мира по Stratego

Искусственный интеллект Ataraxos одержал победу над Пимом Неймейером, одним из сильнейших игроков в Stratego. В серии из 20 партий компьютер выиграл 15 раз, один раз уступил и завершил четыре встречи вничью. Система была разработана исследователями из Университета Карнеги — Меллона, Массачусетского технологического института, Нью-Йоркского университета и Стэнфордского университета. Об этом сообщает издание Science XXI.

Для обучения Ataraxos использовали 16 графических процессоров, а затраты составили несколько тысяч долларов. Ранее компьютеры уже обыгрывали чемпионов в шахматах, го и покере, однако Stratego долго оставалась исключением. Даже DeepMind, обладая значительно большими ресурсами, не смогла создать программу, способную стабильно побеждать лучших игроков.

Особенность Stratego заключается в неполной информации о расположении сил противника. У каждого игрока есть 40 фигур, соответствующих воинским званиям от маршала до шпиона, а также бомбы и флаг. Победа достигается захватом вражеского флага, но игрок не знает типов фигур соперника, видя лишь их расположение. Лишь при столкновении раскрываются личности фигур: более слабая уничтожается, а звание победившей становится известным.

По словам исследователя Нью-Йоркского университета и соавтора работы Юджина Виницкого, Stratego отличается «огромным объёмом скрытой информации, которая раскрывается на протяжении очень длительного времени». Соавтор исследования, специалист Массачусетского технологического института Габриэле Фарина, сравнил игру с покером. В техасском холдеме игрок скрывает только две карты, что приводит к 1326 возможным комбинациям.

В Stratego порядок 40 фигур может быть любым, что создаёт более одного дециллиона возможных расстановок. Кроме того, партия может длиться до 2000 ходов, тогда как шахматная игра обычно заканчивается примерно за 40 ходов. Дополнительную сложность добавляет необходимость блефовать: слабую фигуру можно передвинуть так, будто это маршал, чтобы заставить соперника отступить.

Игроку необходимо находить баланс между слишком частым и слишком редким блефом. В первом случае угрозы перестают восприниматься всерьёз, а во втором действия становятся предсказуемыми. Именно эта особенность, как объяснили исследователи, ранее мешала системам искусственного интеллекта, включая DeepNash от DeepMind, успешно играть в Stratego.