Что означают 25 ступеней

Тренировочная лестница состоит из двадцати пяти ступеней, с 1-й по 25-ю. У каждой есть конкретный целевой Elo с шагом в сто пунктов: 100 у первой, 2500 у последней. Функция в коде игры, рассчитывающая эту цель, лишь умножает номер ступени на сто. Это не измеренные рейтинги, а заранее заданные ориентиры, чтобы новичкам в ультимативных крестиках-ноликах было проще понимать лестницу.

На самой странице это сказано прямо: рядом с выбранным ботом пометка «Предварительный Elo» заменяет измеренное число, пока не сыграны калибровочные партии. Это осознанный выбор, а не галочка, поставленная наспех. Двадцать пять ботов и два эталона для сравнения ждут серии измерений, прежде чем показанная цель станет установленным Elo. Такая честность — достоинство, а не неловкость, которую нужно скрыть: она точно говорит, что странице известно, а что ещё нет, вместо того чтобы выдавать предположение за уверенность.

Что на самом деле меняется от ступени к ступени

Реальное отличие 1-й ступени от 25-й можно проверить в файле конфигурации ботов, а не в рекламном обещании. По всей лестнице меняются два параметра: число поисковых симуляций растёт с 2 до 64, а температура снижается с 1,6 до 0,1. Первое число показывает, сколько последовательностей ходов алгоритм исследует, прежде чем выбрать ход: 2 на 1-й ступени и до 64 на 25-й, то есть наверху объём поиска в тридцать два раза больше, чем внизу.

Второй параметр, температура, определяет, насколько итоговый выбор следует варианту, получившему наивысшую оценку при поиске: высокая температура допускает более разнообразные ходы, низкая почти всегда сужает выбор до лучшего по оценке кандидата. Эти настройки меняют способ принятия решения ботом, но пока не качество суждения, на котором оно основано: сеть, оценивающая каждую позицию, ещё не обучена, как объясняется в следующем разделе.

Как устроен движок

Движок задуман как нейронная сеть в сочетании с поиском по дереву MCTS (Monte Carlo Tree Search): сеть будет предлагать оценку позиции и перспективные ходы, а дерево поиска — проверять эти предположения, моделируя последовательности ходов. Архитектура уже определена: общая часть из 4 блоков с 32 каналами, голова политики для 81 клетки большого поля и голова ценности с 64 скрытыми нейронами. Но пока её веса получены только из генератора случайных чисел.

Все двадцать пять ступеней пока указывают на одну исходную точку: единственный набор весов, общий для всей лестницы в ожидании обучения. Планируется обучение через self-play: сеть играет против себя и создаёт собственные обучающие данные. Затем — отборочная арена, где каждый кандидат встречается с лучшей предыдущей версией, и серия калибровочных игр, чтобы измерить реальное положение каждой ступени на шкале Elo. Ничего из этого ещё не происходило. Сеть не научилась играть: она всё ещё ждёт свою первую тренировочную партию.

Выберите ступень и развивайтесь

Чтобы выбрать ступень, не нужно заранее знать свой уровень. Если ты просто хочешь сыграть в крестики-нолики против ИИ, не дожидаясь подключения человека, начни с 1-й ступени: это самая низкая точка входа на лестницу, и её можно проходить снова столько раз, сколько нужно, прежде чем подняться выше. Список ступеней доступен в любой момент: играть по порядку необязательно, но следование лестнице даёт ориентир тем, кто не знает, с чего начать.

Полоса прогресса на странице показывает, сколько ступеней уже пройдено, а галочка отмечает каждую из них в списке. Победив на одной ступени, лучше перейти к следующей, а не перескакивать сразу через несколько: каждая лишь немного меняет то, как бот ищет ходы, и постепенное продвижение позволяет почувствовать разницу. Выбор стороны перед началом партии — первый игрок, второй или случайно — тоже меняет впечатления от игры, не меняя ступень соперника.