25 阶代表什么

训练阶梯由二十五阶组成,从第 1 阶到第 25 阶。每阶都有明确的目标 Elo,间隔一百分:第一阶为 100,最后一阶为 2500。游戏代码中计算这个目标的函数,只是把阶数乘以一百。这些不是测得的评分,而是预先设定的目标,为初识终极井字棋的玩家提供清晰的阶梯。

页面本身也说得很清楚:在尚未进行校准对局时,当前选中的机器人旁会显示「临时 Elo」,而不是一个测得的数值。这是经过考虑的选择,并非随手勾选的承诺。二十五个机器人和两个参考基准都在等待一轮测量,之后显示的目标才可能成为实际测得的 Elo。这份坦诚是优点,不是需要遮掩的尴尬:它准确说明页面知道什么、还有什么未知,而不把假设包装成定论。

各阶之间究竟改变了什么

第 1 阶和第 25 阶的真正区别,可以在机器人的配置文件中核实,而不是靠营销承诺。整个阶梯有两项参数逐步变化:搜索模拟次数从 2 增至 64,温度从 1.6 降至 0.1。第一个数字表示算法在确定落子前会探索多少条落子序列:第 1 阶为 2 次,第 25 阶最多 64 次,也就是最高阶的探索量为最低阶的三十二倍。

第二项参数温度,决定最终选择有多接近搜索中评分最高的选项:高温度允许更多样的落子,低温度则几乎总会把选择集中到评分最高的候选上。这两个参数改变了机器人作决定的方式,但还没有提升支撑决定的判断质量:给每个局面评分的网络尚未训练,下一节会解释这一点。

引擎是怎样设计的

引擎的设计是神经网络结合 MCTS(Monte Carlo Tree Search,蒙特卡洛树搜索):网络将给出局面评估和有潜力的落子,搜索树再通过模拟后续落子序列检验这些判断。架构已经确定:主干由 4 个块组成,包含 32 个通道;策略头覆盖大棋盘的 81 个格子;价值头有 64 个隐藏单元。但目前,权重仍只来自随机数生成器。

二十五阶目前都指向同一个起点:在等待训练期间,整个阶梯共用同一套权重。计划先通过自我对弈训练,让网络与自己对局,生成自己的学习数据;然后进入晋级竞技场,让每个候选版本挑战此前的最佳版本;最后开展校准,测量每一阶在 Elo 评分尺度上的真实位置。这些都还没有发生。网络还没有学会下棋,仍在等待第一场训练对局。

选择阶位,逐步提高

选择阶位并不需要提前知道自己的水平。如果你只是想和 AI 下井字棋,不想等待真人对手上线,就从第 1 阶开始:这是阶梯最低的入口,升阶之前可以反复挑战,次数不限。阶位列表始终可用,不强制按顺序玩,但对不知道从哪里开始的人来说,沿着阶梯前进会更有方向。

页面的进度条显示你已经击败多少阶,列表中也会为每个已击败的阶位打勾。击败一阶后,最好挑战下一阶,而不是一次跳过好几阶:每阶只会小幅改变机器人搜索落子的方式,逐阶前进能让你有时间感受差别。开局前选择先手、后手或随机,也会改变游戏体验,但不会改变所挑战的阶位。