先写下假设,再让机器人上场
把“让机器人先测一下平衡”当成一个模糊任务,得到的只会是一堆没人看的曲线。爱游戏AI的做法是把它当作一次小实验,先写下可以被推翻的假设。
假设场景如下:虚构的关卡“灰烬回廊”末尾有一个三段式Boss,策划刚把第二阶段的攻击频率调高。他们的假设是:新手玩家仍然能在合理次数的尝试内通过,高手不会因为第二阶段变得太难而丢掉从容感。这两条都可以用机器人做初步检验,但检验的是“在机器人的行为模型下是否成立”,这一点后面会反复强调。
设置:怎样构造不同水平的机器人
不同水平的Agent不是简单地写三套脚本,而是从同一个基础能力出发,逐项施加限制。常用的限制手段有四类。
- 反应延迟:新手Agent在看到攻击预警后要过更长时间才能响应,高手则接近能力上限。
- 动作噪声:在输出的动作上叠加随机偏差,模拟走位不精确、技能释放时机不准。
- 信息可见范围:新手Agent看不到屏幕外的信息,也不会主动利用敌人的行为规律;高手则会学习并记住攻击顺序。
- 训练阶段:把强化学习训练过程中不同阶段的策略保存下来,早期的策略近似新手,中后期的近似熟练玩家。
这四个旋钮可以组合。同一个基础模型套上不同的限制,比另外训练三个完全不同的模型更容易控制变量:所有差异都来自限制,而不是训练随机性。
每一档要运行足够多次,因为单次运行的结果噪声很大。同一关卡、同一档位、不同随机种子,重复跑,再看分布而不是看单次结果。
读数:看哪些指标
一次运行会产生大量数据,但真正对平衡有意义的指标并不多。
| 指标 | 回答的问题 | 需要小心的地方 |
|---|---|---|
| 通过率与平均尝试次数 | 这档水平能不能过,大约要试几次 | 机器人不会因为沮丧而放弃,尝试次数会比真人更“耐心” |
| 资源消耗 | 药水、弹药、耐久是否被大量消耗,是否出现资源断档 | 机器人可能过度囤积或过度挥霍,与真人习惯不同 |
| 死亡位置分布 | 失败集中在哪个阶段、哪个区域 | 集中不等于设计有问题,也可能是预期的难点 |
| 策略分布 | 通关路线是否高度单一,是否存在一招鲜 | 机器人的策略空间受动作集限制,可能漏掉真人的创造性打法 |
| 耗时 | 各档水平通过关卡需要多长时间 | 耗时受机器人运行速度影响,需要换算为游戏内时间 |
解读:读数意味着什么
回到“灰烬回廊”的例子。假设读数显示:新手档的Agent在第二阶段的死亡集中在Boss的一个扇形范围攻击之后,高手档则几乎不受影响。这说明什么?
数据本身只给出“死在哪里”,并不给出“为什么”。至少有三种解释:
- 数值问题:扇形攻击的伤害或范围过大,新手在没有资源余量的情况下一次失误就会死亡。
- 信息问题:攻击的预警不够明显,新手Agent的感知模型没有足够信号,真人玩家可能也会看不清。
- 模型问题:新手档的反应延迟设得太大,代表的不是真实新手,而是一个过于迟钝的机器人。
要区分这三种解释,需要继续实验:只调高预警时长再跑一次;只降低伤害再跑一次;或者调整延迟参数,看结论是否稳定。如果结论对模型参数非常敏感,就不能把它当成对真人的预测,而应当作“这个位置值得真人重点观察”的线索。这也与玩家连续失败时不应轻易判断为“太难”的思路一致:失败数据要先归因,再决定改什么。
还有一种常见读数是“三档通过率差异过小”。这可能意味着关卡缺少区分度,也可能说明限制手段没有真正改变机器人的能力,此时应先检查机器人本身,而不是马上改关卡。
局限:机器人测不出的东西
平衡测试的价值建立在“机器人的行为足够像某类玩家”这个前提上,而这个前提只能部分成立。
- 策略与真人不同:机器人擅长执行既定策略,却缺少好奇心。真人会因为“想看看会发生什么”而尝试奇怪路线,也会因为直觉而放弃一个最优解。
- 测不出乐趣:一个关卡通过率合适,不代表玩起来有趣。挫败感、公平感、成就感这些主观体验,机器人无从感知。
- 学习曲线不同:真人会从失败中逐步理解Boss机制,而机器人的“学习”是训练过程,二者的进步方式并不对应。
- 对既有设计有偏好:如果机器人是在某一版本上训练的,它天然更擅长这一版本的套路,对新机制反而可能表现失真。
因此,机器人给出的通过率不应被写成“真人通过率”,只能写成“该类Agent在此设置下的通过率”。这两者之间的差距,需要靠真人数据来校准,爱游戏的报告里也会把这一标注保留下来。
与真人测试怎么分工
爱游戏AI倾向于把机器人放在真人测试之前和之间。
真人测试之前,机器人用来筛掉明显问题:某档水平完全无法通过,某类资源在流程中明显不够,某个区域死亡异常集中。这样可以避免让真人试玩员浪费时间去发现一个数值填错的Boss。
真人测试之间,机器人负责回归对照:策划每改一次数值,机器人快速重跑,与上一版的读数比较,观察变化方向是否符合预期。变化幅度大的地方,再交给真人做主观确认。
真人测试则承担机器人做不了的部分:手感、节奏、挫败与惊喜、提示是否易懂、玩家是否愿意再来一次。此外,平衡结论一旦要影响动态难度的调节策略,也必须回到真人数据上验证,而不是只依靠机器人的模拟。
可以把机器人理解为一台成本较低的“预演设备”。它能告诉策划哪里值得担心,却不能宣布哪里已经平衡。