旧做法:调数值,改的是难度的“量”

大多数动态难度调整(DDA,根据玩家表现实时调节挑战强度)至今仍停留在数值层:敌人血量、伤害倍率、掉落概率、复活点距离。触发条件也很朴素,比如玩家连续失败几次就降一档。这套做法成本低。

2026年的一篇DDA综述把这条脉络梳理为从基于规则,到数据驱动的玩家建模,再到强化学习,并指出静态难度无法兼顾玩家能力差异与偏好随时间的变化。它同时提到当前研究的几个瓶颈:目标设定不一致,缺少统一的评价标准,基准测试难以复现。需要说明的是,这篇综述的摘要并未涉及关卡结构修改和大模型,下面关卡修改的部分来自另一项研究,我们不把两者混为一谈。

数值调整的局限可以用一个假设场景说明。设想“灰烬回廊”里有一段三连跳平台,第二块平台的间距偏大。卡在这里的玩家,问题出在跳跃落点的精度,改Boss血量、加回血道具都碰不到症结。数值能改变“要打多久”,却改不了“路本身长什么样”。关于关卡结构为何成为下一个调整对象,可以参考动态难度只改数值为什么不够一文里的拆解。

新做法:先判断技能,再改结构,最后验证

2026年发表在《Scientific Reports》的一项研究给出了一套完整流程。它先用强化学习智能体生成三种技能水平的行为轨迹,再混入人工采集并聚类标注的真人游玩数据,训练分类器把玩家分为专家、普通、新手三档。论文报告的总体分类准确率为97.82%,这个数字只属于该论文自有的数据集与分类器,不能直接搬到别的游戏上。

分类结果随后驱动一个两阶段的大模型流程:第一阶段把“新手”这类技能条件提示,扩展成结构化的修改指令;第二阶段把指令应用到当前的关卡片段上。最后一道工序是基于图最短路径的物理约束验证器,用来检查修改后的关卡是否仍然存在一条能走通的路。论文在《超级马里奥》关卡上评测,报告修改后的可玩率在整关粒度为74.1%,在单个关卡片段粒度为83.5%,原始关卡的基线为80.0%。这些数字都限定在“Super Mario Bros.关卡、该论文自有的分类器与两阶段流程”这一条件下。

更早一些,有研究尝试双智能体的思路:一个智能体学习模仿某位玩家,另一个用强化学习去击败它,从而得到贴近这位玩家水平的对手强度,验证场景是格斗游戏。还有研究把多人关卡平衡当作程序化内容生成问题,用强化学习为不同玩家类型生成更均衡的关卡,同时发现玩家类型的差距越大,平衡越难达成。

把这些工作放在一起,能看出一个共同倾向:先建模玩家,再决定改什么,改完再检查。这是我们的归纳,不代表行业已普遍这样做,只能说有研究开始尝试。

可以读的技能信号与可以改的空间

下面是我们的设计取向,不是论文内容,也不是已上线的能力。技能信号大致有几类:跳跃落点的误差分布、失败集中出现的位置、两次操作之间的间隔、是否使用过捷径、通关用时的波动。单看失败次数太粗,同样失败七次,可能是手速不够,也可能是没看懂机关。

可编辑的空间则要划出边界。适合调整的有平台间距、敌人摆放、检查点位置、补给点、提示出现的时机、分支路线的长短。不适合触碰的有主线任务节点、关键道具的获取条件、成就判定相关的结构。前者属于难度的形状,后者属于游戏的骨架,骨架被改动,玩家之间就没有可比的体验了。

新问题:验证只是底线,不是终点

第一个问题是可通行不等于好玩。路径验证器只回答“有没有一条路”,回答不了“这条路有没有乐趣”。上面那篇论文的可玩率没有达到百分之百,也说明大模型生成的修改会出错,验证环节是必需品,而不是可选项。我们倾向于把可达性、无死路、关键任务不被破坏这三项都做成硬性闸门,不通过的修改一律丢弃,退回原关卡。

第二个问题是分类器边界,训练数据来自强化学习智能体和人工采集,覆盖不到刻意不走捷径的探索型玩家。

第三个问题是玩家的感受。如果关卡在玩家背后悄悄变宽,他迟早会发现,并怀疑自己的通关是“被放水”得来的。这类风险在AI动态调难度以后玩家会不会觉得被放水里有更完整的讨论。第四个问题是评价:综述提到的评价标准缺失,意味着我们很难说清一次改动到底算不算成功,是通关率上升,是停留时间变长,还是玩家自己说“这一段打得舒服”。

对玩家体验的影响

做得好的时候,玩家感受不到系统的存在:那段三连跳依然要跳,只是缺口刚好在他努力一下能够到的范围内,或者在他连续失败后,路边多出一个不起眼的落脚点。做得差的时候,玩家会发现关卡每次进入都略有不同,熟练带来的成就感被稀释,甚至觉得辛苦练出来的技术没有意义。

喜欢硬核挑战的玩家可能宁愿卡十次也不想被照顾,玩家应当始终保有手动难度选择权,自动调整只是默认方案,并且要能关掉。关卡因人而异后,日志还得记下玩家当时玩的关卡版本,否则线上问题无法复盘。对于因为“不知道往哪走”而卡住的玩家,改关卡未必是第一选择,先判断卡点的成因往往更划算,这在连续失败10次是否应该自动变简单里有过拆解。

我们的判断

我们的判断有四点。其一,关卡结构修改是值得试验的方向,但目前公开的证据集中在《超级马里奥》这类横版关卡和少数小规模实验上,不宜推广成对所有游戏都有效。其二,任何由大模型产生的关卡改动,都应先过验证再上线,验证不通过就回退。其三,改动要可解释、可关闭,玩家能看到当前的难度档位,也能自己拨回去。其四,评价要事先定义,先想清楚“成功”指什么,再决定去改。

爱游戏AI在这一块的做法是设计取向,而不是已验证的成绩:先做玩家技能建模,再划定可编辑范围,用规则验证器做兜底,并保留人工复核。这些还需要在具体的游戏里,由真实玩家的反馈来检验。

公开来源

  • 2026年《Scientific Reports》的一项研究:玩家技能分类、大模型两阶段修改关卡、图最短路径验证。论文标题《Adaptive level modification via player skill classification and large language models》。论文页面
  • 2026年《Applied and Computational Engineering》的DDA综述:从规则到强化学习的演进与研究瓶颈。论文标题《Dynamic Difficulty Adjustment in Games: From Rules to Reinforcement Learning》。论文页面
  • 2024年的一项预印本:模仿玩家的智能体与击败它的强化学习智能体,在格斗游戏环境中演示。论文标题《Personalized Dynamic Difficulty Adjustment -- Imitation Learning Meets Reinforcement Learning》。arXiv页面
  • 2025年FDG会议:用强化学习为不同玩家类型平衡关卡。论文标题《Level the Level: Balancing Game Levels for Asymmetric Player Archetypes With Reinforcement Learning》。arXiv页面