先说结论:能做长任务,但不能当成“自动找Bug”
2025年以来,游戏测试领域出现了一批让大模型直接充当测试员的研究。它们的共同点是:不再让程序按固定脚本点击,而是让模型读取游戏状态,自己决定下一步做什么,并在过程中判断结果对不对。爱游戏关注这类工作,是因为它触及测试机器人最难的部分:任务链很长,中间任何一步出错,后面全部白跑。
需要先声明:下面提到的数字和结论都属于各自论文的实验条件,并不是爱游戏自己的测试成绩。爱游戏的测试AI目前只谈设计思路,不报告发现了多少Bug。
能做到什么
把庞杂的界面变成模型看得懂的状态
商业级游戏的画面、背包、任务面板和队伍状态加起来信息量极大,直接塞给大模型既贵又乱。2025年的一项研究提出名为TITAN的测试Agent,第一步就是对高维游戏状态做感知与抽象,只保留和决策相关的部分,比如当前任务阶段、可交互对象、资源数量。
在可选动作里做排序,而不是盲目试
同一时刻游戏里可做的操作可能有几十种。TITAN会主动优化并排序可用动作,让模型优先考虑与当前目标有关的操作。
用轨迹记忆和反思撑住长流程
长任务的核心难点不是单步决策,而是“走到第三十步时还记得前面发生过什么”。该论文的做法是保存动作轨迹,并在失败之后做反思式自我纠错:上一次卡在哪里、哪个动作没有生效、这次换什么路径。两款覆盖PC与移动端的大型商业MMORPG是它的评测对象,论文报告任务完成率达到95%,缺陷检测优于其选定的对比方法,还检出了4个此前方法没有发现的缺陷,并称已部署到8条真实游戏QA流水线。这些是该论文在特定游戏和对比条件下的成果,不能推到别的游戏上,更不是爱游戏的成果。
让Oracle来判定“这算不算异常”
能一路走下去,只是完成了探索;要发现Bug,还得有人说“这个结果不对”。TITAN用大模型充当Oracle(测试判定者),检测功能性与逻辑性缺陷,并生成诊断报告。这和传统的固定断言不同:断言只能验证写死的期望,而大模型能在“任务显示已完成但奖励没发放”这类语义层面的矛盾上给出判断。测试Oracle如何判断一个结果是不是Bug,是爱游戏测试设计里单独拆出来讨论的问题。
还做不到什么
自主找缺陷的覆盖率远没到可以放手的程度
2026年发布的GBQA基准给出了一个清醒的参照:它包含30个游戏、124个经过人工验证的缺陷,分三个难度等级,并配有带多轮ReAct循环与记忆机制的基线智能体。结果显示,最好的模型在该基准和该基线智能体的条件下,只发现了48.39%的已验证缺陷。让大模型自己找Bug,距离“可靠地替代人”还很远。
视觉类问题依然困难
穿模、贴图错乱、动画卡死这类Bug,并不体现在任务状态里。2026年有研究专门构建了含5238段标注游玩视频、覆盖120款游戏的数据集,去评测视频层面的glitch检测,并指出这个任务对当前多模态模型仍然很有挑战。“读状态做逻辑判断”和“看画面找异常”是两种能力。
成本、上下文与误报
长任务意味着长上下文和大量模型调用。轨迹越积越长,就必须压缩:GBQA的基线采用了分层记忆,近期步骤保留细节,更早的轨迹被压缩成摘要,其中包括去过的地点、拿到的物品、触发的事件和尚未解释的异常。压缩的风险是细节可能在摘要里丢掉。另一个问题是误报:模型把“设计如此”的行为当成Bug,会让评审者花更多时间去核对。
开发环境与真实产品并不一致
2023年一份关于在大型商业游戏中部署强化学习测试智能体的工业实践报告,就把“开发环境可能与最终产品差异很大”列为关键挑战。测试Agent在测试服里表现良好,不保证在正式版本里同样可靠。
怎么用:探索、Oracle、复核三层分工
基于上述研究,爱游戏的设计倾向是把测试Agent拆成三个相互制衡的环节,而不是让一个模型既走路又当法官。
- 探索层负责长任务。它既要走通主线,也要主动尝试异常顺序:中途退出再读档、任务冲突、背包满时领奖励、装备来回切换。测试Agent的长期记忆与反思让它在失败后调整路径,而不是每次从头再来。
- 判定层负责Oracle。判定依据尽量来自游戏规则和结构化状态,让大模型补充语义层面的判断,并要求它输出理由,方便追溯。
- 复核层是真人。原因在于人机协同的研究:2025年的一项实验含800个测试用例、276名参与者,结果是AI辅助显著提升了缺陷识别表现,但当AI判断出错时,会对人的决策产生负面影响。这意味着复核者必须看到原始证据,而不是只读AI的结论。
发现异常后,Agent应记录地图、角色、任务阶段、装备和操作顺序,输出一份简短的复现流程。有了动作轨迹,复现不再是“据说某个版本会崩溃”,而是一串可以回放的步骤。
示例:假设场景(非真实结果) 步骤1 读取存档「灰烬回廊入口」 步骤2 接取任务「熄灭三盏灯」,点亮两盏 步骤3 退出游戏并重新读档 步骤4 任务面板显示已完成,奖励未发放 Oracle判定:状态矛盾,疑似任务进度未保存 待人工复核:确认是否为设计如此
我们的判断
第一,长任务是测试Agent真正与脚本、随机测试拉开差距的地方,TITAN这类结构(状态抽象、动作排序、轨迹记忆加反思、Oracle)值得参考,但它的结果只在该论文的两款游戏和对比条件下成立。
第二,大模型也不必玩得比人好才有用。2024年一项研究发现,大模型玩得不如普通人类玩家,但它在不同关卡上的表现与人类玩家反映的难度有较强的统计相关,因此可以辅助评估难度。
第三,爱游戏不把AI测试当作真人测试的替代。手感、节奏、主观体验仍要人来判断,AI负责扩大探索面、保留轨迹、提出疑点。
公开来源
- 2025年的研究提出面向大型MMORPG的大模型测试Agent,包含状态抽象、动作排序、轨迹记忆与反思纠错、大模型Oracle。论文标题:Leveraging LLM Agents for Automated Video Game Testing,arXiv预印本,2025年。TITAN论文摘要页
- 2026年的游戏QA基准,评测大模型自主发现缺陷的能力。论文标题:GBQA: A Game Benchmark for Evaluating LLMs as Quality Assurance Engineers,arXiv预印本,2026年。GBQA基准摘要页
- 2025年的人机协同游戏测试实验。论文标题:Human-AI Collaborative Game Testing with Vision Language Models,arXiv预印本,2025年。人机协同测试摘要页
- 2026年的视频类游戏glitch检测研究与数据集。论文标题:Open-Ended Video Game Glitch Detection with Agentic Reasoning and Temporal Grounding,arXiv预印本,2026年。视频glitch检测摘要页
- 2024年的研究:大模型不必达到人类水平,也能衡量关卡难度。论文标题:LLMs May Not Be Human-Level Players, But They Can Be Testers,arXiv预印本,2024年。难度测量摘要页
- 2023年的工业实践报告,讨论在大型商业游戏中部署强化学习测试智能体的挑战。论文标题:Technical Challenges of Deploying Reinforcement Learning Agents for Game Testing in AAA Games,arXiv预印本,2023年。工业实践报告摘要页