知识卡片:DungeonBench——基于《龙与地下城》战斗的规则密集战术推理基准
- 英文标题:DungeonBench: A Benchmark for Rules-Rich Tactical Reasoning in Dungeons & Dragons Combat
- 英文关键词:DungeonBench; tactical reasoning; benchmark; D&D combat; rules-rich
- arXiv ID:2607.29577v1
一句话结论
DungeonBench 是一个面向《龙与地下城》战斗场景的规则密集战术推理基准,目前前沿语言模型策略在单场遭遇战中常能获胜,但在跨遭遇战的连续“一日”场景中暴露出资源预算、休息时机和规则意识上的明显不足。
事件概述或研究问题
现有游戏与模拟器基准虽然能把决策转化为可测量的结果,但许多基准对“规则密集的战术推理”测试不足。DungeonBench 专门考察模型在几何、时机、资源、目标与规则交互同时起作用时能否做出高质量选择。
该基准基于 2014 年《系统参考文档》(System Reference Document, SRD)中大部分与战斗相关、且可由模拟器解析效果的内容构建,并保留了简化战斗模拟器通常会抽象掉的机制。
方法/产品要点
- 每一步暴露完整的战术观察、待决决策,以及可执行选项的索引列表。
- 选项涵盖移动、攻击、法术、反应、目标、准备行动和稀缺资源。
- 核心任务是对合法选择进行估值,其后果依赖行动经济、生物特质、战场几何、时机窗口和后续遭遇。
- 包含两条轨道:
- Encounter:评估单场战斗中的局部战术表现;
- Day:通过持久生命值、法术位、消耗品、准备和短休时机连接多场遭遇,迫使模型在即时战术优势与未来生存能力之间做权衡。
- 同一引擎生成的决策流可支持启发式控制器、语言模型策略、学习型选项排序器以及带动作掩码的强化学习智能体。
- 论文在该共享决策流上评估了前沿语言模型策略。
主要结果或产业意义
- 完整战术观察并未使该基准饱和,说明当前模型仍有明显提升空间。
- 前沿策略往往能赢下单场直接遭遇战,但在一整天的关联遭遇战中暴露以下失败模式:
- 资源预算不足;
- 休息时机选择不当;
- 规则感知的战术纪律欠缺。
为什么重要
DungeonBench 把游戏规则引擎变成可复用的决策测试平台,补充了现有基准对多因素交织战术推理的覆盖不足。与已有卡片对比,它不属于视觉合成或语音自然度评估,而是聚焦“规则密集的战术决策”。增量信息在于:它不只评测单场战斗的即时决策,还加入跨遭遇战的资源与休息规划,能区分“局部能赢”和“长期能活”的智能体能力。
局限与不确定性
- 论文未在现有摘要中披露基准规模、任务数量、标注方式以及具体模型得分,相关数值待核实。
- 摘要中的“vast majority of combat-relevant 2014 SRD content”未给出精确覆盖比例,具体覆盖范围待核实。
- 基准是否只适用于 D&D 2014 SRD 规则、能否迁移到其他规则系统,目前待核实。
- 引擎可解析效果被作为入选条件,因此可能遗漏规则复杂但模拟器难以处理的战斗内容。
可用于图书/PPT/简报的角度
- 以 D&D 战斗为案例,讨论“规则密集型推理”为何比简单游戏决策更考验 AI 模型。
- 展示“连续遭遇战”设计如何暴露大语言模型在长期资源规划上的短板。
- 说明游戏模拟器作为 AI 评估平台的价值:可重复、可量化、可扩展到不同策略算法。
原始材料
- 原始来源:https://arxiv.org/abs/2607.29577v1
- 标题:DungeonBench: A Benchmark for Rules-Rich Tactical Reasoning in Dungeons & Dragons Combat
- 作者:Ismayil Ismayilov, Atakan Kara, Kaan Oktay
- 发布时间:2026-07-31
- 主要分类:cs.AI;相关分类:cs.LG