AI消息速览

DungeonBench——基于《龙与地下城》战斗的规则密集战术推理基准

事件日期 2026-07-31 · 学术前沿 · 已接受

事件日期2026-07-31
信息日期2026-07-31
入库日期2026-08-04
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:DungeonBench——基于《龙与地下城》战斗的规则密集战术推理基准

  • 英文标题:DungeonBench: A Benchmark for Rules-Rich Tactical Reasoning in Dungeons & Dragons Combat
  • 英文关键词:DungeonBench; tactical reasoning; benchmark; D&D combat; rules-rich
  • arXiv ID:2607.29577v1

一句话结论

DungeonBench 是一个面向《龙与地下城》战斗场景的规则密集战术推理基准,目前前沿语言模型策略在单场遭遇战中常能获胜,但在跨遭遇战的连续“一日”场景中暴露出资源预算、休息时机和规则意识上的明显不足。

事件概述或研究问题

现有游戏与模拟器基准虽然能把决策转化为可测量的结果,但许多基准对“规则密集的战术推理”测试不足。DungeonBench 专门考察模型在几何、时机、资源、目标与规则交互同时起作用时能否做出高质量选择。

该基准基于 2014 年《系统参考文档》(System Reference Document, SRD)中大部分与战斗相关、且可由模拟器解析效果的内容构建,并保留了简化战斗模拟器通常会抽象掉的机制。

方法/产品要点

  • 每一步暴露完整的战术观察、待决决策,以及可执行选项的索引列表。
  • 选项涵盖移动、攻击、法术、反应、目标、准备行动和稀缺资源。
  • 核心任务是对合法选择进行估值,其后果依赖行动经济、生物特质、战场几何、时机窗口和后续遭遇。
  • 包含两条轨道:
    • Encounter:评估单场战斗中的局部战术表现;
    • Day:通过持久生命值、法术位、消耗品、准备和短休时机连接多场遭遇,迫使模型在即时战术优势与未来生存能力之间做权衡。
  • 同一引擎生成的决策流可支持启发式控制器、语言模型策略、学习型选项排序器以及带动作掩码的强化学习智能体。
  • 论文在该共享决策流上评估了前沿语言模型策略。

主要结果或产业意义

  • 完整战术观察并未使该基准饱和,说明当前模型仍有明显提升空间。
  • 前沿策略往往能赢下单场直接遭遇战,但在一整天的关联遭遇战中暴露以下失败模式:
    • 资源预算不足;
    • 休息时机选择不当;
    • 规则感知的战术纪律欠缺。

为什么重要

DungeonBench 把游戏规则引擎变成可复用的决策测试平台,补充了现有基准对多因素交织战术推理的覆盖不足。与已有卡片对比,它不属于视觉合成或语音自然度评估,而是聚焦“规则密集的战术决策”。增量信息在于:它不只评测单场战斗的即时决策,还加入跨遭遇战的资源与休息规划,能区分“局部能赢”和“长期能活”的智能体能力。

局限与不确定性

  • 论文未在现有摘要中披露基准规模、任务数量、标注方式以及具体模型得分,相关数值待核实。
  • 摘要中的“vast majority of combat-relevant 2014 SRD content”未给出精确覆盖比例,具体覆盖范围待核实。
  • 基准是否只适用于 D&D 2014 SRD 规则、能否迁移到其他规则系统,目前待核实。
  • 引擎可解析效果被作为入选条件,因此可能遗漏规则复杂但模拟器难以处理的战斗内容。

可用于图书/PPT/简报的角度

  • 以 D&D 战斗为案例,讨论“规则密集型推理”为何比简单游戏决策更考验 AI 模型。
  • 展示“连续遭遇战”设计如何暴露大语言模型在长期资源规划上的短板。
  • 说明游戏模拟器作为 AI 评估平台的价值:可重复、可量化、可扩展到不同策略算法。

原始材料

  • 原始来源:https://arxiv.org/abs/2607.29577v1
  • 标题:DungeonBench: A Benchmark for Rules-Rich Tactical Reasoning in Dungeons & Dragons Combat
  • 作者:Ismayil Ismayilov, Atakan Kara, Kaan Oktay
  • 发布时间:2026-07-31
  • 主要分类:cs.AI;相关分类:cs.LG