DungeonBench以《龙与地下城》2014版SRD战斗规则构建战术推理基准,保留几何、时机、行动经济与资源管理等机制。基准包含单场战斗的Encounter轨道,以及跨战斗继承生命值、法术位、消耗品和休息决策的Day轨道。摘要称前沿语言模型虽常能赢得单场战斗,但在长期资源预算、休息时机和规则纪律上仍有明显不足。
最近 24 小时暂无可用热度快照。