论文提出 Long-Horizon-Terminal-Bench,包含46项、覆盖9类场景的长程终端任务,并将任务拆分为可评分子任务,以提供中间奖励和部分得分。对15个前沿模型的评测显示,每项任务平均消耗990万token、运行231个episode和85.3分钟;最强模型在部分奖励阈值0.95和满分阈值1.0下的pass@1分别仅为15.2%和10.9%。
最近 24 小时暂无可用热度快照。