论文提出将机器可读SOP约束编译为可执行伪代码,并由程序引导的栈式运行时分页呈现当前活动帧,让LLM负责语义执行。SOPBench覆盖六个模型,结果显示编译文本最高提升16.0分;强模型受益,弱模型反而受损。Bank任务三种主配置从70.4升至86.4和92.8,且拒答正确率达到100%。
最近 24 小时暂无可用热度快照。