论文提出“LLM即导师”框架,用同一个模型同时充当考官与提示生成器:先比较策略在不同提示上的输出,识别缺乏挑战性的样本,再通过追加原子约束逐步提高难度。该方法在三个复杂指令遵循基准上优于静态提示、策略无关方法及既有策略自适应方法,但摘要未报告具体基准名称和提升幅度。
最近 24 小时暂无可用热度快照。