论文提出任务感知提示词重写器TAPR,使用基于GRPO的强化学习训练Phi-4-mini-instruct,使模型根据任务改写用户提示词,并通过LLM-as-judge同时评估改写提示词及其任务输出。在问答、摘要和算术推理任务上,作者报告了相对基础模型的持续改进,涉及Natural Questions与GSM8K等基准。
最近 24 小时暂无可用热度快照。