论文在五个 LLM 骨干、编程、国际象棋谜题和数学三个领域中,统一使用 GEPA 优化 Self-Refine、Best-of-N、Debate,并与任务直答和 CoT 基线比较。编排平均最多提升 4.6 个百分点,却消耗约 2 至 4 倍总 token;收益不随难度稳定增加,并显著依赖底层模型。
最近 24 小时暂无可用热度快照。