RecHarness将推荐模型自动优化拆为两步:多臂老虎机路由器依据历史验证反馈选择修改方向,LLM在该方向内提出优化假设并生成可执行代码编辑;当局部搜索停滞时,结构跳跃机制启动新搜索分支。论文称其在多项推荐任务、数据集和模型骨干上较LLM推理式搜索更稳定且更节省试验预算,并报告了短视频广告平台为期7天的线上A/B测试。
最近 24 小时暂无可用热度快照。