奖励模型领域的系统性综述 | 285+ 论文 | 29 Benchmark | 2017-2025
奖励模型(Reward Model, RM) 是一种将输入-输出对映射到标量奖励信号的函数:r = R_ψ(x, y)
奖励模型在 LLM 的全生命周期中扮演"教师"角色,通过提供反馈信号指导模型持续改进。
学习显式的奖励函数(分类/排序/回归)
ImageReward, VisionReward, PairRM
通过生成过程隐式建模奖励
GenRM, Self-Rewarding, Auto-J
利用 LLM 内部状态或无训练方法
Co-Reward, 基于概率的方法
奖励模型在数据处理、强化学习训练、测试时扩展三阶段的应用
共收录 285 篇论文,涵盖判别式、生成式、隐式三大 RM 范式
加载中...
😔 没有找到匹配的论文
尝试调整筛选条件或搜索关键词
整理了 29 个评估基准,分为三大类
| 名称 | 领域 | 规模 | 描述 |
|---|