Good Teachers, Better Students

奖励模型领域的系统性综述 | 285+ 论文 | 29 Benchmark | 2017-2025

📖 浏览论文 📄 arXiv (Coming Soon) 💻 GitHub
285+
论文整理
29
评估基准
9
年发展历程
3
RM 范式

🎯 核心概念

奖励模型(Reward Model, RM) 是一种将输入-输出对映射到标量奖励信号的函数:r = R_ψ(x, y)

奖励模型在 LLM 的全生命周期中扮演"教师"角色,通过提供反馈信号指导模型持续改进。

🔹 判别式 RM

学习显式的奖励函数(分类/排序/回归)
ImageReward, VisionReward, PairRM

🔸 生成式 RM

通过生成过程隐式建模奖励
GenRM, Self-Rewarding, Auto-J

🔷 隐式 RM

利用 LLM 内部状态或无训练方法
Co-Reward, 基于概率的方法

🎨 应用流程

RM 应用流程图

奖励模型在数据处理、强化学习训练、测试时扩展三阶段的应用

📅 发展时间线

2017-2025 年 RM 领域的关键里程碑模型

📖 论文列表

共收录 285 篇论文,涵盖判别式、生成式、隐式三大 RM 范式

加载中...

🏆 评估基准

整理了 29 个评估基准,分为三大类

名称 领域 规模 描述