奖励模型
奖励模型是用于评估策略模型路径的一种方法。虽然在较新的一些方法,如DPO以及GRPO等,他们通过隐式奖励或者可验证问题规避了奖励模型带来的高昂成本,也取得了不错的成果,但是奖励模型仍有用武之地。例如,deepseek-r1在需要对开放性问题(如安全和有用问题)做在线对齐时,仍然需要训练相应的奖励模型。
训练Bradley-Terry模型
该模型是对偏好的概率描述,它假设比较条目存在潜在强度
这里
通常借助一个线性头,从模型的最终隐藏状态输出标量分数。比如可以得到
记被偏好的补全为
,从而得到单样本损失:
等价形式有:
实现示例
简单地说,对偏好数据集,先对选择数据做前向,再对拒绝数据做前向,得到各自的奖励分数,最后计算-logsigmoid损失(取均值)。
数据加载器和分布式系统是后训练大部分任务的主题。
对于因果回归的序列,可以采用最后一生成token的隐层状态作为输出头的输入,也可以采用池化等方式。
结果奖励模型ORM
ORM与偏好奖励模型的区别在于,它预测的是补全的对与错(标签0与1),最终的预测结果会施加在每一个词元上(而不是偏好奖励的序列),再计算最终的损失。
这里的线性头输出词元维度的向量,每个词元处的
损失即为词元+批次下交叉熵损失的平均。
由于生成过程也会出现中间错误但是结果正确的情况,ORM会引入训练噪声。
过程奖励模型PRM
过程奖励模型需要在每个推理步骤的结尾处获得监督信号,然后以类似的方式进行训练。
生成式奖励建模(LLM AS A JUDGE)
通过精心涉及的提示词让LLM来生成并评判偏好对。与人工标注流程相似。
在评测上往往还是不如奖励模型。