奖励模型训练实验与分析
这里对照两次云端训练,观察 Bradley–Terry 偏好奖励模型的损失、偏好准确率与奖励分数变化。模型原理见奖励建模。
bf16 与 f32 交互对比
下方展示两次运行的 11 项训练/验证指标:每次运行的训练指标各有 524 个记录点,验证指标各有 22 个记录点。绿色对应 f32,红色对应 bf16。
切换指标、勾选运行,或移动鼠标查看记录点的 Step 与数值。
结果分析
最后一次验证
两次运行的最后一次验证都在 Step 524。下表比较同一步的结果,准确率表示 chosen 的得分高于 rejected 的比例。
| 指标(Step 524) | bf16 | f32 |
|---|---|---|
| 验证损失 | 0.4731 | 0.5618 |
| 验证偏好准确率 | 76.34% | 78.06% |
| 验证平均奖励分数差 | 2.5613 | 2.6220 |
bf16 的验证损失更低,但偏好准确率也略低。这并不矛盾:准确率只检查排序是否正确,损失还受每对回答的分数差大小影响。因此,两项指标应结合观察,不能仅凭损失判断哪个运行更好。
最后一步不一定是最佳检查点
f32 的最低验证损失出现在 Step 200(0.4559),bf16 则在 Step 275(0.4232);两者最后一步的验证损失都高于各自的最低值。若按验证损失选择模型,应关注这些较早的步骤,而不是默认使用最后一次更新。
奖励分数的绝对值没有统一尺度,更适合结合 chosen/rejected 分数差、偏好准确率与验证损失观察。图表展示的训练准确率是每个记录窗口的数值,不等于整轮训练或独立测试集准确率。
两次运行的实际配置尚未核对,因此这些结果反映本次实验的表现,不能直接归因于数值精度。