第 6 章 训练过程
本章导引
大模型的能力并非天生,而是通过大规模训练获得。本章介绍预训练、监督微调(SFT)和基于人类反馈的强化学习(RLHF)三个训练阶段,以及损失函数的基本概念。
6.1 训练的总体流程
[待撰写]
6.2 预训练:从海量文本中学习语言规律
[待撰写]
6.3 监督微调(SFT):学会遵循指令
[待撰写]
6.4 RLHF:对齐人类偏好
[待撰写]
6.5 训练的工程现实
[待撰写]
本章小结
- 大模型训练分三阶段:预训练 → SFT → RLHF
- 预训练通过 Next Token Prediction 从海量文本中学习语言规律
- 交叉熵损失是预训练的核心目标函数
- SFT 让模型学会遵循指令,RLHF 让模型回复对齐人类偏好
- 训练成本和数据质量是决定模型能力的关键工程因素
参考文献
[待补充]