Skip to content
搜索文档
K
Main Navigation
首页
科普视频
LLM 科普书
论文阅读笔记
RL 学习笔记
西湖 RL 笔记
Rust 学习笔记
主题
菜单
回到顶部
本页目录
Nathan Lambert RL BOOK 学习笔记
学习 Nathan Lambert 强化学习(RL)专著的读书笔记,聚焦大模型时代的 RLHF、PPO、DPO 等核心技术。
笔记列表
对话模板与监督微调
— IFT/SFT、对话模板、指令结构
奖励建模
— Bradley-Terry 模型、偏好学习
强化学习
— 策略梯度、RLHF 训练循环