主题
分享学习经验,相互交流,共同进步
学习 Nathan Lambert 强化学习专著的读书笔记,聚焦 RLHF、PPO、DPO 等核心技术
从"预测下一个词"出发建立直觉;尚在撰写,暂未完成
精读大模型领域经典与前沿论文,配套图表与个人解读
学习西湖大学强化学习课程笔记,涵盖强化学习基础、策略梯度、Actor-Critic 等核心内容
记录 Rust 学习中的概念与代码示例,从多线程与并发编程开始
通过视频,一起学习
用画面和讲解分享知识,让抽象的概念更容易理解。
用可视化介绍 RLHF 中的广义优势估计(GAE),从 TD 残差到优势估计,梳理反向递推的过程。
通过可视化演绎,观察尺度变换下不同梯度方法的表现。