Skip to content
搜索文档
K
Main Navigation
首页
科普视频
LLM 科普书
论文阅读笔记
RL 学习笔记
西湖 RL 笔记
Rust 学习笔记
主题
菜单
回到顶部
本页目录
论文阅读笔记
精读大模型领域经典与前沿论文,配套图表与个人解读。
笔记列表
DeepSeek-R1 技术报告阅读笔记
— 基于 GRPO 强化学习训练的推理模型,含 R1-Zero 与 R1 两阶段详解
GiGPO:面向长程智能体的分层信用分配
— 通过锚点状态分组进行回合级与步骤级优势估计
Graph-GPO:基于状态转移图的信用分配
— 聚合 rollout 轨迹并按到成功状态的距离估计步骤优势