第 4 章 Transformer 架构概览
本章导引
Transformer 是大语言模型的核心架构。本章从整体视角介绍其编码器-解码器结构、GPT 类模型的解码器架构,以及数据在模型中的完整流转过程。注意力机制等细节留待第 5 章展开。
4.1 Transformer 的诞生背景
[待撰写]
4.2 编码器-解码器结构
[待撰写]
4.3 GPT 类模型:仅解码器架构
[待撰写]
4.4 数据流:从 Token 到输出概率
[待撰写]
4.5 关键超参数
[待撰写]
本章小结
- Transformer 摒弃了循环结构,完全基于注意力机制
- GPT 类大模型采用仅解码器架构,通过自回归方式生成文本
- 数据流:Token → 嵌入 → 解码器层堆叠 → softmax → 概率分布
- 层数、隐藏维度、注意力头数是决定模型规模的核心超参数
参考文献
[待补充]