Skip to content

现代大语言模型组件

本文件将在 Transformer Lesson 2 学习过程中逐步完成。

计划内容:

  1. RMSNorm
  2. RoPE
  3. MHA / MQA / GQA
  4. KV Cache
  5. 自回归推理中的 Attention
  6. SwiGLU
  7. 现代 Decoder-only Transformer Block
  8. 与 Qwen / Llama 架构的联系
  9. 与 vLLM 推理系统的联系

原则:

不提前记录尚未真正理解的结论。

所有学习状态与 Confidence 只维护在:

00_Roadmap/progress.md

随着实际学习逐节完善。