Appearance
现代大语言模型组件
本文件将在 Transformer Lesson 2 学习过程中逐步完成。
计划内容:
- RMSNorm
- RoPE
- MHA / MQA / GQA
- KV Cache
- 自回归推理中的 Attention
- SwiGLU
- 现代 Decoder-only Transformer Block
- 与 Qwen / Llama 架构的联系
- 与 vLLM 推理系统的联系
原则:
不提前记录尚未真正理解的结论。
所有学习状态与 Confidence 只维护在:
00_Roadmap/progress.md
随着实际学习逐节完善。