Appearance
AI Mistakes
Transformer、LLM、机器学习与深度学习学习过程中的高价值错误记录。
只记录:
- 概念理解错误;
- 数学推导错误;
- 容易反复出现的混淆;
- 面试中可能造成明显失分的表达问题。
不记录单纯输入错误或已经掌握、只是表达不够完整的问题。
M-AI-001 - Attention Score Matrix 维度判断错误
Date: 2026-08-17
Related:
02_AI/Transformer/02_attention.md
Problem
已知:
判断:
的维度。
Initial Error
误判断为:
或将 Attention Score 的维度与单个 Q/K 向量维度混淆。
Correct Reasoning
因为:
而:
所以:
最终:
Mental Model
矩阵乘法中:
是 Q 与 K 做点积时被消掉的维度。
最终保留下来的两个维度都是 token position:
text
Q:
token × feature
K^T:
feature × token
↓
QK^T:
token × token因此 Attention Score Matrix 表示:
所有 Query token 与所有 Key token 的两两匹配关系。
Trigger
看到:
立即想到:
Status
corrected
M-AI-002 - 将 Bias 与非线性混淆
Date: 2026-08-17
Related:
02_AI/Transformer/03_transformer-block.md
Problem
为什么 FFN 中需要非线性激活函数?
Initial Error
曾认为加入 Bias 后,多层 Linear 无法继续合并,因此产生了非线性。
Correct Reasoning
即使存在 Bias:
展开:
令:
仍然可以写成:
因此它仍然只是一个仿射变换。
真正阻止多个 Linear 被整体合并的是:
等非线性函数。
例如:
不能在整个输入空间内等价为一个固定的:
Trigger
看到:
text
Linear
→ Linear
→ Linear想到:
可以合并。
看到:
text
Linear
→ Activation
→ Linear想到:
激活函数引入非线性,不能整体合并。
Status
corrected
M-AI-003 - Q/K/V 职责边界不清
Date: 2026-08-17
Related:
02_AI/Transformer/02_attention.md
Problem
为什么 Attention 既需要 Q/K,又需要 V?
Initial Confusion
最初能够理解 Q/K 用于相关性匹配,但不清楚为什么最终必须聚合 V,也曾将 K 和 V 的作用混在一起。
Correct Reasoning
对于第
Q/K 决定:
第
个位置应该从第 个位置获取多少信息。
之后:
V 决定:
第
个位置真正向当前 token 提供什么内容。
因此:
text
Q / K
→ 信息路由权重
V
→ 被路由和聚合的内容将 K 与 V 分离,使模型能够分别学习:
- 如何判断信息来源是否重要;
- 选中该来源以后传递什么表示。
Trigger
看到:
分成两个阶段:
text
QK^T
→ 看谁、看多少
× V
→ 真正拿什么回来Status
corrected