Skip to content

AI Mistakes

Transformer、LLM、机器学习与深度学习学习过程中的高价值错误记录。

只记录:

  • 概念理解错误;
  • 数学推导错误;
  • 容易反复出现的混淆;
  • 面试中可能造成明显失分的表达问题。

不记录单纯输入错误或已经掌握、只是表达不够完整的问题。


M-AI-001 - Attention Score Matrix 维度判断错误

Date: 2026-08-17

Related:

  • 02_AI/Transformer/02_attention.md

Problem

已知:

Q,KR100×64

判断:

QKT

的维度。

Initial Error

误判断为:

64

或将 Attention Score 的维度与单个 Q/K 向量维度混淆。

Correct Reasoning

因为:

Q:100×64

而:

KT:64×100

所以:

QKT:(100×64)(64×100)

最终:

100×100

Mental Model

矩阵乘法中:

dk

是 Q 与 K 做点积时被消掉的维度。

最终保留下来的两个维度都是 token position:

text
Q:
token × feature

K^T:
feature × token



QK^T:
token × token

因此 Attention Score Matrix 表示:

所有 Query token 与所有 Key token 的两两匹配关系。

Trigger

看到:

Q,KRn×dk

立即想到:

QKTRn×n

Status

corrected


M-AI-002 - 将 Bias 与非线性混淆

Date: 2026-08-17

Related:

  • 02_AI/Transformer/03_transformer-block.md

Problem

为什么 FFN 中需要非线性激活函数?

Initial Error

曾认为加入 Bias 后,多层 Linear 无法继续合并,因此产生了非线性。

Correct Reasoning

即使存在 Bias:

y=W2(W1x+b1)+b2

展开:

y=W2W1x+W2b1+b2

令:

W=W2W1,b=W2b1+b2

仍然可以写成:

y=Wx+b

因此它仍然只是一个仿射变换。

真正阻止多个 Linear 被整体合并的是:

ReLU, GELU, SiLU

等非线性函数。

例如:

W2ReLU(W1x+b1)+b2

不能在整个输入空间内等价为一个固定的:

Wx+b

Trigger

看到:

text
Linear
→ Linear
→ Linear

想到:

可以合并。

看到:

text
Linear
→ Activation
→ Linear

想到:

激活函数引入非线性,不能整体合并。

Status

corrected


M-AI-003 - Q/K/V 职责边界不清

Date: 2026-08-17

Related:

  • 02_AI/Transformer/02_attention.md

Problem

为什么 Attention 既需要 Q/K,又需要 V?

Initial Confusion

最初能够理解 Q/K 用于相关性匹配,但不清楚为什么最终必须聚合 V,也曾将 K 和 V 的作用混在一起。

Correct Reasoning

对于第 i 个 token:

αij=softmaxj(qikjTdk)

Q/K 决定:

i 个位置应该从第 j 个位置获取多少信息。

之后:

oi=jαijvj

V 决定:

j 个位置真正向当前 token 提供什么内容。

因此:

text
Q / K
→ 信息路由权重

V
→ 被路由和聚合的内容

将 K 与 V 分离,使模型能够分别学习:

  • 如何判断信息来源是否重要;
  • 选中该来源以后传递什么表示。

Trigger

看到:

softmax(QKT)V

分成两个阶段:

text
QK^T
→ 看谁、看多少

× V
→ 真正拿什么回来

Status

corrected