Skip to content

概念卡片:大模型与 Transformer 原理

一句话机制:大模型不是「思考」,是「接龙」——给定上文,预测下一个最可能出现的 token,再把它接上去继续预测。神经网络的「学习」= 随机初始化权重 W 和偏置 B,用损失函数衡量「预测值和真实值的差距」,再用梯度下降沿导数反方向逐步调参,直到差距收敛。

神经网络的最小单元

概念含义类比
神经元输入加权求和 → 激活函数 → 输出树突接收 → 细胞核激活 → 轴突输出
W(权重)每个输入的重要程度决策时各因素的权重
B(偏置/bias)输出的偏移量,控制「阈值」决策的基准线
激活函数把线性输出变成非线性,输出可平滑过渡让 0/1 二值变连续概率
  • 为什么需要激活函数:只输出 0/1 无法表达「0~1 之间的中间态」,多轮微调时太不敏感。Sigmoid 把 (-∞,+∞) 压到 (0,1);主流还有 ReLU、tanh、ELU。

训练三件套

  1. 损失函数(Loss):衡量「预测值 vs 真实值」的差距,训练目标就是让它最小。最简单是 MSE(均方误差)。
  2. 梯度下降(Gradient Descent):对损失函数求一阶导数,导数为正说明「沿该方向损失在增大」,就往反方向调参。
  3. 学习率(lr):每次调参的步长,一般 0.01~0.001。
    • lr 太大 → 步长过大、跳过最优解、来回震荡不收敛;
    • lr 太小 → 陷入局部极小值、训练变慢。

Transformer 演进(从简单到复杂)

阶段解决的问题核心机制
输入处理把词变成向量Embedding(嵌入):离散 token → 连续向量
注意力让模型知道「该关注上下文哪里」Attention:给不同位置的 token 分配不同权重
多头注意力从多个子空间捕捉不同关系Multi-Head Attention:并行多组注意力再拼接
深度训练解决深层网络退化ResNet 残差连接(跳跃连接)+ FFNN 前馈网络
输出处理把向量映射回词表概率Softmax → 采样下一个 token

不变量(必须成立的约束)

  • LLM 输出本质是「下一个 token 的概率分布」,不是确定性答案。这一条是 Prompt 工程(影响概率分布)、Agent(用工具兜底不确定性)设计的共同前提。
  • 训练是「拟合」不是「求解」:得到的是逼近最优的近似解,不是数学意义上的精确解;复杂函数只能找到局部最优,未必全局最优。
  • 梯度消失:Sigmoid 两侧导数趋 0,深层网络梯度传不下去——这正是后来引入 ReLU、ResNet 的原因。

常见误解

  • 以为「大模型很聪明、在思考」→ 它只是按训练数据统计规律做 token 预测,没有自主意识。
  • 以为「参数越多就越接近人脑」→ 大脑是惰性计算(ReLU 也不完全等价),简单拿参数量类比人脑 100T 是粗略口径,不可当结论用。
  • 以为「训练一次就得到唯一最优解」→ 结果依赖初始值运气,多次训练可能落到不同局部最优。

关联

最近更新