主题
概念卡片:大模型与 Transformer 原理
一句话机制:大模型不是「思考」,是「接龙」——给定上文,预测下一个最可能出现的 token,再把它接上去继续预测。神经网络的「学习」= 随机初始化权重 W 和偏置 B,用损失函数衡量「预测值和真实值的差距」,再用梯度下降沿导数反方向逐步调参,直到差距收敛。
神经网络的最小单元
| 概念 | 含义 | 类比 |
|---|---|---|
| 神经元 | 输入加权求和 → 激活函数 → 输出 | 树突接收 → 细胞核激活 → 轴突输出 |
| W(权重) | 每个输入的重要程度 | 决策时各因素的权重 |
| B(偏置/bias) | 输出的偏移量,控制「阈值」 | 决策的基准线 |
| 激活函数 | 把线性输出变成非线性,输出可平滑过渡 | 让 0/1 二值变连续概率 |
- 为什么需要激活函数:只输出 0/1 无法表达「0~1 之间的中间态」,多轮微调时太不敏感。Sigmoid 把
(-∞,+∞)压到(0,1);主流还有 ReLU、tanh、ELU。
训练三件套
- 损失函数(Loss):衡量「预测值 vs 真实值」的差距,训练目标就是让它最小。最简单是 MSE(均方误差)。
- 梯度下降(Gradient Descent):对损失函数求一阶导数,导数为正说明「沿该方向损失在增大」,就往反方向调参。
- 学习率(lr):每次调参的步长,一般 0.01~0.001。
- lr 太大 → 步长过大、跳过最优解、来回震荡不收敛;
- lr 太小 → 陷入局部极小值、训练变慢。
Transformer 演进(从简单到复杂)
| 阶段 | 解决的问题 | 核心机制 |
|---|---|---|
| 输入处理 | 把词变成向量 | Embedding(嵌入):离散 token → 连续向量 |
| 注意力 | 让模型知道「该关注上下文哪里」 | Attention:给不同位置的 token 分配不同权重 |
| 多头注意力 | 从多个子空间捕捉不同关系 | Multi-Head Attention:并行多组注意力再拼接 |
| 深度训练 | 解决深层网络退化 | ResNet 残差连接(跳跃连接)+ FFNN 前馈网络 |
| 输出处理 | 把向量映射回词表概率 | Softmax → 采样下一个 token |
不变量(必须成立的约束)
- LLM 输出本质是「下一个 token 的概率分布」,不是确定性答案。这一条是 Prompt 工程(影响概率分布)、Agent(用工具兜底不确定性)设计的共同前提。
- 训练是「拟合」不是「求解」:得到的是逼近最优的近似解,不是数学意义上的精确解;复杂函数只能找到局部最优,未必全局最优。
- 梯度消失:Sigmoid 两侧导数趋 0,深层网络梯度传不下去——这正是后来引入 ReLU、ResNet 的原因。
常见误解
- 以为「大模型很聪明、在思考」→ 它只是按训练数据统计规律做 token 预测,没有自主意识。
- 以为「参数越多就越接近人脑」→ 大脑是惰性计算(ReLU 也不完全等价),简单拿参数量类比人脑 100T 是粗略口径,不可当结论用。
- 以为「训练一次就得到唯一最优解」→ 结果依赖初始值运气,多次训练可能落到不同局部最优。
关联
- 总览:AI大模型技术栈总览
- 交互层(原理的工程化):概念卡片:Prompt工程
- 源:
B40-资源/语雀-Code-Summary/AITech/从神经网络原理、Transformer模型演进、到代码工程实现.md