Hebb 与 STDP:大脑的局部学习规则
1. 回顾:反向传播需要什么——大脑没有的东西
反向传播(backprop)更新权重 wij 需要:
δj = (yj − tj) · σ′(zj) (输出层)
δj = (Σk δk · wjk) · σ′(zj) (隐藏层:反向传播误差)
这要求四个大脑不具备的条件:
| 要求 | 生物是否满足 |
|---|---|
| 全局损失函数 L(需要知道网络最终输出和目标) | ✗ 没有全局监督信号 |
| 对称反馈权重(反馈 = WT) | ✗ 前馈和反馈通路是不同轴突 |
| 非局部信息(第 i 层需要第 j 层所有下游误差) | ✗ 突触只能看到 pre 和 post 的局部活动 |
| 时间冻结(前传完成才能反传) | ✗ 大脑持续在线处理信息 |
那么,突触如何知道该增强还是减弱?答案从 Hebb 1949 年的洞见开始。
2. Hebb 的洞见(1949)
"When an axon of cell A is near enough to excite cell B and repeatedly or persistently takes part in firing it, some growth process or metabolic change takes place in one or both cells such that A's efficiency, as one of the cells firing B, is increased."
— Donald Hebb, The Organization of Behavior (1949)
"Cells that fire together, wire together."
最简单的 Hebb 规则:
x — 突触前神经元的活动(输入)
y — 突触后神经元的活动(输出)
η — 学习率(一个小正数,如 0.01)
Δw — 突触权重的变化量
两者同时活跃 → w 增加 → 这个输入-输出关联被强化。
3. 从 Hebb 到 Oja:权重不发散的关键修正
纯 Hebb 规则有一个致命问题:权重会无限增长。
Δw = η · x · y → 如果 x 和 y 正相关,每次更新 w 都增大 → y = w·x 也增大 → Δw 更大 → 正反馈爆炸。 大脑不能接受无穷大的突触权重。1982 年,Erkki Oja 提出了修正:
Oja's rule 在 Hebb 项 η·y·x 的基础上加了衰减项 −η·y²·w:
— 当 y 大时,衰减也大,防止 w 无限增长
— w 会收敛到 ∥w∥ = 1(单位长度)
— 更重要的是,w 收敛的方向 = 输入数据的第一主成分(PCA)
4. 交互一:Hebb 训练全过程——从随机权重到主成分
实验目标:亲眼看到 Hebb/Oja 学习规则如何从零开始,在每一次数据呈现中更新权重,最终收敛到数据的主方向。理解这个过程不需要任何标签——它是纯无监督的。
2D 输入 → 单神经元 Hebb 学习
灰色点 = 输入数据(相关高斯分布,主方向沿 45°)。彩色箭头 = 突触权重向量 w(方向 = 神经元"喜欢"的输入模式,长度 = 权重范数)。橙色轨迹 = 权重历史。
观察要点:
① 点击"×100"几次,看箭头如何从随机方向旋转到 45°(数据云的主轴)
② 增大 η → 收敛更快但不稳定;减小 η → 平滑但缓慢
③ 注意 ∥w∥ 始终接近 1.0(Oja 规则的归一化效果)
④ 如果关掉 Oja 归一化(心智实验),纯 Hebb 规则下箭头会越变越长直到飞出画面
⑤ 核心洞察:整个过程不需要任何标签——神经元仅仅通过"同时活跃就增强"的局部规则,自动发现了数据的隐藏结构
5. STDP:把时间加回 Hebb
Hebb 规则没有考虑时序——pre 和 post 谁先谁后。但在生物中,5ms 的先后差异决定了 LTP 还是 LTD。
1997–1998 年,Markram 和 Bi & Poo 分别独立发现了 STDP:
Δw = −A⁻ · exp(+Δt / τ⁻) if Δt < 0 (post→pre, LTD)
每个符号的物理含义:
| 符号 | 含义 | 决定因素 | 典型值 |
|---|---|---|---|
| Δt | tpost − tpre,突触后减突触前脉冲时刻 | 两个神经元 spike 的精确时间差 | −80 ~ +80 ms |
| A⁺ | LTP 最大幅度——pre→post 因果配对时,单次最多增强多少 | NMDA 受体密度、钙信号通路效率 | 0.005–0.02 |
| A⁻ | LTD 最大幅度——反因果配对时单次最多减弱多少。通常 A⁻ ≈ 1.05×A⁺(减弱略大于增强,维持稳定) | 代谢型谷氨酸受体、磷酸酶活性 | ≈ 1.05×A⁺ |
| τ⁺ | LTP 时间窗口——pre 先于 post 多长范围内仍算因果相关 | NMDA 受体电流衰减时间常数 | 15–30 ms |
| τ⁻ | LTD 时间窗口——post 先于 pre 多长范围内触发 LTD。一般 τ⁻ ≈ τ⁺ | mGluR 信号级联动力学 | 15–30 ms |
| exp(−|Δt|/τ) | 指数衰减——Δt 越大,因果联系越弱,Δw 越小(不是随意选的:生物实验确证 LTP/LTD 幅度随 Δt 指数衰减) | Ca²⁺ 内流的被动扩散和泵出动力学 | — |
6. 交互二:STDP 窗口——四个参数的几何直觉
实验目标:直观理解 A⁺, τ⁺, A⁻, τ⁻ 如何塑造 STDP 曲线的形状。拖动 Δt 光标看权重变化大小,调节参数看曲线如何变形。注意 Y 轴是固定的——改变 A⁺ 只影响蓝色曲线,不影响红色曲线。
STDP 窗口
参数实验:
① 增大 A⁺ → 仅蓝色 (LTP) 曲线变高,红色不变
② 增大 τ⁺ → 蓝色曲线变"宽",Δt=40ms 也能触发 LTP
③ 设 A⁺=A⁻ 且 τ⁺=τ⁻ → 完全对称窗口(生物中不存在,但可以看看)
④ 设 τ⁺=5ms → 极窄 LTP 窗口,只有几乎同步的脉冲才能增强
7. 交互三:两神经元 STDP——原始因果检测的统计规律
实验目标:这里没有 Oja 归一化。两个脉冲神经元通过 STDP 耦合,权重完全由脉冲时序的统计规律决定。观察:① 权重的漂移方向取决于 pre-post 时序的统计偏向,② 没有归一化时权重可能持续增长或衰减。
Pre 神经元以泊松过程发放。每次 pre 脉冲向突触注入电流(指数衰减),推动 post 神经元膜电位。Post 发放时,STDP 根据最近的 pre-post 时序更新 w。Post 还有一个微弱的背景电流,偶尔产生"自发"脉冲——这制造了偶尔的 LTD 事件。
Pre → Post 突触权重实时演化(原始 STDP,无归一化)
观察要点:
① 在默认参数下,w 通常持续增长——因为 post 几乎总是在 pre 之后发放(因果),LTP 占优
② 偶尔看到 w 小幅下降——post 的背景电流导致它在某次 pre 之前自发发放(反因果 LTD)
③ 提高 Pre 发放率 → post 发放更频繁 → STDP 事件更多 → w 变化加速
④ 对比交互一:这里没有 Oja 规则的 −η·y²·w 衰减项来按住权重,所以 w 不会收敛到 1,而是由 LTP/LTD 的统计平衡决定方向
⑤ 这个无约束的正反馈是生物需要 homeostatic plasticity(稳态可塑性)的原因——STDP 本身不保证稳定
8. 局部学习 vs. 反向传播:总结对比
| 属性 | 反向传播 (Backprop) | Hebb / Oja | STDP |
|---|---|---|---|
| 所需信息 | 全局误差梯度 δ | x, y(局部活动) | Δt(局部脉冲时序) |
| 监督信号 | 必须有标签 | 无监督 | 无监督 |
| 学习时机 | 批次结束,离线 | 每次激活,在线 | 每次脉冲,在线 |
| 权重稳定性 | 梯度下降保证收敛 | 需要 Oja 归一化 | A⁻ > A⁺ 维持稳定 |
| 学到什么 | 判别特征(分类) | 主成分(数据结构) | 因果关联(时序结构) |
| 生物合理性 | 几乎不存在 | 基本合理 | 实验直接观察到 |
9. 小测验
📖 推荐主源
Oja 规则原始论文: Oja (1982) — "A Simplified Neuron Model as a Principal Component Analyzer" 证明单个线性神经元 + 规范化的 Hebb 学习等价于 PCA。短小精悍(4 页)。
STDP 经典实验: Bi & Poo (1998) — "Synaptic Modifications in Cultured Hippocampal Neurons" 在海马培养神经元中首次精确测量 Δt 依赖的 LTP/LTD 窗口。
反向传播与大脑: Lillicrap et al. (2020) — "Backpropagation and the Brain"