Hebb 与 STDP:大脑的局部学习规则

Lesson 0002  ·  2025-06-15  ·  约25分钟  ·  前置:0001 LIF
本课目标:理解两种核心的局部学习规则——Hebb 学习("fire together, wire together")与 STDP(脉冲时序依赖可塑性),知道它们如何在没有全局误差信号的条件下实现特征学习,并亲手运行 Hebb 训练的完整过程。

1. 回顾:反向传播需要什么——大脑没有的东西

反向传播(backprop)更新权重 wij 需要:

Δwij = −η · δj · ai
δj = (yj − tj) · σ′(zj)   (输出层)
δj = (Σk δk · wjk) · σ′(zj)   (隐藏层:反向传播误差)

这要求四个大脑不具备的条件:

要求生物是否满足
全局损失函数 L(需要知道网络最终输出和目标)✗ 没有全局监督信号
对称反馈权重(反馈 = WT)✗ 前馈和反馈通路是不同轴突
非局部信息(第 i 层需要第 j 层所有下游误差)✗ 突触只能看到 pre 和 post 的局部活动
时间冻结(前传完成才能反传)✗ 大脑持续在线处理信息

那么,突触如何知道该增强还是减弱?答案从 Hebb 1949 年的洞见开始。

2. Hebb 的洞见(1949)

"When an axon of cell A is near enough to excite cell B and repeatedly or persistently takes part in firing it, some growth process or metabolic change takes place in one or both cells such that A's efficiency, as one of the cells firing B, is increased."
— Donald Hebb, The Organization of Behavior (1949)

"Cells that fire together, wire together."

最简单的 Hebb 规则:

Δw = η · x · y

x — 突触前神经元的活动(输入)
y — 突触后神经元的活动(输出)
η — 学习率(一个小正数,如 0.01)
Δw — 突触权重的变化量

两者同时活跃 → w 增加 → 这个输入-输出关联被强化。

关键属性:局部性。要修改 w,只需要知道 x(pre 的活动)和 y(post 的活动)。这两个信号都在突触本地可得。没有反向传播,没有全局损失函数,没有标签。

3. 从 Hebb 到 Oja:权重不发散的关键修正

纯 Hebb 规则有一个致命问题:权重会无限增长。

Δw = η · x · y → 如果 x 和 y 正相关,每次更新 w 都增大 → y = w·x 也增大 → Δw 更大 → 正反馈爆炸。 大脑不能接受无穷大的突触权重。1982 年,Erkki Oja 提出了修正:

Δw = η · y · (x − y · w)

Oja's rule 在 Hebb 项 η·y·x 的基础上加了衰减项 −η·y²·w:
— 当 y 大时,衰减也大,防止 w 无限增长
— w 会收敛到 ∥w∥ = 1(单位长度)
— 更重要的是,w 收敛的方向 = 输入数据的第一主成分(PCA)

这为什么重要?一个简单的局部学习规则,无需任何全局误差信号,自动提取了输入数据中方差最大的方向——也就是最重要的特征。这是无监督特征学习的雏形,也是理解"智能如何从数据中发现结构"的第一步。

4. 交互一:Hebb 训练全过程——从随机权重到主成分

实验目标:亲眼看到 Hebb/Oja 学习规则如何从零开始,在每一次数据呈现中更新权重,最终收敛到数据的主方向。理解这个过程不需要任何标签——它是纯无监督的。

2D 输入 → 单神经元 Hebb 学习

灰色点 = 输入数据(相关高斯分布,主方向沿 45°)。彩色箭头 = 突触权重向量 w(方向 = 神经元"喜欢"的输入模式,长度 = 权重范数)。橙色轨迹 = 权重历史。

迭代: 0 w = (—, —) ∥w∥ = — y = —

观察要点:
① 点击"×100"几次,看箭头如何从随机方向旋转到 45°(数据云的主轴)
② 增大 η → 收敛更快但不稳定;减小 η → 平滑但缓慢
③ 注意 ∥w∥ 始终接近 1.0(Oja 规则的归一化效果)
④ 如果关掉 Oja 归一化(心智实验),纯 Hebb 规则下箭头会越变越长直到飞出画面
⑤ 核心洞察:整个过程不需要任何标签——神经元仅仅通过"同时活跃就增强"的局部规则,自动发现了数据的隐藏结构

5. STDP:把时间加回 Hebb

Hebb 规则没有考虑时序——pre 和 post 谁先谁后。但在生物中,5ms 的先后差异决定了 LTP 还是 LTD。

1997–1998 年,Markram 和 Bi & Poo 分别独立发现了 STDP:

Δw =   A⁺ · exp(−Δt / τ⁺)    if Δt > 0 (pre→post, LTP)
Δw = −A⁻ · exp(+Δt / τ⁻)    if Δt < 0 (post→pre, LTD)

每个符号的物理含义:

符号含义决定因素典型值
Δttpost − tpre,突触后减突触前脉冲时刻两个神经元 spike 的精确时间差−80 ~ +80 ms
A⁺LTP 最大幅度——pre→post 因果配对时,单次最多增强多少NMDA 受体密度、钙信号通路效率0.005–0.02
A⁻LTD 最大幅度——反因果配对时单次最多减弱多少。通常 A⁻ ≈ 1.05×A⁺(减弱略大于增强,维持稳定)代谢型谷氨酸受体、磷酸酶活性≈ 1.05×A⁺
τ⁺LTP 时间窗口——pre 先于 post 多长范围内仍算因果相关NMDA 受体电流衰减时间常数15–30 ms
τ⁻LTD 时间窗口——post 先于 pre 多长范围内触发 LTD。一般 τ⁻ ≈ τ⁺mGluR 信号级联动力学15–30 ms
exp(−|Δt|/τ)指数衰减——Δt 越大,因果联系越弱,Δw 越小(不是随意选的:生物实验确证 LTP/LTD 幅度随 Δt 指数衰减)Ca²⁺ 内流的被动扩散和泵出动力学—
为什么是 exp?突触后 NMDA 受体打开时 Ca²⁺ 内流。pre 先于 post 发放时,谷氨酸已结合、NMDA 的 Mg²⁺ 阻断被 post 去极化解除 → 大 Ca²⁺ 瞬变 → LTP。顺序相反时 post 已复极化、Mg²⁺ 重新阻断 → 少量 Ca²⁺ → LTD。Ca²⁺ 浓度以指数衰减回到基线,时间常数 ≈ τ。所以 τ 不是公式里随便放的——它是 NMDA 电流衰减时间的直接反映。

6. 交互二:STDP 窗口——四个参数的几何直觉

实验目标:直观理解 A⁺, τ⁺, A⁻, τ⁻ 如何塑造 STDP 曲线的形状。拖动 Δt 光标看权重变化大小,调节参数看曲线如何变形。注意 Y 轴是固定的——改变 A⁺ 只影响蓝色曲线,不影响红色曲线。

STDP 窗口

LTP (pre→post 因果) LTD (post→pre 反因果) ⟵ 拖拽图表移动 Δt 光标

参数实验:
① 增大 A⁺ → 仅蓝色 (LTP) 曲线变高,红色不变
② 增大 τ⁺ → 蓝色曲线变"宽",Δt=40ms 也能触发 LTP
③ 设 A⁺=A⁻ 且 τ⁺=τ⁻ → 完全对称窗口(生物中不存在,但可以看看)
④ 设 τ⁺=5ms → 极窄 LTP 窗口,只有几乎同步的脉冲才能增强

7. 交互三:两神经元 STDP——原始因果检测的统计规律

实验目标:这里没有 Oja 归一化。两个脉冲神经元通过 STDP 耦合,权重完全由脉冲时序的统计规律决定。观察:① 权重的漂移方向取决于 pre-post 时序的统计偏向,② 没有归一化时权重可能持续增长或衰减。

Pre 神经元以泊松过程发放。每次 pre 脉冲向突触注入电流(指数衰减),推动 post 神经元膜电位。Post 发放时,STDP 根据最近的 pre-post 时序更新 w。Post 还有一个微弱的背景电流,偶尔产生"自发"脉冲——这制造了偶尔的 LTD 事件。

Pre → Post 突触权重实时演化(原始 STDP,无归一化)

w = 0.50 last Δt = — spikes: pre=0 post=0

观察要点:
① 在默认参数下,w 通常持续增长——因为 post 几乎总是在 pre 之后发放(因果),LTP 占优
② 偶尔看到 w 小幅下降——post 的背景电流导致它在某次 pre 之前自发发放(反因果 LTD)
③ 提高 Pre 发放率 → post 发放更频繁 → STDP 事件更多 → w 变化加速
④ 对比交互一:这里没有 Oja 规则的 −η·y²·w 衰减项来按住权重,所以 w 不会收敛到 1,而是由 LTP/LTD 的统计平衡决定方向
⑤ 这个无约束的正反馈是生物需要 homeostatic plasticity(稳态可塑性)的原因——STDP 本身不保证稳定

8. 局部学习 vs. 反向传播:总结对比

属性反向传播 (Backprop)Hebb / OjaSTDP
所需信息全局误差梯度 δx, y(局部活动)Δt(局部脉冲时序)
监督信号必须有标签无监督无监督
学习时机批次结束,离线每次激活,在线每次脉冲,在线
权重稳定性梯度下降保证收敛需要 Oja 归一化A⁻ > A⁺ 维持稳定
学到什么判别特征(分类)主成分(数据结构)因果关联(时序结构)
生物合理性几乎不存在基本合理实验直接观察到

9. 小测验

Q1: 纯 Hebb 规则 Δw = η·x·y 为什么会导致权重爆炸?
因为 x 和 y 的乘积总是大于 1
因为正反馈:w↑ → y=w·x↑ → Δw=η·x·y↑ → w 更大
因为 η 通常设得太大了
因为输入数据 x 的范数会随时间增大
Q2: Oja 规则中,衰减项 −η·y²·w 的作用是什么?
防止过拟合,相当于 L2 正则化
当 y 大时自动压制权重增长,保持 ∥w∥≈1
使权重向输入数据的最小方差方向收敛
引入负反馈以模拟侧抑制(lateral inhibition)
Q3: STDP 中,如果 pre 总是在 post 之后 10ms 发放,突触会怎样?
增强 (LTP),因为 10ms 在 LTP 窗口内
减弱 (LTD),因为 Δt<0 表示 pre 对这次 post 无因果贡献
不变,因为 10ms 超出了 STDP 的有效窗口
取决于 A⁺ 和 A⁻ 的相对大小

📖 推荐主源

阅读: "Spike Timing-Dependent Plasticity: A Hebbian Learning Rule" — Caporale & Dan (2008), Annual Review of Neuroscience

Oja 规则原始论文: Oja (1982) — "A Simplified Neuron Model as a Principal Component Analyzer" 证明单个线性神经元 + 规范化的 Hebb 学习等价于 PCA。短小精悍(4 页)。

STDP 经典实验: Bi & Poo (1998) — "Synaptic Modifications in Cultured Hippocampal Neurons" 在海马培养神经元中首次精确测量 Δt 依赖的 LTP/LTD 窗口。

反向传播与大脑: Lillicrap et al. (2020) — "Backpropagation and the Brain"

🤖 提问提示:Oja 规则学到了第一主成分——那第二、第三主成分怎么学?multiple neurons + lateral inhibition 如何实现完整的 PCA?这与深度学习的表征学习有什么联系?随时问你的 AI 教师。