Lesson 0005 — 动力系统与流形:智能的几何本质

📅 2026-06-17  ·  ⏱ 阅读时间约 25 min  ·  🔗 前置:0004 群体编码  ·  补充课

这节课回答什么问题? "学习=向真理空间逼近"这个直觉,在什么意义上是精确的,在什么意义上需要修正?动力系统视角和流形假说为这个问题提供了最接近物理实现的数学语言。这节课会直接校准你的类比——保留其核心洞察,修正其偏差。

1. 从单神经元调谐到群体动力学

上一课(0004 群体编码)回答了"一群神经元如何编码连续变量"。但这只完成了一半——编码是静态的快照。真正的计算,是状态在时间中如何演化。

打个比方:群体编码告诉你"键盘上每个键是干什么的"(字母→手指映射),动力系统视角告诉你"打字时手指在键盘上的运动轨迹"(连续运动的时间结构)。前者的分析单位是单个符号/神经元,后者的分析单位是整个系统的相空间轨迹。

这个转变,被 Shenoy lab 的综述精准概括:

"Computation through neural population dynamics."
— Vyas, S., Golub, M.D., Sussillo, D. & Shenoy, K.V. (2020). Annual Review of Neuroscience, 43, 249–269.

核心主张:你不应该问"这个神经元编码了什么",而应该问"这群神经元作为一个整体,在做什么动力学?它的状态空间被组织成了什么样的几何结构?"

2. 流形假说——但到底是哪个流形?

这是你需要修正的第一个关键点。

"流形假说"其实在不同语境下指代三种不同对象。你的"真理空间"类比把它们混在一起了——这在直觉层面是高效的,但在精确推理时需要区分。

2.1 三种流形

类型 流形嵌入在什么空间 流形上的点是什么 是谁提出的
数据流形
(Data Manifold)
输入空间 ℝD
(如 784 维的 MNIST 像素空间)
一张具体的手写数字图像 传统 ML 流形学习
(ISOMAP, LLE, t-SNE 的理论前提)
激活流形
(Activation / Neural Manifold)
神经状态空间 ℝN
(N = 同时记录的神经元数)
某一时刻的群体 firing rate 向量 r(t) 计算神经科学
(Churchland, Shenoy, Jazayeri)
权重流形
(Weight Manifold)
参数空间 ℝD
(D = 网络权重总数)
一组训练好的网络参数 θ* 深度学习理论
(Mapping Networks; mode connectivity; lottery ticket)
⚠ 关键区分:这三者虽然在数学上都声称"高维嵌入空间中的低维结构",但它们是不同的对象。数据流形上的点 = 一张图;激活流形上的点 = 一帧神经活动;权重流形上的点 = 一套模型参数。将它们统称为"真理空间"会掩盖重要的差异——比如说,权重流形依赖于训练数据和架构,它不是你从自然中"发现"的,而是训练过程构造出来的。

2.2 流形假说在每种情况下精确意味着什么

数据流形假说(ML 中最常见):

自然图像/文本/语音的全体可能取值填满 ℝD。 但有意义的自然数据只占据一个 d ≪ D 的低维子流形 M_data ⊂ ℝD。 沿着 M_data 移动对应语义连续变化(旋转角度、光照方向…); 垂直于 M_data 的方向产生无意义噪声。

激活流形假说(神经科学版):

N 个神经元的所有可能 firing rate 组合填满 ℝN。 但实际观测到的神经活动只占据一个 d ≈ 10–20 的低维流形 M_act ⊂ ℝN。 1 = f(r) 描述活动在这个流形上的演化。 不同任务条件 = 同一动力学方程,不同初始条件。

权重流形假说(Mapping Networks 版):

一个网络的所有可能参数值填满 ℝD(D 可达百万量级)。 但能取得良好泛化的参数只占据一个低维流形 M_w ⊂ ℝD。 存在一个隐空间 z ∈ ℝd 和映射 M: ℝd → ℝD, 使得沿 z 的梯度下降等效于在 M_w 上搜索最优参数。

3. 动力系统视角:确切地说是怎么回事

这不是比喻。当你同时记录到达任务(reaching task)中猴子的 M1/PMd 神经元,然后用 PCA/GPFA 降维到前 3 个主成分并画出轨迹,你会看到:

    准备期 (planning)                执行期 (movement)
    ╭──────────────────╮          ╭──────────────────╮
    │  轨迹缓慢流向     │          │  轨迹被不稳定的    │
    │  某个"准备子空间" │  ──GO──→ │  动力学快速推出,  │
    │  收敛但停留在     │          │  产生精确的        │
    │  发放阈值之下     │          │  肌肉指令序列      │
    ╰──────────────────╯          ╰──────────────────╯

    同一条动力学方程 f
    同一个流形 M_act
    不同的初始条件(reach left vs reach right)
    → 不同的轨迹终点(左 vs 右)
    → 不需要切换模型——计算就是流形上的运动

3.1 数学形式

r(t) ∈ ℝN N 个神经元的 firing rate 向量(N ≈ 100–200) 1(t) ≈ f(r(t)) + η(t) 其中 f: ℝN → ℝN 是一个低维有效动力学——虽然定义在高维空间上, 但它的吸引子和不稳定流形都限制在 d 维流形附近(d ≈ 10–20)。 降维后: κ(t) = C · r(t) κ ∈ ℝd, C: ℝN → ℝd (PCA/GPFA 投影) κ̇(t) ≈ g(κ(t)) g 是在低维空间中的等效动力学

3.2 为什么这是革命性的

传统提问方式动力系统提问方式
"这个神经元对什么的调谐?" "这组神经元整体在什么几何结构上演化?"
"哪个脑区负责什么功能?" "状态空间中的哪个子区域对应什么计算阶段?"
"这个神经元为什么在这个时刻发放?" "这个发放事件是流形上哪条轨迹的哪个阶段?"
"大脑如何处理信息?" "大脑如何组织状态空间使动力学自动执行计算?"

用你的语言翻译:如果你接受"学习=发现真理空间",那么推理/行动 = 真理空间上的动力学。你的"真理空间"在这个框架中对应的就是 M_act——神经活动所在的低维流形。

4. 互动:Lorenz 吸引子——看见流形上的动力学

Lorenz 系统是一个 3 维动力学系统,但所有轨迹都收敛到一个~2 维的蝴蝶形流形上。这是理解"低维流形嵌入高维空间"的最经典实例。

dx/dt = σ(y − x)     dy/dt = x(ρ − z) − y     dz/dt = xy − βz

Lorenz Attractor — 3D → 2D 投影

轨迹已绘制 0 个点

观察要点:① 所有轨迹(不同初始条件)都落在同一个"蝴蝶"流形上——这就是低维结构;② 轨迹在蝴蝶的两翼之间切换(对应神经活动中的"决策切换");③ 调节 ρ:ρ < 1 时只有稳定不动点,ρ ≈ 28 时出现混沌吸引子——同一个方程,不同参数,流形拓扑完全不同。

5. 你的类比——精确在哪里,偏差在哪里

这是一次直接校准。你的"真理空间"类比在工程直觉层面非常有力,但把它当作严格真理会误导你。

✅ 精确的洞察

你的表述为什么对
"损失函数只是探针,不是目标" 正确。损失函数是启发式代理。就像 Lorenz 系统中你看的是 dx/dt = σ(y−x),但你真正关心的是蝴蝶流形的几何。ML 中你优化交叉熵,但你真正获得的是权重空间中一个泛化的区域。
"词嵌入找到了蕴含真实世界语义结构的潜空间" 正确。word2vec/GloVe 的几何结构确实捕获了语义关系——方向对应于类比。但这不是唯一的:不同的随机初始化和训练数据会得到不同的嵌入空间,它们通过旋转/缩放相互关联(都是有效表示)。
"找到了隐空间就找到了真理共识" 半对。训练分布上的泛化确实对应"该分布的内在结构"。但这是分布相关的——分布外(OOD)时,同一个"真理空间"可能失效。不存在超越数据分布的绝对真理。

❌ 需要修正的偏差

修正 1:"真理空间"不存在——存在许多等价的低维流形。

不同随机种子训练出的网络,其权重在 ℝD 中可能相隔很远,但在功能上等价(mode connectivity 研究已证实这一点)。重要的不是流形的绝对位置,而是它的拓扑和几何性质。就像一栋楼可以建在城市的不同位置但仍然能住人——真正重要的是房间的布局(流形的几何),而不是地基的经纬度(权重的具体值)。
修正 2:流形是被构造的,不是被"发现"的。

你说"发现真理空间",暗示它像考古遗址一样早已存在,只等被挖出来。更精确的图景是雕塑:初始状态(随机权重/未训练的突触连接)是一片无结构的岩石,学习过程(SGD/可塑性)从岩石中雕刻出流形结构。流形是学习过程的产物,不是等待发现的外部实体。这一点对类脑计算有深刻含义——"学习算法"和"流形结构"是同一过程的两个侧面。
修正 3:三种流形不可混用。

词嵌入的"语义空间"= 数据流形的一个压缩表示。
神经元的"群体动力学"= 激活流形。
Mapping Networks 的参数降维 = 权重流形。

它们之间有关系(一个好的数据流形表示可能导致更好的权重流形结构),但它们不是同一个东西。将词嵌入类比直接套用到神经元动力学上,你可能在谈完全不同的对象。
修正 4:Mapping Networks "参数少500倍性能反超"不是魔法——它是正则化。

在全参数空间搜索时,SGD 会落入 sharp minima——这些点训练损失低但泛化差。约束在低维权重流形上等价于一种强结构正则化:你只搜索那些"光滑的"参数配置,它们自然对应于 flat minima + 更好的泛化。Mapping Networks 的价值在于用几何约束实现了正则化,而不是证明了存在一个神秘的"参数真理空间"。

6. Mapping Networks 的精确解读

Sen & Mukherjee (CVPR 2026 Oral) 的核心贡献可以重述为三层:

层一(工程): 存在一个极低维的隐空间,映射到权重空间后能覆盖所有好的解。训练参数量可以缩减 100-500 倍。

层二(理论): 这证明了好的网络参数并非分散在 ℝD 各处——它们聚集在一个低维流形附近。SGD 在全局空间中的"有效搜索维度"远小于名义参数数量。

层三(哲学——你在这一层): 如果好的模型都被约束在一个低维结构上,那么这个结构本身可能编码了"解决这类问题的本质几何"。不同的具体任务会有不同的权重流形,但它们可能共享某些元结构。

你的直觉在层三是成立的。 但在层一和层二的精确描述中,需要将"真理"替换为"泛化约束下的最优几何",将"发现"替换为"构造",将单数"真理空间"替换为复数"等价流形类"。

7. 与你全景图的关系

你现在掌握的全景图可以更新为:

学习 = 构造低维流形(权重流形 / 激活流形 / 数据表示的压缩流形)
        │
        ├── 通过:多时间尺度的局部可塑性规则(0002, 0003)
        ├── 编码:群体活动在流形上的位置(0004)
        ├── 动力学:ṙ = f(r) ← 本课
        │
        └── 为什么是这个流形而不是别的?
              ├── 预测编码(0006):使生成模型逼近真实数据分布
              └── 自由能原理(0008):流形是变分自由能的极小曲面

你的"学习=寻找真理空间"直觉,在这张图中被精确化为:学习通过局部可塑性规则构造一个低维流形,该流形的几何使得其上的动力学自动执行对世界状态的有效推断。

8. 推荐阅读

💡 向 agent 提问
这节课直接校准了你的核心类比。如果你觉得某些修正不对,或者想深入其中任何一点——流形的可学习性条件、动力学 f 的结构、从神经数据中估计流形维度的方法——直接问。