北大李铁军组(彭强伟、周沛杰等)这几年在单细胞数据的最优传输方法上做了一套完整的工作,从空间转录组配准一路做到非平衡OT的流匹配推理。核心线索是 WFR(Wasserstein-Fisher-Rao)度量——能同时处理位移和质量增减。下面把三篇主要工作的关系理清楚。


先搞清楚 WFR 度量是什么

WFR 是 Wasserstein 和 Fisher-Rao 的结合:

  • Wasserstein 部分:控制点的位移(transport),对传统 OT 来说就是全部
  • Fisher-Rao 部分:控制质量的增减(birth/death),传统 OT 不能处理质量变化

形式上,WFR 距离是以下动态度量的最小化:

\[\text{WFR}(\rho_0, \rho_1)^2 = \inf_{\rho_t, v_t, g_t} \int_0^1 \int \big( \|v_t\|^2 + \frac{g_t^2}{4} \big) \, d\rho_t \, dt\]

约束:$\partial_t \rho_t + \nabla \cdot (\rho_t v_t) = \rho_t g_t$,其中 $v_t$ 是速度场(位移),$g_t$ 是增长率函数(质量变化)。

这个公式看着抽象,但物理意义很直观:不光是粒子在动,粒子的数量也可以变。 在单细胞数据里,细胞在分化(位移)的同时也在增殖/凋亡(质量变化),所以 WFR 天然适合。


第一篇:stVCR(Nature Methods, 2026.3)

全称:spatial Transcriptomics via Variational Co-alignment with Reference

解决的问题:空间转录组数据的配准——把多个空间切片对齐到同一个参考坐标系。

为什么需要 WFR:不同切片的细胞类型丰度不一样(比如切片 A 某个区域凋亡多,切片 B 同一区域增殖多),而且组织本身有弹性形变。纯 Wasserstein 假设质量守恒,不行;纯刚性配准,又处理不了形变。

方法框架

  1. WFR 非平衡 OT:允许细胞类型丰度在切片间变化
  2. 刚性空间对齐:先用 WFR 找到切片间的对应关系,再用刚性变换(旋转+平移)对齐空间坐标
  3. 生物先验:用已知的细胞类型标记基因作为锚点,约束配准方向

输出:一个对齐后的空间图谱,多个切片的细胞类型分布可以联合分析。

贡献:第一次把 WFR 非平衡 OT 用到空间转录组配准,有效解决了传统方法在细胞丰度不均时失效的问题。


第二篇:WFR-FM(arXiv:2601.06810, 2026.1)

全称:Wasserstein-Fisher-Rao Flow Matching

解决的问题:从非平衡的快照数据(snapshot data)中重建连续动力学——比如从两个时间点的 scRNA-seq 数据推断细胞分化轨迹。

stVCR 的局限:stVCR 用的是传统 OT 求解器(Sinkhorn 型迭代),计算量随数据规模增长很快,而且需要反复求解瞬态 OT 问题。

WFR-FM 的思路:把 WFR 动态 OT 和 Flow Matching 结合起来。

Flow Matching 原本是生成模型领域的方法——给定起点分布和终点分布,学习一个向量场来”推着”粒子从起点走到终点。WFR-FM 把它扩展到非平衡场景:

  • 不光推着粒子走(向量场 $v_t$)
  • 还要决定粒子什么时候出生/死亡(标量增长率场 $g_t$)

核心结果:同时回归 $v_t$ 和 $g_t$,最小化 WFR-FM loss 等价于恢复 WFR 测地线。

优势: - 免仿真训练(simulation-free),不需要在推理时模拟整个轨迹 - 比传统 OT 求解器快几个数量级 - 可以估计时变增长场(time-varying growth field)


第三篇:WFR-MFM(arXiv:2601.20606, 2026.1)

全称:Wasserstein-Fisher-Rao Mean Flow Matching

解决的问题:WFR-FM 虽然训练快,但推理时仍需要迭代求解 ODE 来生成轨迹。对于大规模应用(比如对数千种扰动条件做预测),这仍然太慢。

WFR-MFM 的创新:用平均流场(mean flow) 替代 ODE 仿真。

基本想法:对于任意时间区间 $[t_0, t_1]$,定义

  • 平均速度场 $\bar{v}{t_0 \to t_1}(x) = \frac{1}{t_1 - t_0} \int{t_0}^{t_1} v_t(x) \, dt$
  • 平均增长场 $\bar{g}{t_0 \to t_1}(x) = \frac{1}{t_1 - t_0} \int{t_0}^{t_1} g_t(x) \, dt$

然后一步推理:

\[\rho_{t_1}(x) \approx \text{Push}_{t_0 \to t_1} \rho_{t_0}\]

其中 Push 操作是同时应用平均位移场和平均增长场,不需要分段求解 ODE。

效果:推理速度比 WFR-FM 再快一个数量级,同时保持预测精度。在数千种扰动条件的合成数据上做了验证。


三篇的关系

stVCR(Nature Methods 2026.3) ├─ 应用场景:空间转录组配准 ├─ 求解范式:传统 OT 求解器(Sinkhorn) └─ WFR 度量 + 刚性对齐 + 生物先验 │ ▼ WFR-FM(arXiv:2601.06810) ├─ 应用场景:scRNA 轨迹推断 ├─ 求解范式:Flow Matching(免仿真训练) └─ WFR 度量 + 向量场 + 增长场回归 │ ▼ WFR-MFM(arXiv:2601.20606) ├─ 应用场景:大规模扰动预测 ├─ 求解范式:Mean Flow(一步推理) └─ WFR 度量 + 平均场 + 无 ODE 仿真

三篇共享同一个核心选择:WFR 度量来同时表达位移和质量变化。变化的是求解范式——从传统 OT 求解器到 Flow Matching 到一步推理,效率逐级提升。

这跟另一条主线(BGW/srGW 用 Bregman 替代平方损失)走的是完全不同的方向:BGW 在损失函数层面做文章,Li 组在求解器层面做文章。


补充:主要研究者

人名 角色
李铁军(Tiejun Li) 北大数学学院,组长,偏微分方程/随机算法/最优传输
周沛杰(Peijie Zhou) 实际带队,scRNA 方向,通讯作者
彭强伟(Qiangwei Peng) 一作(stVCR + WFR-FM),兼顾理论和算法实现
王子涵(Zihan Wang) WFR-FM 合作
王新宇(Xinyu Wang) WFR-MFM 一作

彭强伟是一作主力,三篇里有两篇是他写的。代码都开源了(GitHub 可找到)。


延伸思考

  • WFR 度量和 Fisher-Rao 信息几何有什么关系?WFR 的增长率项 $g_t$ 来自 Fisher-Rao 度量,这是 OT 和微分几何在密度空间中的交汇点
  • WFR-FM 和扩散模型的关系:Flow Matching 本质上是对扩散模型概率流 ODE 的推广,加上质量增长就变成了 WFR-FM
  • 如果把这些方法跟 BGW 框架结合会怎样?比如用 Bregman 散度替代 WFR 中的平方损失——目前还没人做,可能是个方向

参考资料: - stVCR: Spatial transcriptomics alignment via unbalanced optimal transport — Nature Methods, 2026. DOI: 10.1038/s41592-026-02642-x - WFR-FM: WFR-FM: Simulation-Free Dynamic Unbalanced Optimal Transport — arXiv:2601.06810, 2026 - WFR-MFM: WFR-MFM: One-Step Inference for Dynamic Unbalanced Optimal Transport — arXiv:2601.20606, 2026