单细胞 RNA 测序(scRNA-seq)从 2009 年第一篇 paper 到现在,已经从一个”能把单个细胞测出几千个基因”的炫技技术变成了生物学研究的标配工具。但十几年过去了,有些问题解决了,有些仍然卡着脖子,还有些在 2025-2026 年出现了有意思的突破。

这篇算是最近整理资料的汇总,按”已经解决好的” → “还剩哪些难题” → “每个难题上有什么新进展”来组织。


一、这几年来解决得比较好的问题

1. Batch Effect 校正与数据整合 — 已相当成熟

这是 scRNA-seq 过去 5 年最成功的故事。不同实验室、不同平台(10x vs SMART-seq vs Drop-seq)的数据整合,从当年每篇 paper 都要自己摸索,变成了开箱即用的标准工具链。

方法 年份 核心思路
Harmony 2019 软聚类 + 迭代校正,快且稳
scVI 2018 变分自编码器 + ZINB 分布建模
scANVI 2021 半监督版,批校正 + 注释联合
Seurat v5 2023 WNN 加权最近邻,整合多模态 + 批次

有标准 benchmark 平台(scIB / Luecken et al. 2022 的系统评估)兜底,新方法能在统一框架下公平对比。极端情况(批次与生物学完全混杂时)仍然困难,但日常场景的效果已经足够可靠。

2. 细胞类型自动注释 — 从手工到半自动化

以前注释一个细胞类型靠的是:看 marker gene 热图 + 翻文献 + 拍脑袋。现在:

  • Reference-based(SingleR, CellTypist, scTab):速度飞快,准确率高
  • Marker-based(ScType):自动查 marker 数据库打分
  • LLM-style(scGPT, Geneformer):零样本注释已接近实用
  • Uncertainty-aware(eDOC):用 evidential learning 告诉你”这个细胞我不确定是什么”

常见组织(血液、免疫、脑、肿瘤)的注释准确率 > 90%。新类型发现(OOD detection)仍然是一个课题,但已知类型的自动注释已经从”研究方向”变成了”工具使用”。

3. Dropout 插补 — 认识的成熟

这个问题的”解决”过程很有趣——不是方法本身变好了,而是社区对问题的理解成熟了。

  • 2016–2019:疯狂做 imputation,MAGIC / scImpute / SAVER 百花齐放
  • 2020–2022:benchmark 陆续发现插补会引入假阳性,社区共识开始转向”慎用”
  • 2023–2025:共识稳定下来——插补不是万能药,适合特定场景(如轨迹推断、GRN 构建)但不适合差异表达;更好的做法是用概率模型(ZINB loss)直接处理稀疏性

4. 空间转录组解卷积 — 趋于饱和

空间转录组学(Visium, Slide-seq, MERFISH)拿到的是”每个 spot 混合了几种细胞”的信号,要从其中反推细胞类型构成。这个子问题已经接近解决:

  • RCTD(稳健细胞类型解卷积)
  • CARD(空间相关信息 + scRNA 参考)
  • Cell2location(贝叶斯模型 + 不确定性量化)
  • Tangram(scRNA ↔ 空间对齐)

多种方法在 benchmark 中结果高度相关,新方法很难再明显超越——说明这个子问题接近饱和。

5. 数据和流程标准化 — 基础设施建成

  • Human Cell Atlas (HCA):全球最大单细胞参考图谱
  • CZI CellxGene:标准化数据格式 + 统一发布
  • Scanpy / Seurat 生态:分析流程基本固化,新手上手门槛大幅降低

几年前,”数据在哪?格式怎么统一?”是真实的障碍,现在基础设施问题已经基本解决。


二、仍然卡着的核心难题

1. 空间转录组的细胞分割(Cell Segmentation)

问题:空间转录组学技术(MERFISH, Xenium, Visium HD)能以亚细胞分辨率测量基因表达,但怎么把转录本正确分配到单个细胞这一步极其困难。分子信号稀疏、组织形态各异、细胞边界模糊——一个分割错误,下游分析全部污染。

2026 年专门有一篇综述就叫 “The Challenge of Cell Segmentation in Spatially Resolved Transcriptomics”,说明这已经被社区确认为一个独立的瓶颈问题。

2. 多模态整合的统一理论

同时测量 RNA + 蛋白(CITE-seq)、RNA + 染色质可及性(sc multi-omics)、RNA + 空间位置的技术越来越流行,但数学上:

  • 各模态维度差异巨大(RNA: ~20k 基因 vs 蛋白: ~200 种)
  • 统计分布不同(counts vs 强度 vs 比率)
  • 不同模态对同一生物过程的敏感度不同

现有的整合方法大多是工程化的(WNN, MOFA+, totalVI),缺一个统一的理论框架

3. 细胞-细胞通信(CCC)推断的可靠性

从 scRNA 数据推断哪些细胞在通过配体-受体(LR)对”对话”是热门方向,但:

  • LR 数据库严重不完整,尤其是非免疫细胞间的相互作用
  • 缺空间上下文——不知道两个细胞是否真的物理相邻
  • 表达配体和受体 ≠ 它们真的在相互作用
  • 没有金标准验证

4. 基因调控网络(GRN)推断

公认最难的子问题。从单细胞数据反推转录因子调控哪些靶基因,复杂度极高、假阳性严重。大模型在这上面也没能带来预想中的突破。

5. 轨迹推断的不确定性

从静态 snapshot 数据推断动态过程(分化、疾病进展)是 scRNA 的核心卖点,但:

  • 假时间方向是人为指定的
  • RNA velocity 提供方向信息但数据质量要求高
  • 分叉点的识别在统计上缺置信度

三、对每个难题的最新突破(2025–2026)

针对细胞分割:免分割思路出现

工作 年份 创新点
SEFI (arXiv:2502.13974) 2025 免分割整合(Segmentation-Free Integration)。用自监督学习从荧光核染色图像提取形态特征,直接聚类基因表达,跳过分割步骤
SpCAST (arXiv:2605.26904) 2026 KAN(Kolmogorov-Arnold Network)框架。从 scRNA 参考向空间数据做标签转移,专门处理成像平台 panel 有限 + 测序平台 dropout 的双重问题
Signed graph partitioning (arXiv:2312.04181) 2023 用符号图划分做原位转录组细胞分割

方向判断:“免分割 + 多模态融合” 是当前的主流策略。分割仍然是瓶颈,但 SEFI 这样的思路证明不一定非要先分割才能做下游分析。

针对多模态整合:大模型范式全面入侵

CellxPert (arXiv:2605.00930, 2026) 🔥 是目前最全面的多模态 foundation model:

  • 统一表示 RNA + ATAC + 蛋白(CITE-seq)+ MERFISH + 成像质谱
  • 154 种细胞类型的零样本注释(目前最大的 label space)
  • 支持 in-silico perturbation:用 MCMC 在潜空间采样,预测基因敲除后的表达变化

配套的综述:Computational Methods for Single-Cell Multi-Omics Integration and Alignment (arXiv:2201.06725) 系统梳理了 machine translation 思路下的各方法。

但我认为这里缺的仍然是理论框架——OT 或 Bregman 流形对齐的思路如果能在这个场景落地,刚好补上这块空白。

针对 CCC 推断:数据库和工具在迭代

  • CellPhoneDB v5 (arXiv:2311.04567, 2023):已从单纯的 LR 数据库进化为支持多模态的推断工具,加入空间共定位约束
  • CCC Inference and Analysis 综述 (arXiv:2512.03497, 2025):全面梳理了从 LR 数据库到 de novo 方法、从非空间到空间 CCC 推断的演进路径

但根本问题没变:LR 数据库仍然不完整,且没有可靠的金标准来做验证。

针对 GRN 推断:一个反直觉的发现

Towards Universal GRN Inference (arXiv:2605.08128, 2026) 做了一个重要的 benchmark:

scRNA foundation models 的预训练目标(重建基因表达)并不自动提升 GRN 推断能力,表现仍然 far from satisfactory。

原因是重建损失不关注调控信号——模型学会了预测表达水平,但没有学会”谁调控了谁”。需要专门为调控信号设计的训练目标。

另一篇综述 Modeling Dynamics, Cell Type Specificity, and Perturbations in GRNs (arXiv:2602.18854, 2026) 提出需要考虑细胞类型特异性和 perturbation 数据。

针对空间对齐/配准(与最优传输结合的最活跃方向)

这个子方向在 2025–2026 年非常活跃,而且跟最优传输 / 流匹配直接相关:

工作 思路
RAFT-UP (arXiv:2603.18249) 空间扭曲的显式可控对齐,在刚体 ↔ 弹性形变之间灵活权衡
INST-Align (arXiv:2604.12084) 隐式神经表示 + 共享规范表达场,耦合对齐和批次效应校正
Spatial ST Super-resolution via Flow Matching (arXiv:2602.10644) 流匹配做空间转录组超分辨率

值得注意的是,这三个工作的共同点是不再把对齐和整合分开做——stVCR 系列(李铁军组)的 WFR 度量也是这个思路,用非平衡 OT 同时处理位移和质量变化。

Foundation Models 的爆发与争议

2025–2026 年涌现了大量 scRNA foundation model:

模型 亮点
GeneMamba sub-quadratic 注意力,解决 transformer 的 O(n²) 瓶颈
CellxPert (arXiv:2605.00930) 多模态 + in-silico 扰动
Sigmoid Attention (arXiv:2604.27124) 替换 softmax → cell-type separation 提升 25%,训练更快
Prototype Guided Post-pretraining (arXiv:2605.07938) 预训练后加原型引导微调
scHyena 专门面向全长 scRNA-seq

但是必须提一篇重要的反方论文:

“Parameter-free representations outperform single-cell foundation models on downstream benchmarks” — 发现简单的无参数表示(PCA + log-normalize)在标准评测上反而超过精心训练的 foundation models。

这跟 CV/NLP 早期 foundation model 刚出现时的情形很像:到底进步来自模型架构,还是来自更干净的预处理?对这个领域来说,这个问题的答案还不确定。


四、一张完整的路线图

问题 已解决程度 2025-26 热点方向 ───────────────────────────────────────────────────────────────────── Batch effect 校正 / 数据整合 ⬛⬛⬛⬛⬜ 已成熟 — 细胞类型自动注释 ⬛⬛⬛⬛⬜ 已成熟 foundation model 零样本 空间解卷积 ⬛⬛⬛⬛⬜ 已饱和 — Dropout / 稀疏性处理 ⬛⬛⬛⬜⬜ 共识成熟 ZINB 概率建模 数据处理基础设施 / 标准化 ⬛⬛⬛⬛⬛ 建成 — ───────────────────────────────────────────────────────────────────── 空间转录组细胞分割 ⬛⬛⬜⬜⬜ 攻坚中 免分割 (SEFI) + KAN (SpCAST) 多模态整合(统一理论) ⬛⬛⬜⬜⬜ 缺框架 CellxPert 大模型 / OT 对齐? CCC 推断(可靠性) ⬛⬛⬜⬜⬜ 数据瓶颈 CellPhoneDB v5 / 综述 轨迹推断(方向 / 分叉置信度) ⬛⬛⬛⬜⬜ 有共识不稳定 时序 scRNA + RNA velocity GRN 推断 ⬛⬜⬜⬜⬜ 最难 FM 没解决,需专用目标 空间对齐 / 配准 ⬛⬛⬛⬜⬜ 活跃中 RAFT-UP / INST-Align / FM SR ───────────────────────────────────────────────────────────────────── scRNA Foundation Models ⬛⬛⬜⬜⬜ 爆发但争议 GeneMamba / CellxPert / 反方论文

几个值得关注的交叉点:

  1. OT / Flow Matching 对齐 + 空间转录组:stVCR、RAFT-UP、INST-Align 证明了这个方向的活跃度
  2. Bregman 框架 + 多模态整合:BGW(Bregman-Gromov-Wasserstein)用 Bregman 散度替代平方损失,理论上比传统 GW 更灵活,正好可以切入多模态整合这个缺理论的方向
  3. Foundation models + 免分割:大模型如果能直接处理空间点阵数据(而非预先分割好的细胞),就有机会绕过分割这个瓶颈

参考文献

  • The Challenge of Cell Segmentation in SRT, arXiv:2606.09675 (2026)
  • SEFI: Segmentation-free integration, arXiv:2502.13974 (2025)
  • SpCAST: Kolmogorov-Arnold network for spatial transcriptomics, arXiv:2605.26904 (2026)
  • Cell segmentation via signed graph partitioning, arXiv:2312.04181 (2023)
  • CellxPert: multi-omics foundation model, arXiv:2605.00930 (2026)
  • Computational Methods for Multi-Omics Integration, arXiv:2201.06725 (2022)
  • CellPhoneDB v5, arXiv:2311.04567 (2023)
  • CCC Inference and Analysis review, arXiv:2512.03497 (2025)
  • Towards Universal GRN Inference, arXiv:2605.08128 (2026)
  • Modeling Dynamics in GRNs, arXiv:2602.18854 (2026)
  • RAFT-UP: Robust alignment for ST, arXiv:2603.18249 (2026)
  • INST-Align: Implicit neural alignment, arXiv:2604.12084 (2026)
  • Spatial ST Super-resolution via Flow Matching, arXiv:2602.10644 (2026)
  • GeneMamba, arXiv:2605.07938 (2026) - related prototype-guided work
  • Sigmoid attention for scFM, arXiv:2604.27124 (2026)
  • scHyena: full-length scRNA-seq, related works
  • Cross-modal transfer for foundation models, arXiv:2606.07676 (2026)
  • Parameter-free representations outperform scFMs, arXiv (2025) - critical counterpoint
  • Luecken et al. Benchmarking atlas-level data integration in single-cell genomics. Nature Methods 2022.