scRNA-seq 的核心挑战、已解决的难题与前沿进展
单细胞 RNA 测序(scRNA-seq)从 2009 年第一篇 paper 到现在,已经从一个”能把单个细胞测出几千个基因”的炫技技术变成了生物学研究的标配工具。但十几年过去了,有些问题解决了,有些仍然卡着脖子,还有些在 2025-2026 年出现了有意思的突破。
这篇算是最近整理资料的汇总,按”已经解决好的” → “还剩哪些难题” → “每个难题上有什么新进展”来组织。
一、这几年来解决得比较好的问题
1. Batch Effect 校正与数据整合 — 已相当成熟
这是 scRNA-seq 过去 5 年最成功的故事。不同实验室、不同平台(10x vs SMART-seq vs Drop-seq)的数据整合,从当年每篇 paper 都要自己摸索,变成了开箱即用的标准工具链。
| 方法 | 年份 | 核心思路 |
|---|---|---|
| Harmony | 2019 | 软聚类 + 迭代校正,快且稳 |
| scVI | 2018 | 变分自编码器 + ZINB 分布建模 |
| scANVI | 2021 | 半监督版,批校正 + 注释联合 |
| Seurat v5 | 2023 | WNN 加权最近邻,整合多模态 + 批次 |
有标准 benchmark 平台(scIB / Luecken et al. 2022 的系统评估)兜底,新方法能在统一框架下公平对比。极端情况(批次与生物学完全混杂时)仍然困难,但日常场景的效果已经足够可靠。
2. 细胞类型自动注释 — 从手工到半自动化
以前注释一个细胞类型靠的是:看 marker gene 热图 + 翻文献 + 拍脑袋。现在:
- Reference-based(SingleR, CellTypist, scTab):速度飞快,准确率高
- Marker-based(ScType):自动查 marker 数据库打分
- LLM-style(scGPT, Geneformer):零样本注释已接近实用
- Uncertainty-aware(eDOC):用 evidential learning 告诉你”这个细胞我不确定是什么”
常见组织(血液、免疫、脑、肿瘤)的注释准确率 > 90%。新类型发现(OOD detection)仍然是一个课题,但已知类型的自动注释已经从”研究方向”变成了”工具使用”。
3. Dropout 插补 — 认识的成熟
这个问题的”解决”过程很有趣——不是方法本身变好了,而是社区对问题的理解成熟了。
- 2016–2019:疯狂做 imputation,MAGIC / scImpute / SAVER 百花齐放
- 2020–2022:benchmark 陆续发现插补会引入假阳性,社区共识开始转向”慎用”
- 2023–2025:共识稳定下来——插补不是万能药,适合特定场景(如轨迹推断、GRN 构建)但不适合差异表达;更好的做法是用概率模型(ZINB loss)直接处理稀疏性
4. 空间转录组解卷积 — 趋于饱和
空间转录组学(Visium, Slide-seq, MERFISH)拿到的是”每个 spot 混合了几种细胞”的信号,要从其中反推细胞类型构成。这个子问题已经接近解决:
- RCTD(稳健细胞类型解卷积)
- CARD(空间相关信息 + scRNA 参考)
- Cell2location(贝叶斯模型 + 不确定性量化)
- Tangram(scRNA ↔ 空间对齐)
多种方法在 benchmark 中结果高度相关,新方法很难再明显超越——说明这个子问题接近饱和。
5. 数据和流程标准化 — 基础设施建成
- Human Cell Atlas (HCA):全球最大单细胞参考图谱
- CZI CellxGene:标准化数据格式 + 统一发布
- Scanpy / Seurat 生态:分析流程基本固化,新手上手门槛大幅降低
几年前,”数据在哪?格式怎么统一?”是真实的障碍,现在基础设施问题已经基本解决。
二、仍然卡着的核心难题
1. 空间转录组的细胞分割(Cell Segmentation)
问题:空间转录组学技术(MERFISH, Xenium, Visium HD)能以亚细胞分辨率测量基因表达,但怎么把转录本正确分配到单个细胞这一步极其困难。分子信号稀疏、组织形态各异、细胞边界模糊——一个分割错误,下游分析全部污染。
2026 年专门有一篇综述就叫 “The Challenge of Cell Segmentation in Spatially Resolved Transcriptomics”,说明这已经被社区确认为一个独立的瓶颈问题。
2. 多模态整合的统一理论
同时测量 RNA + 蛋白(CITE-seq)、RNA + 染色质可及性(sc multi-omics)、RNA + 空间位置的技术越来越流行,但数学上:
- 各模态维度差异巨大(RNA: ~20k 基因 vs 蛋白: ~200 种)
- 统计分布不同(counts vs 强度 vs 比率)
- 不同模态对同一生物过程的敏感度不同
现有的整合方法大多是工程化的(WNN, MOFA+, totalVI),缺一个统一的理论框架。
3. 细胞-细胞通信(CCC)推断的可靠性
从 scRNA 数据推断哪些细胞在通过配体-受体(LR)对”对话”是热门方向,但:
- LR 数据库严重不完整,尤其是非免疫细胞间的相互作用
- 缺空间上下文——不知道两个细胞是否真的物理相邻
- 表达配体和受体 ≠ 它们真的在相互作用
- 没有金标准验证
4. 基因调控网络(GRN)推断
公认最难的子问题。从单细胞数据反推转录因子调控哪些靶基因,复杂度极高、假阳性严重。大模型在这上面也没能带来预想中的突破。
5. 轨迹推断的不确定性
从静态 snapshot 数据推断动态过程(分化、疾病进展)是 scRNA 的核心卖点,但:
- 假时间方向是人为指定的
- RNA velocity 提供方向信息但数据质量要求高
- 分叉点的识别在统计上缺置信度
三、对每个难题的最新突破(2025–2026)
针对细胞分割:免分割思路出现
| 工作 | 年份 | 创新点 |
|---|---|---|
| SEFI (arXiv:2502.13974) | 2025 | 免分割整合(Segmentation-Free Integration)。用自监督学习从荧光核染色图像提取形态特征,直接聚类基因表达,跳过分割步骤 |
| SpCAST (arXiv:2605.26904) | 2026 | KAN(Kolmogorov-Arnold Network)框架。从 scRNA 参考向空间数据做标签转移,专门处理成像平台 panel 有限 + 测序平台 dropout 的双重问题 |
| Signed graph partitioning (arXiv:2312.04181) | 2023 | 用符号图划分做原位转录组细胞分割 |
方向判断:“免分割 + 多模态融合” 是当前的主流策略。分割仍然是瓶颈,但 SEFI 这样的思路证明不一定非要先分割才能做下游分析。
针对多模态整合:大模型范式全面入侵
CellxPert (arXiv:2605.00930, 2026) 🔥 是目前最全面的多模态 foundation model:
- 统一表示 RNA + ATAC + 蛋白(CITE-seq)+ MERFISH + 成像质谱
- 154 种细胞类型的零样本注释(目前最大的 label space)
- 支持 in-silico perturbation:用 MCMC 在潜空间采样,预测基因敲除后的表达变化
配套的综述:Computational Methods for Single-Cell Multi-Omics Integration and Alignment (arXiv:2201.06725) 系统梳理了 machine translation 思路下的各方法。
但我认为这里缺的仍然是理论框架——OT 或 Bregman 流形对齐的思路如果能在这个场景落地,刚好补上这块空白。
针对 CCC 推断:数据库和工具在迭代
- CellPhoneDB v5 (arXiv:2311.04567, 2023):已从单纯的 LR 数据库进化为支持多模态的推断工具,加入空间共定位约束
- CCC Inference and Analysis 综述 (arXiv:2512.03497, 2025):全面梳理了从 LR 数据库到 de novo 方法、从非空间到空间 CCC 推断的演进路径
但根本问题没变:LR 数据库仍然不完整,且没有可靠的金标准来做验证。
针对 GRN 推断:一个反直觉的发现
Towards Universal GRN Inference (arXiv:2605.08128, 2026) 做了一个重要的 benchmark:
scRNA foundation models 的预训练目标(重建基因表达)并不自动提升 GRN 推断能力,表现仍然 far from satisfactory。
原因是重建损失不关注调控信号——模型学会了预测表达水平,但没有学会”谁调控了谁”。需要专门为调控信号设计的训练目标。
另一篇综述 Modeling Dynamics, Cell Type Specificity, and Perturbations in GRNs (arXiv:2602.18854, 2026) 提出需要考虑细胞类型特异性和 perturbation 数据。
针对空间对齐/配准(与最优传输结合的最活跃方向)
这个子方向在 2025–2026 年非常活跃,而且跟最优传输 / 流匹配直接相关:
| 工作 | 思路 |
|---|---|
| RAFT-UP (arXiv:2603.18249) | 空间扭曲的显式可控对齐,在刚体 ↔ 弹性形变之间灵活权衡 |
| INST-Align (arXiv:2604.12084) | 隐式神经表示 + 共享规范表达场,耦合对齐和批次效应校正 |
| Spatial ST Super-resolution via Flow Matching (arXiv:2602.10644) | 流匹配做空间转录组超分辨率 |
值得注意的是,这三个工作的共同点是不再把对齐和整合分开做——stVCR 系列(李铁军组)的 WFR 度量也是这个思路,用非平衡 OT 同时处理位移和质量变化。
Foundation Models 的爆发与争议
2025–2026 年涌现了大量 scRNA foundation model:
| 模型 | 亮点 |
|---|---|
| GeneMamba | sub-quadratic 注意力,解决 transformer 的 O(n²) 瓶颈 |
| CellxPert (arXiv:2605.00930) | 多模态 + in-silico 扰动 |
| Sigmoid Attention (arXiv:2604.27124) | 替换 softmax → cell-type separation 提升 25%,训练更快 |
| Prototype Guided Post-pretraining (arXiv:2605.07938) | 预训练后加原型引导微调 |
| scHyena | 专门面向全长 scRNA-seq |
但是必须提一篇重要的反方论文:
“Parameter-free representations outperform single-cell foundation models on downstream benchmarks” — 发现简单的无参数表示(PCA + log-normalize)在标准评测上反而超过精心训练的 foundation models。
这跟 CV/NLP 早期 foundation model 刚出现时的情形很像:到底进步来自模型架构,还是来自更干净的预处理?对这个领域来说,这个问题的答案还不确定。
四、一张完整的路线图
问题 已解决程度 2025-26 热点方向
─────────────────────────────────────────────────────────────────────
Batch effect 校正 / 数据整合 ⬛⬛⬛⬛⬜ 已成熟 —
细胞类型自动注释 ⬛⬛⬛⬛⬜ 已成熟 foundation model 零样本
空间解卷积 ⬛⬛⬛⬛⬜ 已饱和 —
Dropout / 稀疏性处理 ⬛⬛⬛⬜⬜ 共识成熟 ZINB 概率建模
数据处理基础设施 / 标准化 ⬛⬛⬛⬛⬛ 建成 —
─────────────────────────────────────────────────────────────────────
空间转录组细胞分割 ⬛⬛⬜⬜⬜ 攻坚中 免分割 (SEFI) + KAN (SpCAST)
多模态整合(统一理论) ⬛⬛⬜⬜⬜ 缺框架 CellxPert 大模型 / OT 对齐?
CCC 推断(可靠性) ⬛⬛⬜⬜⬜ 数据瓶颈 CellPhoneDB v5 / 综述
轨迹推断(方向 / 分叉置信度) ⬛⬛⬛⬜⬜ 有共识不稳定 时序 scRNA + RNA velocity
GRN 推断 ⬛⬜⬜⬜⬜ 最难 FM 没解决,需专用目标
空间对齐 / 配准 ⬛⬛⬛⬜⬜ 活跃中 RAFT-UP / INST-Align / FM SR
─────────────────────────────────────────────────────────────────────
scRNA Foundation Models ⬛⬛⬜⬜⬜ 爆发但争议 GeneMamba / CellxPert / 反方论文
几个值得关注的交叉点:
- OT / Flow Matching 对齐 + 空间转录组:stVCR、RAFT-UP、INST-Align 证明了这个方向的活跃度
- Bregman 框架 + 多模态整合:BGW(Bregman-Gromov-Wasserstein)用 Bregman 散度替代平方损失,理论上比传统 GW 更灵活,正好可以切入多模态整合这个缺理论的方向
- Foundation models + 免分割:大模型如果能直接处理空间点阵数据(而非预先分割好的细胞),就有机会绕过分割这个瓶颈
参考文献
- The Challenge of Cell Segmentation in SRT, arXiv:2606.09675 (2026)
- SEFI: Segmentation-free integration, arXiv:2502.13974 (2025)
- SpCAST: Kolmogorov-Arnold network for spatial transcriptomics, arXiv:2605.26904 (2026)
- Cell segmentation via signed graph partitioning, arXiv:2312.04181 (2023)
- CellxPert: multi-omics foundation model, arXiv:2605.00930 (2026)
- Computational Methods for Multi-Omics Integration, arXiv:2201.06725 (2022)
- CellPhoneDB v5, arXiv:2311.04567 (2023)
- CCC Inference and Analysis review, arXiv:2512.03497 (2025)
- Towards Universal GRN Inference, arXiv:2605.08128 (2026)
- Modeling Dynamics in GRNs, arXiv:2602.18854 (2026)
- RAFT-UP: Robust alignment for ST, arXiv:2603.18249 (2026)
- INST-Align: Implicit neural alignment, arXiv:2604.12084 (2026)
- Spatial ST Super-resolution via Flow Matching, arXiv:2602.10644 (2026)
- GeneMamba, arXiv:2605.07938 (2026) - related prototype-guided work
- Sigmoid attention for scFM, arXiv:2604.27124 (2026)
- scHyena: full-length scRNA-seq, related works
- Cross-modal transfer for foundation models, arXiv:2606.07676 (2026)
- Parameter-free representations outperform scFMs, arXiv (2025) - critical counterpoint
- Luecken et al. Benchmarking atlas-level data integration in single-cell genomics. Nature Methods 2022.