想象你拿到几张同一座城市的热力图:有的显示工作日,有的显示周末,还有的来自不同季节。若把它们直接叠在一起,局部差异会被抹平;若完全分开看,又可能把偶然噪声当成规律。空间基因分析也有类似难题:研究者需要比较多张组织切片,同时判断哪些表达模式可以互相印证,哪些只是某一张切片独有。
Meng Zhou、Shuangge Ma 和 Mengyun Wu 提出的 IBaySVG,试图在这两者之间找到平衡。它用一个集成式贝叶斯分层模型,同时分析多个组织样本,让切片共享证据,又不强迫它们表现一致。据 arXiv 与 Journal of the American Statistical Association(JASA),论文预印本最初提交于 2025 年 4 月,2026 年 8 月更新至第 4 版,并于同年 9 月以 accepted author version 登上 JASA。
不只问“多少”,还要问“在哪里”
空间转录组(spatial transcriptomics)在测量基因表达量时,也保留细胞或采样点在组织中的位置。于是,研究者不只知道某个基因是否活跃,还能观察它是否沿大脑皮层、肿瘤边界等区域发生有规律的变化。
这类表达随位置系统变化的基因,叫空间变异基因(spatially variable genes,SV genes)。找到它们,可以帮助划分组织中的功能区域,也能提示疾病相关变化集中在哪里。
问题在于,组织中的图案未必规整。论文作者概括称,已有方法常预先设定空间模式,复杂结构可能因此被遗漏;多样本分析也缺少标准化整合方案。按照论文报告,在人类背外侧前额叶皮层(DLPFC)和鳞状细胞癌(SCC)数据上,分别采用七种既有方法时,不同切片检出的空间变异基因重合率低于 50%。这并不直接证明某种方法算错了,却说明结果可能十分依赖切片和分析工具。
先让每张切片说自己的话
IBaySVG 的第一步,是少替空间图案做假设。据 arXiv 论文,模型使用非参数空间函数——也就是不先把表达变化限定为线性、局部聚集或周期形状,而让数据决定曲线怎么弯。其自适应空间过程用于容纳多种空间模式。
模型还以零膨胀负二项分布处理表达计数。“零膨胀”表示数据里有大量零值;“负二项分布”则适合描述波动明显大于普通计数模型预期的情况。这一设置对应空间转录组数据稀疏、离散程度高的特点。
真正关键的是第二步:跨样本借力。贝叶斯分层模型可以理解为一次带有层级的集体判断。每张切片保留自己的结果,上层模型再寻找共同证据。IBaySVG 使用两层收缩先验——先验是模型在看到当前数据前对参数结构作出的约束——分别判断某个基因在单一样本中是否存在空间效应,以及这种效应是否跨样本存在。说白了,它不会因为多数切片相似,就自动抹掉少数切片的不同;也不会让每张切片从零开始、互不参考。
算得动,也是设计的一部分
贝叶斯模型需要计算后验分布,也就是结合数据后更新对各种可能性的判断。直接计算往往困难。作者因此采用变分推断(variational inference):把难算的后验转换成一个可以优化的近似分布,通常比逐步抽样的 MCMC 更快。
据 arXiv 论文,作者分析了 DLPFC 和 SCC 数据,覆盖同一供体的多个切片、不同供体切片和肿瘤组织等场景;各样本的空间点数约从 1000 到平均 4000 不等。论文称,仿真中 IBaySVG 的 F1 分数持续高于对比方法。F1 是综合衡量“找得准”和“漏得少”的指标。不过,现有供稿没有给出具体分数、差距或各对照方法表现,因此不能据此判断优势有多大。
在真实数据中,作者用识别出的空间变异基因划分组织区域,并通过通路富集分析寻找功能一致的基因簇。通路富集分析,是检查一组基因是否集中参与某些生物功能的办法。这说明该框架的目标不只是列出基因名单,还希望把名单连接到组织结构和潜在功能。
为什么值得关注
这项工作的价值,主要在建模角度的转换:研究对象不再是一张“标准切片”,而是一组既有关联、又存在异质性的组织。跨样本共享信息可以减少各算各的带来的摇摆;保留样本层差异,又避免把真实异质性平均掉。对于包含不同供体、不同切片或肿瘤区域的数据,这种平衡比单纯追求一个统一答案更重要。
局限与未知
- 本文所有效果论断均来自同一研究团队的论文材料,尚无独立复现可供交叉印证。
- 供稿未披露具体 F1 数值、准确率、召回率、显著性指标和运行时间,因此“更稳健”“可扩展”等表述仍主要是作者判断。
- 多层模型能保留异质性,但它在多大程度上受先验设置、切片质量和样本差异影响,现有材料没有给出足够细节。