基因域识别
SemST
概要
基因表达特征 + 空间位置信息 + 基因语义信息 → 聚类
让 AI 不仅知道组织里哪些基因表达相似,还能理解这些基因在生物学上有什么意义,从而更准确地划分组织区域。当然,实验中还需要通过消融实验等方法,验证语义信息是否真的带来了提升。
- 传统:根据表达数据判断这两个点是否相似
- SemST:加入基因功能来考虑。如果基因 X、Y 参与神经元功能,而基因 M、N 主要参与免疫反应,那么这两个点可能具有不同的生物学功能
步骤
LLM提取生物信息嵌入模块
- 收集每个点的高表达基因
- 输入数据:例如,某个采样点检测到一组高表达基因:Gene A、Gene B、Gene C。模型先知道这个点有哪些比较活跃的基因
- 让大语言模型帮助理解基因含义
- 语义信息提取:利用大语言模型的生物学知识,结合基因符号及相关信息,生成能够表示这些基因语义的向量(语义嵌入)
- 把生物学语义融入空间特征,进行聚类
- 空间域识别:SemST 利用 细粒度语义调节模块(FSM)(语义信息融入模型的特征学习过程,影响不同采样点的表示),将基因语义与原有的表达、空间信息结合,帮助模型学习更有区分度的特征
- 最后,模型把采样点划分成不同的空间区域
框架
- 输入:三种信息
- 基于表达和空间数据构造两个图,使用GCN对多视图特征进行传播和融合
- 基因符号被格式化为提示,并输入到大语言模型(LLM)中以提取生物信息嵌入
- 嵌入随后被提出的FSM模块用于指导空间特征优化
- 模型优化:通过基于ZINB的数据重建实现

方法推导
实验
PyTorch 实现,采用 Adam 优化器训练,初始学习率 0.001,权重衰减为(5 × 10^−4)
数据集
九个公共空间转录组数据集:5 个具名数据集 + DLPFC 的 5 个切片
| 数据集 | 平台 | 标注域数 | 备注 |
|---|---|---|---|
| DLPFC(人背外侧前额叶皮层) | 10x Genomics Visium | 5 或 7 个皮层 | 使用 5 个切片:151508、151509、151510、151671、151672,来自 2 个成人样本 |
| HBC(人乳腺癌) | 10x Genomics Visium | 20 | — |
| MBA(小鼠脑前部) | 10x Genomics Visium | 52 | — |
| ME(小鼠胚胎) | Stereo-seq | 12 | E9.5 样本 |
| MVC(小鼠视觉皮层) | STARmap | 7 | — |
对比方法
| 方法 | 论文中标注的出处 | 类型/说明(据论文正文) |
|---|---|---|
| STAGATE | Dong and Zhang 2022(Nat. Com.'22) | 图注意力自编码器,学习同时捕获表达相似性与空间邻近性的低维嵌入 |
| GraphST | Long et al. 2023(Nat. Com.'23) | 在 GNN 基础上引入对比学习以更好区分空间域 |
| Spatial-MGCN | Wang et al. 2023(BIB’23) | 多视图 GCN,建模基因表达与空间信息间的复杂关系 |
| GAAEST | Wang et al. 2024(Com. Biol.'24) | 基于对比学习的图注意力自动编码器,用于空间域识别 |
| SEDR | Xu et al. 2024(Genome Med.'24) | 无监督空间嵌入深度表示 |
| MAFN | Zhu et al. 2024(TKDE’24) | 多视图自适应融合网络,用于空间分辨转录组数据聚类 |
| stDCL | Yu et al. 2025(Adv. Sci.'25) | 双图对比学习,用于空间异质性解析与基因调控解释 |
| DUSTED | Zhu et al. 2025(AAAI’25) | 双注意力增强的空间转录组去噪器 |
| STAIG | Yang et al. 2025(Nat. Com.'25) | 图像辅助图对比学习,用于空间域探索与无对齐整合 |
指标
用于综合评估预测聚类与真实标注之间的一致性,且所有结果都乘以了 100
| 指标 | 通用含义 |
|---|---|
| ARI(Adjusted Rand Index,调整兰德指数) | 衡量两个划分(预测聚类 vs. 真实标注)的相似度,并对随机划分的期望一致性做校正;取值上限为 1,随机水平约为 0,可为负 |
| NMI(Normalized Mutual Information,归一化互信息) | 基于预测聚类与真实标签之间的互信息,并做归一化;衡量两划分共享的信息量,通常取值 0–1 |
| ACC(clustering accuracy,聚类准确率) | 在最优标签匹配下,预测簇标签与真实标签一致的比例 |
| F1(F1-score) | 精确率与召回率的调和平均,用于综合衡量聚类/分类的查准与查全 |
-
ARI:衡量预测聚类与真实分类之间的一致性,并校正随机聚类可能产生的一致性
-
[ \mathrm{ARI}= \frac{\mathrm{RI}-\mathbb{E}[\mathrm{RI}]} {\max(\mathrm{RI})-\mathbb{E}[\mathrm{RI}]} ]
-
更常见的等价计算形式为:
[ \mathrm{ARI}= \frac{ \sum_{ij}\binom{n_{ij}}{2} -\frac{\sum_i\binom{a_i}{2}\sum_j\binom{b_j}{2}}{\binom{n}{2}} }{ \frac12\left[\sum_i\binom{a_i}{2}+\sum_j\binom{b_j}{2}\right] -\frac{\sum_i\binom{a_i}{2}\sum_j\binom{b_j}{2}}{\binom{n}{2}} } ]
其中,(n_{ij}) 是真实类别 (i) 与预测簇 (j) 的交集样本数,(a_i,b_j) 分别是对应行、列的样本总数,(n) 是总样本数。
- 通常范围为 ([-1,1]),越接近 1 越好。
- 随机水平的期望值为 0。
-
-
NMI:衡量预测聚类与真实标签之间共享了多少信息。
-
[ \mathrm{NMI}(U,V)= \frac{2I(U;V)}{H(U)+H(V)} ]
-
其中:
[ I(U;V)=\sum_{i,j}p(i,j) \log\frac{p(i,j)}{p(i)p(j)} ]
[ H(U)=-\sum_i p(i)\log p(i) ]
-
(U):真实分类。
(V):预测聚类。
(I(U;V)):互信息。
(H(U),H(V)):各自的信息熵。
-
-
常见的 NMI 定义范围为 ([0,1]),越大越好。不同实现也可能采用其他归一化方式。
-
-
ACC:先找到预测簇与真实类别之间的最佳匹配,再计算准确率。
-
[ \mathrm{ACC}= \max_{\pi} \frac{1}{n} \sum_{i=1}^{n} \mathbf{1}\left[y_i=\pi(\hat y_i)\right] ]
-
其中:
-
(y_i):第 (i) 个样本的真实标签。
(\hat y_i):预测的聚类标签。
(\pi):预测簇到真实类别的最优映射。
(\mathbf{1}[\cdot]):条件成立时为 1,否则为 0。
-
-
-
F1-score:Precision(精确率)和 Recall(召回率)的调和平均数。兼顾误报和漏报。
-
[ F1=\frac{2PR}{P+R} ]
-
其中:
[ P=\frac{TP}{TP+FP} ]
[ R=\frac{TP}{TP+FN} ]
-
(TP):真正例。
(FP):假正例。
(FN):假负例。
-
-
结果
- 定量:有多少
- 定性:是什么,什么特点
定量比较,加粗为最好结果,下划线次好

定性比较,手动标注和聚类结果的可视化,颜色表示空 间域

消融实验
SemST变体在四个代表性数据集上性能:
- 未使用LLM
- 近似LLM
- 纯文本编码器,无包含任何专业领域知识、提示非生物问题
- 生物相关语义嵌入的LLM


FSM模块消融-集成到所有比较方法中:

参数分析:
SemST 在三个数据集上使用从5到50的(kg) 进行评估:
- 性能通常随着更大的 kg 而提高
- ME和MVC中,达到峰值 kg=30
- MBA中达到峰值 kg=20
中等规模的基因集最能捕捉关键的生物信号,平衡信息损失和生成冗余

存在问题
这些模型几乎都把基因视为孤立的、高维度的数值特征。这种做法完全忽略了基因符号本身所蕴含的大量生物学知识——关于它们的功能、通路和相互作用的知识。
挑战:符号生物学知识与定量空间信息之间的根本差异
主要贡献
- 大语言模型的基因语义与图神经网络捕获的空间上下文
- 细粒度语义调制(FSM)模块,语义先验以逐元素的方式动态校准空间特征
- 在多个基准空间转录组数据集上进行大量实验
- 模块是一个通用的即插即用组件,持续提升其他基线模型性能
专有知识
空间域识别
是空间转录组学中的一个基本计算任务,旨在识别具有相似基因表达模式的区域,这些模式通常反映了潜在的解剖学或功能组织。鲁棒的空间域识别为下游生物分析奠定了坚实基础,例如差异基因表达分析、功能富集分析和细胞间相互作用推断。这项任务通常被表述为一个聚类问题,旨在将组织划分为具有生物学意义的单元。
图神经网络(GNNs)
内含有:
- GCN 图卷积网络:通过图卷积聚合邻居节点的信息
- GAT 图注意力网络:通过注意力机制,为不同邻居分配不同权重
- GraphSAGE 图采样与聚合:采样邻居,再聚合邻居信息
- GIN 图同构网络
示例:
空间转录组里,Spot 指的是组织切片上的一个空间采样点。在一张组织切片上,选取一个个位置,测量每个位置的基因表达情况。
一个 Spot 通常包含两类信息:
- 空间信息:它在组织切片上的位置,例如坐标 ((x,y))
- 基因表达信息:这个位置测量到的各个基因的表达量
模型:
- GCN:综合自己和邻居的特征,学习 spot 的表示
- GAT:学习哪些邻居对当前 spot 更重要
细粒度语义调制(FSM)
使生物功能与空间背景之间能够进行主动的、动态的“对话”。具体来说,FSM学习一个点特定的仿射变换,以对GNN推导的空间特征进行逐元素的校准。允许高阶生物知识动态地指导和细化局部空间上下文的表示。
复现
两种形式:
- 加载预训练权重复现结果
- 从头训练模型
预训练权重
相关工作
- 生物语义的大语言模型
- 空间域识别