SemST

3.8k 词

基因域识别

SemST

概要

基因表达特征 + 空间位置信息 + 基因语义信息 → 聚类

让 AI 不仅知道组织里哪些基因表达相似,还能理解这些基因在生物学上有什么意义,从而更准确地划分组织区域。当然,实验中还需要通过消融实验等方法,验证语义信息是否真的带来了提升。

  • 传统:根据表达数据判断这两个点是否相似
  • SemST:加入基因功能来考虑。如果基因 X、Y 参与神经元功能,而基因 M、N 主要参与免疫反应,那么这两个点可能具有不同的生物学功能

步骤

LLM提取生物信息嵌入模块

  1. 收集每个点的高表达基因
    1. 输入数据:例如,某个采样点检测到一组高表达基因:Gene A、Gene B、Gene C。模型先知道这个点有哪些比较活跃的基因
  2. 让大语言模型帮助理解基因含义
    1. 语义信息提取:利用大语言模型的生物学知识,结合基因符号及相关信息,生成能够表示这些基因语义的向量(语义嵌入)
  3. 把生物学语义融入空间特征,进行聚类
    1. 空间域识别:SemST 利用 细粒度语义调节模块(FSM)(语义信息融入模型的特征学习过程,影响不同采样点的表示),将基因语义与原有的表达、空间信息结合,帮助模型学习更有区分度的特征
    2. 最后,模型把采样点划分成不同的空间区域

框架

  • 输入:三种信息
  • 基于表达和空间数据构造两个图,使用GCN对多视图特征进行传播和融合
  • 基因符号被格式化为提示,并输入到大语言模型(LLM)中以提取生物信息嵌入
  • 嵌入随后被提出的FSM模块用于指导空间特征优化
  • 模型优化:通过基于ZINB的数据重建实现

image-20261010160113052

方法推导

实验

PyTorch 实现,采用 Adam 优化器训练,初始学习率 0.001,权重衰减为(5 × 10^−4)

数据集

九个公共空间转录组数据集:5 个具名数据集 + DLPFC 的 5 个切片

数据集 平台 标注域数 备注
DLPFC(人背外侧前额叶皮层) 10x Genomics Visium 5 或 7 个皮层 使用 5 个切片:151508、151509、151510、151671、151672,来自 2 个成人样本
HBC(人乳腺癌) 10x Genomics Visium 20 —
MBA(小鼠脑前部) 10x Genomics Visium 52 —
ME(小鼠胚胎) Stereo-seq 12 E9.5 样本
MVC(小鼠视觉皮层) STARmap 7 —
对比方法
方法 论文中标注的出处 类型/说明(据论文正文)
STAGATE Dong and Zhang 2022(Nat. Com.'22) 图注意力自编码器,学习同时捕获表达相似性与空间邻近性的低维嵌入
GraphST Long et al. 2023(Nat. Com.'23) 在 GNN 基础上引入对比学习以更好区分空间域
Spatial-MGCN Wang et al. 2023(BIB’23) 多视图 GCN,建模基因表达与空间信息间的复杂关系
GAAEST Wang et al. 2024(Com. Biol.'24) 基于对比学习的图注意力自动编码器,用于空间域识别
SEDR Xu et al. 2024(Genome Med.'24) 无监督空间嵌入深度表示
MAFN Zhu et al. 2024(TKDE’24) 多视图自适应融合网络,用于空间分辨转录组数据聚类
stDCL Yu et al. 2025(Adv. Sci.'25) 双图对比学习,用于空间异质性解析与基因调控解释
DUSTED Zhu et al. 2025(AAAI’25) 双注意力增强的空间转录组去噪器
STAIG Yang et al. 2025(Nat. Com.'25) 图像辅助图对比学习,用于空间域探索与无对齐整合
指标

用于综合评估预测聚类与真实标注之间的一致性,且所有结果都乘以了 100

指标 通用含义
ARI(Adjusted Rand Index,调整兰德指数) 衡量两个划分(预测聚类 vs. 真实标注)的相似度,并对随机划分的期望一致性做校正;取值上限为 1,随机水平约为 0,可为负
NMI(Normalized Mutual Information,归一化互信息) 基于预测聚类与真实标签之间的互信息,并做归一化;衡量两划分共享的信息量,通常取值 0–1
ACC(clustering accuracy,聚类准确率) 在最优标签匹配下,预测簇标签与真实标签一致的比例
F1(F1-score) 精确率与召回率的调和平均,用于综合衡量聚类/分类的查准与查全
  • ARI:衡量预测聚类与真实分类之间的一致性,并校正随机聚类可能产生的一致性

    • [ \mathrm{ARI}= \frac{\mathrm{RI}-\mathbb{E}[\mathrm{RI}]} {\max(\mathrm{RI})-\mathbb{E}[\mathrm{RI}]} ]

    • 更常见的等价计算形式为:

      [ \mathrm{ARI}= \frac{ \sum_{ij}\binom{n_{ij}}{2} -\frac{\sum_i\binom{a_i}{2}\sum_j\binom{b_j}{2}}{\binom{n}{2}} }{ \frac12\left[\sum_i\binom{a_i}{2}+\sum_j\binom{b_j}{2}\right] -\frac{\sum_i\binom{a_i}{2}\sum_j\binom{b_j}{2}}{\binom{n}{2}} } ]

      其中,(n_{ij}) 是真实类别 (i) 与预测簇 (j) 的交集样本数,(a_i,b_j) 分别是对应行、列的样本总数,(n) 是总样本数。

      • 通常范围为 ([-1,1]),越接近 1 越好。
      • 随机水平的期望值为 0。
  • NMI:衡量预测聚类与真实标签之间共享了多少信息。

    • [ \mathrm{NMI}(U,V)= \frac{2I(U;V)}{H(U)+H(V)} ]

    • 其中:

      [ I(U;V)=\sum_{i,j}p(i,j) \log\frac{p(i,j)}{p(i)p(j)} ]

      [ H(U)=-\sum_i p(i)\log p(i) ]

      • (U):真实分类。

        (V):预测聚类。

        (I(U;V)):互信息。

        (H(U),H(V)):各自的信息熵。

    • 常见的 NMI 定义范围为 ([0,1]),越大越好。不同实现也可能采用其他归一化方式。

  • ACC:先找到预测簇与真实类别之间的最佳匹配,再计算准确率。

    • [ \mathrm{ACC}= \max_{\pi} \frac{1}{n} \sum_{i=1}^{n} \mathbf{1}\left[y_i=\pi(\hat y_i)\right] ]

    • 其中:

      • (y_i):第 (i) 个样本的真实标签。

        (\hat y_i):预测的聚类标签。

        (\pi):预测簇到真实类别的最优映射。

        (\mathbf{1}[\cdot]):条件成立时为 1,否则为 0。

  • F1-score:Precision(精确率)和 Recall(召回率)的调和平均数。兼顾误报和漏报。

    • [ F1=\frac{2PR}{P+R} ]

    • 其中:

      [ P=\frac{TP}{TP+FP} ]

      [ R=\frac{TP}{TP+FN} ]

      • (TP):真正例。

        (FP):假正例。

        (FN):假负例。

结果
  • 定量:有多少
  • 定性:是什么,什么特点

定量比较,加粗为最好结果,下划线次好

image-20261011162526319

定性比较,手动标注和聚类结果的可视化,颜色表示空 间域

image-20261011162757877

消融实验

SemST变体在四个代表性数据集上性能:

  1. 未使用LLM
  2. 近似LLM
  3. 纯文本编码器,无包含任何专业领域知识、提示非生物问题
  4. 生物相关语义嵌入的LLM

image-20261011165757716

image-20261011165906574

FSM模块消融-集成到所有比较方法中:

image-20261011165941678

参数分析:

SemST 在三个数据集上使用从5到50的(kg) 进行评估:

  • 性能通常随着更大的 kg 而提高
  • ME和MVC中,达到峰值 kg=30
  • MBA中达到峰值 kg=20

中等规模的基因集最能捕捉关键的生物信号,平衡信息损失和生成冗余

image-20261011170015222

存在问题

这些模型几乎都把基因视为孤立的、高维度的数值特征。这种做法完全忽略了基因符号本身所蕴含的大量生物学知识——关于它们的功能、通路和相互作用的知识。

挑战:符号生物学知识与定量空间信息之间的根本差异

主要贡献

  • 大语言模型的基因语义与图神经网络捕获的空间上下文
  • 细粒度语义调制(FSM)模块,语义先验以逐元素的方式动态校准空间特征
  • 在多个基准空间转录组数据集上进行大量实验
  • 模块是一个通用的即插即用组件,持续提升其他基线模型性能

专有知识

空间域识别

是空间转录组学中的一个基本计算任务,旨在识别具有相似基因表达模式的区域,这些模式通常反映了潜在的解剖学或功能组织。鲁棒的空间域识别为下游生物分析奠定了坚实基础,例如差异基因表达分析、功能富集分析和细胞间相互作用推断。这项任务通常被表述为一个聚类问题,旨在将组织划分为具有生物学意义的单元。

图神经网络(GNNs)

内含有:

  • GCN 图卷积网络:通过图卷积聚合邻居节点的信息
  • GAT 图注意力网络:通过注意力机制,为不同邻居分配不同权重
  • GraphSAGE 图采样与聚合:采样邻居,再聚合邻居信息
  • GIN 图同构网络

示例:

空间转录组里,Spot 指的是组织切片上的一个空间采样点。在一张组织切片上,选取一个个位置,测量每个位置的基因表达情况。

一个 Spot 通常包含两类信息:

  • 空间信息:它在组织切片上的位置,例如坐标 ((x,y))
  • 基因表达信息:这个位置测量到的各个基因的表达量

模型:

  • GCN:综合自己和邻居的特征,学习 spot 的表示
  • GAT:学习哪些邻居对当前 spot 更重要

细粒度语义调制(FSM)

使生物功能与空间背景之间能够进行主动的、动态的“对话”。具体来说,FSM学习一个点特定的仿射变换,以对GNN推导的空间特征进行逐元素的校准。允许高阶生物知识动态地指导和细化局部空间上下文的表示。

复现

两种形式:

  • 加载预训练权重复现结果
  • 从头训练模型

预训练权重

相关工作

  • 生物语义的大语言模型
  • 空间域识别
留言