一、文章介绍
从常规H&E染色组织病理学图像预测空间基因表达,为昂贵的空间转录组学(ST)实验提供了一种有前景且成本低廉的替代方案。利用大量常规收集的H&E切片,这一方法有望大规模揭示组织微环境、疾病进展和治疗反应的分子见解。然而,现有方法面临一个核心挑战:如何在组织架构中同时建模空间连续性与功能异质性。空间连续性指邻近区域具有相关表达,而生物学功能是异质的——相邻点可能属于完全不同的微环境(如肿瘤与免疫间质),具有截然不同的基因谱。当前方法难以平衡这两方面:统一表征会导致过度平滑和生物学特异性丧失,而忽略空间结构则会损害上下文连贯性。
早期方法(如ST-Net、HisToGene、Hist2ST)将图像到表达预测视为回归问题,将空间坐标和视觉特征编码到共享潜在空间,这无意中强制了局部平滑性,代价是生物边界的模糊。近年来,生成模型(如Stem)通过条件去噪过程提高了预测的保真度和多样性,但Stem未显式整合空间信息,无法解耦空间和功能因子,且迭代采样计算成本高。后续基于流的方法(如STFlow)通过流匹配实现了更快采样,但仍依赖局部邻域聚合,将空间依赖与功能异质性混为一谈。
为突破上述瓶颈,Chengyang Zhang、Bo Li及其合作者在Bioinformatics上发表了题为“PSSD: a conditional flow matching framework with progressive spatial-semantic decoupling for spatial gene expression prediction”的研究论文,提出了一个名为PSSD的渐进式空间-语义解耦框架。
PSSD的核心洞见在于:将空间-语义解耦嵌入到连续流匹配的向量场中,而非仅仅在网络层面组合模态。这一范式转变使生成过程沿ODE积分路径进行逐步、自适应的交互——在功能异质区域抑制空间先验,在结构连贯区域强化空间先验。因此,流匹配不仅是采样效率的工具,更是实现轨迹引导解耦的数学基础。
PSSD采用三阶段渐进架构:(1)共享编码——初始DiT块处理联合基因嵌入(整合表达计数和GO增强的基因相关性)及时序和图像条件,捕获模态不变语义;(2)空间-语义解耦——将共享表示解耦为语义流和空间流(后者融入坐标调制),通过门控机制实现可控的双向信息交换;(3)自适应融合——通过逐点可学习的融合系数λ(由坐标投影经sigmoid得到)自适应平衡空间与语义贡献,生成最终预测。
研究者构建了基因本体(GO)增强的基因嵌入:通过信息含量(IC)和最低公共祖先(LCA)计算GO术语间相似性,用匈牙利算法实现基因间GO术语集的最优对齐,构建加权基因图,经GNN生成先验嵌入与表达计数嵌入融合。图像嵌入使用UNI和CONCH两种病理学基础模型提取。
在7个ST数据集(DLPFC、BC、cSCC、ccRCC、PAAD、COAD及Visium HD COAD)上的实验表明,PSSD在HVG和HEG的PCC上一致优于ST-Net、BLEEP、Stem、STFlow等方法。在DLPFC上,PSSD的HVG PCC达0.337(比Stem提升12.3%),HEG PCC达0.299(提升11.9%)。消融实验表明,移除解耦模块性能下降最显著,证明空间-语义解耦的必要性;用DDPM替代流匹配导致明显性能下降,证明确定性线性轨迹对门控机制的稳定性至关重要。在生成效率上,PSSD将单样本推理时间从Stem的32.04分钟降至3.98分钟(约8倍加速)。基因特异性线性探针分析表明,空间流对高空间自相关(Moran’s I)基因(如MBP)主导,语义流对低空间依赖基因(如CD74)主导,证明解耦机制捕获的是生物学驱动因素而非计算伪影。
二、算法原理介绍
PSSD的算法设计围绕“条件流匹配 → 渐进式空间-语义解耦网络 → 自适应融合”三个核心层次展开。
(一)条件流匹配框架。将基因表达预测形式化为学习条件分布x∼pgene(x∣s,z)x \sim p_{\text{gene}}(x|s,z)x∼pgene(x∣s,z),其中sss为空间坐标嵌入,zzz为图像嵌入。目标是从先验分布p0p_0p0(高斯噪声)到条件依赖的目标分布p1(x∣c)p_1(x|c)p1(x∣c)学习条件向量场vθ(xt,t∣c)v_\theta(x_t,t|c)vθ(xt,t∣c),由ODEdxtdt=vθ(xt,t∣c)\frac{dx_t}{dt}=v_\theta(x_t,t|c)dtdxt=vθ(xt,t∣c)定义。采用线性插值传输路径xt=(1−t)x0+tx1x_t=(1-t)x_0+t x_1xt=(1−t)x0+tx1,速度场恒定为v=x1−x0v=x_1-x_0v=x1−x0,训练损失为L=E∥vθ(xt,t∣c)−(x1−x0)∥22\mathcal{L}=\mathbb{E}\|v_\theta(x_t,t|c)-(x_1-x_0)\|_2^2L=E∥vθ(xt,t∣c)−(x1−x0)∥22。推理时从p0p_0p0采样t=0t=0t=0的噪声,用Euler方法(100步)数值积分ODE至t=1t=1t=1,一步生成预测。该确定性线性轨迹与扩散模型的高方差噪声路径形成对比,为后续空间-语义解耦提供了稳定的动态优化基底。
(二)渐进式空间-语义解耦网络。三阶段架构沿ODE积分路径(状态变量从噪声到数据逐步演化)动态调节空间与语义信号的冲突。(1)共享编码:联合基因嵌入h=hcount+hcorrh=h^{\text{count}}+h^{\text{corr}}h=hcount+hcorr(表达计数嵌入+GO增强GNN嵌入)经DiT块处理,h′=DiTBlocks(h,t+z)h'=\text{DiTBlocks}(h,t+z)h′=DiTBlocks(h,t+z),捕获模态不变语义。(2)空间-语义解耦:初始化空间流hsp=h′+α⋅sh^{\text{sp}}=h'+\alpha \cdot shsp=h′+α⋅s(sss为坐标调制嵌入,α=0.5\alpha=0.5α=0.5)和语义流hse=h′h^{\text{se}}=h'hse=h′。两者经共享注意力但独立适配器处理。门控机制ϕ=Softmax(MLP([c,hˉsp,hˉse,∣hˉsp−hˉse∣]))\phi=\text{Softmax}(\text{MLP}([c,\bar{h}^{sp},\bar{h}^{se},|\bar{h}^{sp}-\bar{h}^{se}|]))ϕ=Softmax(MLP([c,hˉsp,hˉse,∣hˉsp−hˉse∣]))计算交叉更新权重,hsp←hsp+ϕ1hseh^{sp}\leftarrow h^{sp}+\phi_1 h^{se}hsp←hsp+ϕ1hse,hse←hse+ϕ2hsph^{se}\leftarrow h^{se}+\phi_2 h^{sp}hse←hse+ϕ2hsp,实现受控双向信息交换。(3)自适应融合:融合系数λ=σ(ffusion(s))\lambda=\sigma(f_{\text{fusion}}(s))λ=σ(ffusion(s))(sigmoid投影坐标),hfuse=λhˉsp+(1−λ)hˉseh^{\text{fuse}}=\lambda \bar{h}^{sp}+(1-\lambda)\bar{h}^{se}hfuse=λhˉsp+(1−λ)hˉse,逐点自适应平衡空间与语义贡献,经额外DiT块生成最终表达。
(三)多模态特征构建。图像嵌入通过UNI和CONCH提取,经注意力池化和MLP映射。基因嵌入:表达计数经MLP得hcounth^{count}hcount;GO增强嵌入中,用信息含量(IC)和最低公共祖先(LCA)计算GO术语相似度,匈牙利算法对齐基因间GO术语集,构建加权基因图,GNN生成hcorrh^{corr}hcorr,两者求和得联合嵌入。
三、总结
PSSD是一个基于条件流匹配的渐进式空间-语义解耦框架,通过将解耦机制嵌入到ODE积分路径的连续向量场中,在生成过程中逐步自适应地平衡空间连续性与功能异质性,使模型在功能异质区域抑制空间先验、在结构连贯区域强化空间先验。其核心创新在于:以流匹配的确定性线性轨迹为数学基底,通过三阶段渐进架构(共享编码→解耦双向门控→自适应融合)实现空间与语义信息的动态解耦与可控整合。PSSD在7个ST数据集上取得最优预测精度(PCC提升达12.3%),采样速度比扩散方法快约8倍,且基因特异性分析证明解耦机制捕获的是生物学驱动因素,为从组织病理学图像到空间转录组的高效、高保真推断提供了兼具精度与可扩展性的解决方案。