组合关系太复杂,模型要学会双向看
很多机器学习任务并不是“输入一个样本,输出一个标签”这么简单。一个基因扰动可能影响一组基因,一个网络连接可能对应多个端口,一个组合输入也可能同时决定多个预测通道。此时,输入之间有关系,输出之间也有关系,只看单向映射很容易漏掉上下文。
我看到 GDBIM 的设计后,最直观的感受是:它让模型同时看两张图。一张图描述输入实体之间如何互相影响,另一张图描述预测目标之间如何共同变化,再用宽特征扩展把局部和全局模式组织起来。
一,两张图,分别回答两个问题
GDBIM 的双图结构可以这样理解:
- 输入图:哪些扰动、主机或实体彼此相似?它们之间有什么先验关系?
- 输出图:哪些基因、端口或目标通道会一起变化?预测结果之间有什么依赖?
模型先用知识编码器把经验关系放进实体表示,再通过特征扩展把组合输入和预测通道放到同一特征空间,最后用通道特定的解码器做目标推断。
这套思路特别适合组合数据,因为组合效应往往不是简单相加。两个扰动单独看都不明显,组合后却可能显著改变基因表达;两个网络主机分别见过,新的通信模式仍可能从关系中推出来。
二,从基因表达,到网络和区块链
GDBIM 在多种数据上验证了这种结构,包括 Norman、Adamson、RPE1、K562 四个转录组数据集,以及网络流量、区块链交易和航线识别任务。转录组实验覆盖单扰动和双扰动,并专门测试了训练中没有出现过的组合。
在单扰动预测里,GDBIM 在均方误差、相关系数等指标上持续取得更高表现,也能同时捕捉高表达与低活性基因。双扰动测试更能说明问题:当两个扰动都没在训练中出现、只出现其中一个,或两个单独出现但组合未见过时,模型都保持了优势。这说明它学到的不只是样本记忆,也在利用组合关系。
我尤其注意到它对五类扰动交互的分析:抑制、协同、新生、上位性和冗余。简单把两个单独效应相加,在协同或相互抵消的场景里会失效;双图结构的价值,就是为这些非线性交互留下位置。
三,宽特征不等于盲目堆层
“Broad feature” 容易被理解成把网络做宽,但我更愿意把它看成一种整理信息的方式:先扩展输入组合和目标通道的表示,再让不同解码器针对具体预测目标取用相关部分。模型还用 Louvain 社区划分来组织相似扰动,在数据有限时优先学习同一社区内的关系,减少无关样本带来的干扰。
这一步有很实际的含义:当湿实验数据很贵时,模型不只告诉我们“预测是什么”,还可以帮助判断下一批最值得做的实验。数据采集从随机补洞,变成围绕关键关系的定向补充。
四,我会保留的边界
组合推断的难点并没有被一个新架构彻底消除。不同领域的实体关系需要可靠先验;训练数据稀疏时,某些组合仍然不可辨识;网络流量和区块链任务还涉及隐私与分布变化。更重要的是,预测准确不等于因果解释成立,模型发现的关系仍需要实验或业务验证。
但我认为 GDBIM 给出了一个值得复用的判断:当输入和输出都存在关系时,模型也应该把两侧都建模,而不是只在输入端做复杂编码。
五,结论
组合数据的价值,往往藏在“谁和谁一起出现”以及“哪些结果一起变化”里。双图结构让我看到,通用模型不一定要抹平所有领域差异,也可以保留输入关系、输出关系和领域知识,再用统一的特征空间连接它们。
这比单纯追求更深的网络更有启发:先问清楚数据中的关系有几层,再决定模型需要看几张图。
参考资料:Cai, L., Liu, L., Yu, J. et al. GDBIM: generalised dual-graph broad feature inference model for combinatorial regression and recognition. npj Artif. Intell. (2026).