以色列理工联合哈佛医学院发表多模态模型,从病理切片直接解码复发风险与化疗获益
2026/7/24 23:14:21 网站建设 项目流程

小罗碎碎念

本文核心内容参考自:Gil Shamai, et al. Deep learning on histopathological images to predict breast cancer recurrence risk and chemotherapy benefit: a multicentre, model development and validation study.Lancet Oncol, 2026, 27: 512-526.
研究由以色列理工学院领衔,联合哈佛大学医学院、以色列多家医疗中心、美国芝加哥大学等机构共同完成。

对早期激素受体阳性、HER2阴性乳腺癌患者来说,要不要做辅助化疗,始终是一道艰难的选择题。

传统临床评估(看肿瘤大小、组织分级、淋巴结状态)就像人工查验证件,只能筛出特征明显的高危人群,却会漏掉一部分潜在风险者,也会让很多低危患者白白承受化疗的毒副作用。

而行业金标准Oncotype DX 21基因复发评分检测,就像高精度全身扫描,能精准判断复发风险和化疗获益,但一次检测高达约3500美元的成本、漫长的周转周期,让它成了很多患者用不起的“奢侈品”——文献数据显示,在中低收入国家,能用上这类基因检测的患者不足5%。


作为占全部乳腺癌约70%的主流亚型,激素受体阳性、HER2阴性早期乳腺癌的治疗决策,长期困在“精准但昂贵”与“廉价但粗糙”的两难里。

常规的苏木精-伊红(H&E)染色病理切片虽然全球普及、成本低廉,却只能提供形态学诊断,无法直接给出基因组层面的复发风险。

过去十几年里,研究者一直在尝试用人工智能从H&E切片中预测Oncotype DX评分,但所有研究都卡在了同一个瓶颈:只能回顾性地和基因检测结果做相关性验证,却无法证明AI的风险分层真能指导化疗获益——而这恰恰是Oncotype DX检测最核心的临床价值。

来自以色列理工学院、哈佛大学医学院等机构的研究团队,基于大规模病理预训练基础模型,开发出一套多模态深度学习系统,仅需常规H&E全切片图像加上雌激素受体(ER)、孕激素受体(PR)状态,就能准确估算Oncotype DX复发评分。

更重要的是,该研究首次利用TAILORx随机对照临床试验的数据,验证了AI分层能够准确预测患者的化疗获益,为病理AI真正走入临床决策提供了关键证据。


模型完整工作流

这是模型从病理切片输入到输出风险评分的端到端流程,核心是“预训练基础模型+多实例学习+多模态融合”的架构:

输入与预处理

输入常规H&E染色的全切片病理图像,先进行自动组织分割,再切割为标准化的小图块(tiles),剔除空白与伪影区域。

特征提取

使用在17万张H&E病理切片上预训练的GigaPath基础模型,对每一张图块提取高维特征向量。这是模型泛化能力强的核心来源——无需人工标注肿瘤区域,就能自动捕捉形态学特征。

特征聚合与融合

通过Transformer编码器对所有图块特征做聚合(多实例学习MIL),同时融入ER、PR、年龄等临床变量,形成多模态特征。

输出与评估

经切片级微调后输出连续的AI复发评分,最终用于生存分析(如无复发生存RFI)等性能评估。


TAILORx临床试验分组设计

该图还原了TAILORx随机对照试验(RCT)的患者分层逻辑,这是本研究能验证“化疗获益”的核心基础:

共10273名患者按Oncotype DX 21基因复发评分分为三层:

  • <11分(低危):1629人,仅接受内分泌治疗(Group A)
  • 11-25分(中危):6907人,随机分组:3449人接受内分泌+安慰剂(Group B),3458人接受内分泌+化疗(Group C)
  • ≥26分(高危):1737人,接受内分泌+化疗(Group D)

关键价值:中危人群的随机化设计,排除了治疗选择偏倚,让研究者能真正验证“AI划分的风险组,是否真的对应化疗获益差异”。


全球研究队列分布与样本规模

展示了研究覆盖的7个独立队列的地理分布与样本量,体现研究的多中心泛化验证设计:

核心训练测试队列

TAILORx(8284名患者,全球多中心)

外部验证队列

覆盖以色列(Carmel、Haemek、Sheba医疗中心)、美国(芝加哥大学UCMC、TCGA数据库)、澳大利亚(ABCTB乳腺组织库),同时设置了专门的校准队列。

整体规模

共收集17812名患者、25436张切片;经质控后最终纳入分析13781名患者、16885张切片。

地理范围跨北美、欧洲、中东、大洋洲、南美,覆盖不同人种、染色方案与扫描设备,用于验证模型的跨中心泛化能力。


医学AI交流群

目前小罗全平台关注量120,000+,交流群总成员4000+,大部分来自国内外顶尖院校/医院,期待您的加入!!

由于近期入群推销人员较多,已开启入群验证,扫码添加我的联系方式,备注姓名-单位-科室/专业,即可邀您入群。


一、从形态图像到基因组评分

和传统“先做基因检测、再指导治疗”的路径不同,这项研究的核心逻辑,是让AI直接从病理切片的形态特征中,解码出与21基因表达谱对应的复发风险信息。

它没有走“人工标注特征→训练模型”的老路,而是依托在17万余张病理切片上预训练的GigaPath基础模型,结合多实例学习架构,实现了从图像到风险评分的端到端预测。

整个流程可以拆解为三个核心步骤,外加一套适配不同场景的校准方案。

预处理

一张数字化的全切片图像(WSI)通常有数十亿像素,相当于上万张普通照片的大小,无法直接输入模型。

研究团队首先通过算法自动识别切片上的有效肿瘤组织区域,剔除空白背景和扫描伪影,再将组织区域切割成一块块1.6平方毫米的标准图块,只有图块数量不少于100张的切片才会进入后续分析。

这套自动质控流程仅剔除了不到0.1%的不合格样本,从源头保证了输入数据的可靠性。


特征提取

研究团队没有用普通的卷积神经网络从零开始训练,而是采用了预训练的GigaPath病理基础模型——这个模型已经通过自监督学习,在171189张不同来源的H&E病理切片上完成了“预学习”,掌握了病理图像的通用形态特征。

基于Transformer架构的它,还擅长捕捉组织内的长距离空间关联,比传统模型更能理解肿瘤微环境的整体格局。


整合打分

所有图块提取出的特征向量,会通过Transformer编码器进行聚合,生成整张切片的全局特征;与此同时,模型会融入患者的ER、PR状态这两个临床变量,最终输出一个连续的AI复发评分。

有意思的是,研究团队通过特征重要性分析发现:当加入图像特征后,组织学分级、患者年龄、肿瘤大小这些传统临床指标都不再提供额外信息——也就是说,AI从图像里已经学到了比人工分级更丰富、更精准的风险相关特征。

最终的多模态模型只保留了ER、PR两项最核心的临床指标,大部分预测能力都来自图像本身,这也大大降低了模型的使用门槛。


极简校准

为了让模型能适配不同医院的染色差异、扫描仪型号和人群特征,研究团队还设计了一套极简的单参数线性校准方法:只需要估算出目标队列的平均Oncotype DX评分(甚至可以通过临床特征粗略推算),就能通过一次线性缩放完成校准,不需要在当地重新收集基因检测数据做训练。

实验证实,仅需100例样本就能完成稳定的校准,这为模型在资源有限地区的落地扫清了关键障碍。


二、从随机临床试验到全球多中心真实世界

一项医学AI技术能不能真正用于临床,光靠原理创新远远不够,必须经得起严格的验证。

这项研究的验证体系堪称同类研究的标杆:既在TAILORx随机临床试验中完成了“金标准级”的化疗获益验证,又在六大独立外部队列中检验了真实世界泛化能力。

TAILORx试验,首次在随机对照数据中验证化疗获益

TAILORx是奠定Oncotype DX临床地位的经典III期随机对照试验,入组了上万名激素受体阳性、HER2阴性、淋巴结阴性的早期乳腺癌患者。

其中复发评分在11-25分的中间风险患者,被随机分配接受单纯内分泌治疗或内分泌联合化疗,这为验证AI能否预测化疗获益提供了独一无二的数据基础。

研究纳入了其中8284例符合质控的患者,按7:3的比例拆分为训练集和测试集,所有拆分都以患者为单位,避免了数据泄露。

首先看最直观的准确性:在2407人的测试集中,AI评分与真实Oncotype DX评分的Pearson相关系数达到0.728。

对于临床最关心的“识别高危患者(复发评分≥26分)”这一任务,模型的曲线下面积(AUC)达到了0.898——相比之下,仅用临床特征的模型AUC只有0.780,仅用图像的模型也能达到0.886,可见图像特征贡献了绝大部分预测能力。

研究团队选择16分和26分作为高低危的划分阈值,最终有45.6%的患者被归为AI低危,12.0%被归为AI高危,剩余42.4%为中危。

在AI判定的低危患者中,仅有1.8%是真正的基因高危,阴性预测值高达98.2%;而AI判定的高危患者中,特异性达到95.9%。这意味着,被AI划分为低危的患者,几乎可以放心排除高危风险。


在预后分层上,AI高危患者的无远处复发生存风险是低危患者的2.88倍,无复发生存风险是2.61倍,和真实基因检测的分层效果没有统计学差异。

但真正的突破,还是化疗获益的验证。过去所有同类研究都只能证明AI和基因检测结果像,却无法证明AI指导的治疗决策对不对——因为回顾性数据里,高危患者几乎都接受了化疗,无法区分是预后差还是化疗没效。

而TAILORx的随机分组设计,让研究者可以直接回答:AI说高危的患者,化疗到底有没有用?

结果非常明确:对于绝经前的AI高危患者,化疗能显著改善无病生存(风险比HR=0.63),也就是化疗能降低37%的疾病进展风险;而对于绝经后的AI低危患者,化疗完全没有带来生存获益(HR=0.94,无统计学差异)。

更有临床价值的是重新分类分析:按照传统的MINDACT临床风险标准被判定为高危的绝经后患者里,有31.3%被AI重新划分为低危。

这部分患者按照传统标准可能会接受化疗,但实际上她们并没有化疗获益,AI可以帮她们避免过度治疗。


跨人群跨中心的稳定表现

如果说TAILORx验证了模型的“绝对实力”,六大独立外部队列则检验了模型的“适应能力”

这六个队列分别来自以色列三家医疗中心、美国芝加哥大学、澳大利亚乳腺组织库和TCGA数据库,共涵盖5497名患者,覆盖了不同的人种、染色方案、扫描设备,甚至包含了训练集中没有的淋巴结阳性患者。

经过单参数校准后,模型在各个队列中识别高危(复发评分≥26)的AUC稳定在0.858到0.903之间,和TAILORx测试集的表现几乎没有差距。

哪怕是训练时从未见过的淋巴结阳性患者,模型的AUC也能达到0.874,和淋巴结阴性患者的0.861相当——这说明模型捕捉的是肿瘤本身的生物学风险特征,而不是依赖淋巴结状态这类间接指标。

在有长期随访数据的队列中,AI风险分层同样能显著区分患者的预后,效果与真实基因检测没有统计学差异。

比如在澳大利亚队列中,AI高危患者的乳腺癌特异性死亡风险是低危患者的4.17倍,展现了极强的预后价值。


基础模型带来的代际优势

研究还和已有的两类主流方法做了基准对比:一类是传统的全监督多实例学习模型,另一类是当时唯一公开的复发评分预测模型DLRS。

结果显示,无论是在TAILORx测试集还是外部队列中,基于基础模型的新方法都显著优于前两者,尤其是在跨中心的外部验证中,优势更加明显——这正是大规模预训练基础模型的核心价值:更强的泛化能力,更少的域偏移。


三、不止于替代检测,病理AI正在改写精准医疗的边界

这项研究的意义,远不止于“用AI替代昂贵的基因检测”这么简单。

它真正打开了常规病理切片的“分子信息宝藏”,让每一张医院里随处可见的H&E切片,都能发挥接近基因组检测的临床价值。

最直接的影响,是精准医疗的可及性革命。

Oncotype DX检测一次约3500美元,还需要样本寄送、专业实验室检测,周转时间长;而数字病理切片的扫描成本不到1美元,AI分析可以在数天内完成,几乎没有边际成本。

对于中低收入国家的患者来说,这意味着不用再在“盲目化疗”和“天价检测”之间二选一,仅凭常规病理检查就能获得接近精准医疗的风险分层,大幅减少不必要的化疗及其带来的毒副作用与经济负担。

其次,它补充了传统临床决策的盲区。

  • 一方面,约5%临床判断为低危的绝经前患者,会被AI升级为高危,从而避免治疗不足;
  • 另一方面,30%-40%临床判断为高危的绝经后患者,会被AI降级为低危,从而避免过度治疗。

一升一降之间,是治疗决策的整体优化。


更值得深思的是,AI对瘤内异质性的捕捉能力。

研究中,AI评分与基因检测不一致的病例,大多存在明显的瘤内异质性——同一份肿瘤的不同切片,AI评分差异很大,而基因检测的结果往往只匹配其中一张切片的AI评分。

这意味着,只取少量组织的基因检测可能会因为取样偏差漏掉高危区域,而分析多张切片的AI反而能给出更全面的风险评估。

当然,这项研究也有其边界。目前模型的化疗获益直接验证主要基于淋巴结阴性人群,未来还需要在淋巴结阳性的RxPONDER等试验中进一步确认,也需要更多前瞻性、来自中低收入国家的真实世界数据支持。

但方向已经清晰:未来这类病理基础模型还可以继续拓展,从预测单一的复发评分,到同时预测多种分子特征、药物响应,实现“一张切片、全套分子评估”,从乳腺癌拓展到更多癌种。

从“奢侈品”到“普惠品”,精准医疗的门槛正在被AI一点点拉低。而这,正是技术最动人的价值:让最前沿的医学成果,最终惠及每一个需要的人。


加入团队

我们是一支由国内外顶尖高校硕博组成的前沿交叉团队,多名成员以第一作者身份在Nature、Nature Communications、Advanced Science以及Radiology等顶级期刊发表过论文。

团队正在招聘实习生/分析师/讲师,欢迎医工交叉方向的优秀硕博,投递个人简历到团队邮箱:lxltx2025@163.com

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询