ICML 2026放出医学影像专辑征稿消息那天,我们实验室的群一下子就热闹了。其实大家激动的不只是"顶会终于开始认真收医学影像文章"——毕竟这几年NeurIPS和ICLR也没少发医学AI的工作——而是专辑的主题设置传递了一个很明确的信号:医学多模态智能正在从"能做出来"转向"能信得过"。"从基础模型到可信推理",这个描述往大了说,是整个领域未来两三年最主要的攻关方向;往小了说,直接关系到你我手头正在做的课题怎么设计、实验怎么做、投稿怎么切中审稿人的心思。
我自己从博士阶段开始就一直在做医学影像分析,从最早的纯CNN分割,到后来多模态融合、再到最近开始碰基础模型微调和不确定性量化,中间踩过的坑不算少。这篇东西就是结合我自己的项目经验,把ICML 2026医学影像专辑相关的那些关键问题掰开揉碎聊一聊:这个专辑到底收什么方向的文章、医学多模态真正的难点在哪、基础模型在医学影像上怎么落地、可信推理又该怎么着手做扎实。
1. ICML医学影像专辑究竟在收什么:先读懂这次征稿的隐藏意图
很多做医学影像的同学,看到"ICML"第一反应是"这是ML主会,医学影像这种偏应用的方向是不是不太受待见"。这个想法放在五六年前确实有道理,但放到2026年的语境下已经过时了。ICML的确与MICCAI风格不同,它不追求你在某个临床任务上刷了多高的Dice或AUC,而更在乎你有没有提出可泛化的方法论、经得起理论推敲的学习范式,以及对机器学习社区有反哺价值的问题建模。这个专辑把"医学影像"和"基础模型、可信推理"绑在一起,本质上是在说:医学影像不再只是ML方法的试验场,它正在成为检验"大模型可靠性"的最严苛考场之一。
1.1 专辑定位与主会、MICCAI的差异化
如果你的目标是ICML医学影像专辑,脑子里必须先有这条判断线:MICCAI重临床验证,CVPR重视觉表现,ICML重学习机制的创新。举一个很直观的例子,同样是做多模态融合,MICCAI的审稿人大概率会问"你这个方法在XX数据集上比现有SOTA高了多少",但ICML的审稿人会追问"你的融合机制解决了什么根本性的表征对齐问题,换到另一个医学场景还能不能站得住"。
这导致投稿策略完全不同。你不能只交一份"调参调出来的最优结果",你需要构建一个问题定义清晰、方法模块化、且带有某种通用性论证的研究链路。专辑里提到的"基础模型"和"可信推理"其实是两条并行的主线:前者偏预训练范式、规模化和迁移能力,后者偏不确定性、解释性与决策安全。两者在医学影像中汇聚的核心原因也很简单——临床不会接受一个"说不出为什么、也不知道什么时候会错"的模型。
1.2 审稿人会拿什么尺子量你的工作
我参加过几次相关会议的审稿,也跟一些资深AC聊过医学影像专辑的评审倾向。总结下来,有四个维度是几乎每次都会被拿出来衡量的:
- 方法新颖度:你是不是只在普通U-Net后面接了Transformer,还是真的针对医学数据特点提出了新的建模方式?
- 医学有效性:你的实验设计是否符合临床逻辑,比如数据划分有没有考虑患者级别的泄漏?
- 科学严谨性:有没有做充分的消融,不确定性分析是不是只是画了个花花绿绿的图却没有任何定量指标?
- 可复现性:代码、数据、训练细节是否透明,审稿人能不能照着做出来?
坦率讲,第四点是被最多投稿忽略的。很多组实验做得漂亮,但代码一团糟、随机种子不固定、预处理细节不写清楚,这种稿子即便方法创新度高也很容易被压分。ICML系列的审稿人里方法论洁癖的人不少,复现性在他们的评价体系里权重非常高。
2. 医学多模态的核心难点:为什么不是"把几个模态拼在一起"那么简单
多模态这词被用滥了,好像只要输入里同时有图像和文本就算多模态。但医学多模态完全不是这个量级的事。你在自然图像里搞图文检索,图像和文本的语义鸿沟再大,至少它们描述的是同一件具象的事物——一只猫的图片配上"一只猫"的文字。但医学场景下的多模态数据是异构到几乎不共享表面特征,却在深层语义上高度耦合的:MRI的体素强度、病理切片的组织纹理、基因表达谱的数值分布、结构化电子病历里的离散编码,这些数据在形态、尺度、噪声分布上差距极大,唯一的共同点是它们都在以不同角度描述同一个病人的同一套生理病理过程。
2.1 医学影像内部的"多模态"其实也有很多层
先别急着看影像跟文本怎么融合,光影像内部就够你喝一壶的。CT是密度成像,MRI的T1/T2加权序列反映的是不同的组织弛豫特性,PET则是代谢活性的显影,这三者空间分辨率不同、噪声特性迥异,甚至图像中器官的形变都不完全一致。
我做过一个肝癌的课题,要把CT和MR两个模态融合起来做肿瘤区域分割。刚开始很天真,把两个模态的图直接resize到同样分辨率、concatenate起来送进网络就完事了。结果发现模型学到的所谓"融合",基本就是抱住了contrast更好的那个模态的大腿,另一个模态的贡献微乎其微。后来才意识到,问题出在没有做空间配准——CT和MRI扫描时病人的体位、呼吸相位都不一样,同一个解剖位置的体素根本不对齐,你让网络"融合",网络只能胡来。这个教训让我此后做任何多模态融合,第一步永远是空间对齐,而不是模型结构。
- 同一患者的不同模态影像,器官形态与位置存在非刚性形变,需要配准预处理
- 不同模态的体素语义对应关系需要显式建模,否则融合只是空话
- 时间维度的对齐同样关键,比如多次随访影像之间病灶的演化对应
2.2 融合范式怎么选:早融合、晚融合还是中间融合
这是每个做多模态的人都绕不开的三岔路口,我三种都试过,各自的坑也基本都有数。早融合(输入级拼接)最简单,但模态之间往往分辨率不一致、噪声水平不匹配,强行在输入端融合会让网络很难学到高阶的跨模态交互,而且某个模态的强噪声会直接污染整个输入空间。晚融合(决策级投票或平均)则过于保守,它假定了各模态的决策是独立的,但临床上不同模态的发现往往是互补且相互印证的,强行独立再融合会丢掉大量共现信息。
真正值得投入的是中间融合,也就是在高维特征层进行交互。这个方向的通用做法是用注意力机制做跨模态的特征对齐和加权,这也是目前各类多模态大模型处理医学数据的主流手段。不过你需要注意中间融合的一个隐性前提——各模态的编码器得先把特征提炼到"语义可对应"的层次,要是其中一个编码器太弱,融合模块再花哨也是白搭。所以我在实际项目里通常先把各模态单独训练到一定的baseline水平,再接融合网络,这样既能稳住下限,也能分开定位性能瓶颈。
还有一个常被忽视的问题:模态缺失。临床数据脏得很,你今天费尽心思设计的五模态融合框架,明天可能就遇到某个病人少了一个模态扫描的情况。我们组在2024年做过一个实际的肿瘤预测项目,计划是用影像加病理报告双模态,结果真实数据里约三成案例的病理报告因为各种原因缺失。现在比较成熟的对策是设计模态dropout训练策略,在训练时随机把某些模态置为mask,让模型学会在缺失条件下依然保持可用,同时学习"这个模态在的时候如何利用它"。这个思路做出来投ICML的价值在于,它触及了模态鲁棒性的方法论问题,而非单纯解决一个临床数据集。
3. 基础模型在医学影像的落地路径:抄作业之前先看清差距
"基础模型+医学影像"是这几年最热的话题之一,但热不代表好做。很多人看到自然语言处理那边的大模型风生水起,就觉得把CLIP、SAM这类模型拿来在医学数据上微调一下就能躺赢,实际落地后的落差感往往非常大。这背后的核心原因不是基础模型不够强,而是医学影像数据的分布与自然图像差异太大,直接迁移会出现严重的域偏移。
3.1 SAM、CLIP这些通用基础模型在医学上到底好不好使
先说结论:能借力,但不能指望直接用。以分割模型SAM为例,它在自然图像上切割"物体"的能力确实惊艳,但医学影像里"物体"的定义跟通用语义完全不同——同样是肺结节、肿瘤区域、血管结构,它们在不同序列、不同病人身上呈现出的边界模糊性和灰度特征差异极大。我有一次把SAM直接用在超声图像上的甲状腺结节分割,结果它把很多灰度相近的正常组织也一并"切"了出来,边界完全失控。
CLIP这类图文对比模型同理。它学到的图文对齐是建立在海量自然图片和网页文本上的,医学影像的视觉语言跟自然语言之间的桥,远没有想象中那么好走。不过这不意味着基础模型在医学上毫无用武之地。实践下来比较靠谱的路线是用通用基础模型做初始化或特征提取器,再用医学数据做领域自适应微调。比如用预训练ViT的早期层作为通用的低级特征提取器,在此基础上训练医学特定的高层模块,这样既利用了大模型学到的通用视觉先验,又避免让自然图像的先验主导医学任务的决策。
| 基础模型 | 在医学影像中的实际表现 | 推荐用法 |
|---|---|---|
| SAM | 直接分割效果差,边界容易溢出 | 作为交互式分割的初始化,配合医学微调或 prompt 精调 |
| CLIP | 图文匹配语义对齐弱,但视觉特征迁移性尚可 | 用它的视觉编码器做特征初始化,训练医学专用分类头 |
| 掩码自编码器(MAE)类 | 在不依赖标签的重建任务上,能有效捕捉医学纹理和结构 | 在医学数据上进行掩码重建预训练,再下游微调 |
我个人的体会是,在医学数据上做自监督预训练,性价比往往高于直接硬迁移通用模型。医学影像虽然单模态数据量大,但标注成本极高,而自监督预训练刚好能把海量未标注数据的价值榨出来。You Only Look Once那种单阶段检测思想在这里其实也有启发——不要搞太复杂的pipeline,先用一个大而全的自监督模型把底层表征学好,再用轻量的下游任务头解决具体问题,整体流程清晰高效,出了问题也好定位。
3.2 自建医学影像基础模型的资源投入与策略选择
聊到自建基础模型,很多课题组第一反应是"我们没这个算力"。这个顾虑我完全理解,但需要区分一下你想要的"基础模型"是哪种量级的东西。如果你指的是像GPT那样千亿参数、海量数据训练出来的通用模型,那确实不是普通实验室该碰的。但医学影像基础模型通常不需要做到那个规模,它服务的是垂直领域,域内数据量有限,模型的规模需求也远小于通用大模型。
我们组实际走过的路线是:先在几万例无标注的影像数据上做掩码自编码预训练,预训练模型规模大概在1亿参数上下,用几块A100就能跑完;然后在下游任务上做有监督微调。跟直接在目标任务上从零训练相比,这种方式在小样本目标任务上的提升非常明显,尤其在数据只有几百例的情况下,预训练+微调的Pipeline要比从零训练稳定得多。这里的关键在于预训练任务要选对,医学影像的掩码重建策略不能跟自然图像一样随机掩码,要结合解剖结构的特点,比如沿解剖轴方向做掩码、或者重点掩码病灶区域,这样才能让模型学到真正有用的结构先验。
另外还有一个策略层面的问题值得想清楚:是训练一个"什么都能干"的医学基础模型,还是针对某个具体模态和任务训练若干专用模型?我的建议是,除非你们组有非常大的数据储备和工程团队,否则优先做模态专属的中等规模基础模型,比如一个专门针对病理图像的预训练模型、一个专门针对胸部X光的预训练模型。这种模型的构建成本和验证成本都更低,而且在学术投稿时反而更容易讲清楚"为什么这样设计"。
4. 可信推理:医学AI从"准确率高"到"值得信赖"的必经之路
ICML专辑把"可信推理"放在标题里,我猜测未来几年医学影像AI的评估标准会发生一个显著变化:从"模型说了什么"转向"模型为什么这么说、什么时候可能说错"。这一点在临床场景中非常关键——外科医生可以接受AI的建议偶尔不够准确,但绝不能接受一个黑箱子在关键时刻给出一个自信满满的错误判断,而医生对此毫无察觉。我参与过一个AI辅助诊断系统的科室试用,落地时反馈最强烈的恰恰不是灵敏度不够,而是模型给出高风险判断时缺少解释、缺少风险提示。
4.1 不确定性估计:让模型知道"自己不知道"
可信推理的第一步,是让模型具备表达自身不确定性的能力。深度神经网络天然是过度自信的,softmax输出的概率分布并不代表模型真实的置信度,这点很多刚入行的人会踩坑。你会看到一些论文里说"模型对阳性病例给出了0.98的高概率",但如果你画出校准曲线,会发现这个0.98对应的真实阳性频率可能只有0.8,这就是miscalibration。
处理这个问题的成熟手段大致有三类:
- Deep Ensemble:训练多个不同初始化的模型,用它们输出的分歧程度估计不确定性。这个方法简单粗暴且有效,是目前实践中最可靠的不确定性来源之一,缺点是训练和推理成本成倍增加。
- MC Dropout:在推理时保留dropout,多次前向计算得到一组预测分布。实现成本极低,任何已有模型都能改,但估计质量比不上真正的贝叶斯方法或集成方法。
- Post-hoc校准:用温度缩放(Temperature Scaling)、直方图分箱等方法把模型的输出概率校正到与真实频率一致。这个步骤成本最低,但它只改善校准度,不能告诉你模型在某个样本上是否"没见过"。
在医学影像任务里,我更推荐Deep Ensemble做骨架,配合一个轻量的校准模块。我们组之前做肺结节分类的时候,单模型AUC是0.91,但有一些假阴性案例是模型特别"自信"地给出了低风险判断。换成Deep Ensemble之后,我们发现这些错误案例恰好对应模型集成之间的高分歧,也就是说,高不确定性可以帮助我们召回相当一部分错误。如果再把高不确定性的样本交给医生复核,整个系统的安全边界会厚很多。
4.2 可解释性与知识引导:不只是画热力图
谈到可解释性,很多人第一反应是Grad-CAM式的热力图。说实话,这类方法在医学场景中的作用被过度高估了。热力图只能告诉你"模型看的是哪个区域",但没法告诉你"模型为什么认为这个区域重要"。在病理诊断里,这远远不够——医生需要的是"这个区域存在异型细胞,且排列方式符合高级别病变的特征"这种有语义的解释。
这几年我比较看好的方向是概念瓶颈模型(Concept Bottleneck Model)。它通过在网络的倒数第二层强制引入一组人类可理解的概念变量(比如"是否存在钙化""边界是否光滑""密度是否均匀"),让模型先预测概念、再由概念映射到最终诊断。这样整个推理路径变得可追溯:医生可以看到模型识别出了哪些概念、每个概念如何影响了最终判断、哪个概念最关键。我们在一个皮肤镜图像分类项目里试过这个思路,效果比预想的好——不仅可解释性强了,准确率也没有明显下降,反而在概念标注的约束下变得更稳定。
另外一个不可忽视的方向是知识引导的推理。医学知识的特殊性在于它有很强的结构化先验:解剖结构关系、疾病演化逻辑、检查指标之间的互相影响。把这些知识注入模型的常见方式是构建知识图谱或规则约束,让模型在推理时"知道"某种疾病不太可能出现在某个解剖位置,或者某两个症状之间通常存在伴随关系。这本质上是在给模型做推理时的正则化,可以减少违反医学常理的输出。我在做脑肿瘤分级时,就把"水肿范围与肿瘤级别正相关"这类临床经验作为软约束加入了训练损失,实验显示在少见亚型上的分类鲁棒性有提升。
4.3 从预测到决策:可信推理需要的评估体系
一旦你做不确定性估计和可解释性,立刻就会遇到一个现实问题:现有指标不够用了。传统指标如AUC、F1只能衡量预测准确性,没法衡量可靠性。可信推理的评测应该至少包含三个层面:
- 校准度:预测概率与真实频率的一致性,常用Expected Calibration Error(ECE)和可靠性曲线评估。
- 不确定性质量:用风险-召回曲线(Risk-Coverage Curve)看的是"如果只对低不确定性样本做预测,准确率能提升多少",好的不确定性估计应该能精确识别出那些高风险样本。
- 解释的忠实性:你可以通过"去掉归因区域再预测"看结果是否如预期改变,或评估概念瓶颈中概念预测的准确性,来判断解释是否真实反映了模型决策。
我自己通常会把这三类指标放进论文的实验表格里,而不是只给一个AUC。这样不仅向审稿人传递了"我重视可信推理"的信号,也能在论文讨论部分把故事讲得更完整。
5. 做医学多模态研究最容易翻车的四个坑:数据、指标、域偏移、复现
医学多模态听上去高大上,但真正动手做的时候,绊倒人的往往是那些特别不起眼的基础问题。这些东西论文里不会写,学术talk也不会讲,但你就是会撞上。我按自己踩过的坑,梳理四个最常见也最致命的翻车点。
5.1 数据划分不考虑患者级别泄漏,结果全线虚高
这是医学影像AI里被讨论最多、也依然反复出现的问题。CT或MRI这种三维扫描,一张图里可以切出几百个slice;如果按照slice级别来划分训练集和测试集,同一个病人的大量slice可能同时出现在两边,模型在测试集上"见过"这个病人的大部分解剖特征,性能当然虚高。这种泄漏在单模态任务里已经是严重失误了,在多模态任务里还会变本加厉——因为不同模态的数据来自同一批病人,如果你在影像上做了患者级别划分,但在文本或基因数据上忘了做同样的事,跨模态的信息泄漏会更隐蔽。
在实验设计的第一天就要把患者ID设为划分数据的唯一依据,每个病人的所有模态、所有slice只能出现在同一个划分集合内。这个原则听起来简单,但实际数据集一旦经过多级预处理、筛选和特征提取,患者ID的信息很容易丢失,等你发现的时候往往实验已经做了一半。
5.2 多模态融合的性能增益,可能来自模态本身的冗余
做医学多模态最怕遇到的情况是:你的融合模型确实比单模态好了,但好不是因为融合机制设计得巧妙,而是因为多个模态提供了大量冗余信息,随便拼一起就能把特征维度撑大、模型容量蹭上去,自然就赢了。审稿人最容易挑的刺就在这——你无法证明增益来自跨模态交互,而不是参数量增加。
避开这个问题的最有效手段是做充分的消融实验,而且是"有对照的消融"。你需要对比:
- 单模态A的最佳性能
- 单模态B的最佳性能
- A+B简单拼接(输入级或输出级)的性能
- 你的融合方法的性能
如果简单拼接就已经接近你的融合方法了,那说明你的机制没有讲到点子上。我之前做影像+文本融合时也遇到过这个问题,后来把融合模块换成基于共注意力机制的跨模态交互,并跟"独立编码后拼接"做了严格对比,才把新增模块的必要性讲清楚。
5.3 跨中心、跨设备的域偏移,决定模型能不能真的落地
医学影像数据天生就存在域偏移:不同医院的扫描设备型号不同、参数设置不同、病人的群体分布不同,同一个模态的图像统计特性差异可能大到让模型性能暴跌。你在一家医院的数据上训练的模型,拿到另一家医院几乎必掉点。很多论文的实验设计完全无视这一点,只在单一来源的数据集上做训练和测试,结果在小数据集上看着很完美的性能,到了真实临床环境完全不是一回事。
如果你的目标是ICML这种级别的投稿,我强烈建议在实验中加入某种形式的域泛化验证:要么在多个来源的数据上做cross-validation,要么至少做跨机构数据集的迁移测试。你不需要专门去解决域偏移问题,但把这个问题摆上桌面并展示你的方法在一定程度上缓解了它,会显著增加工作的说服力。这同时也是"可信推理"的一个自然延伸——一个不可信赖的系统,往往就是因为换个环境就不行了。
5.4 复现性差:训练细节和代码隐忧
我审稿的时候遇到过一篇方法还挺有意思的论文,但它的方法部分把关键超参数藏起来了,预处理部分写了"参照前人工作",数据和代码的链接全是空的。说句不好听的,这种稿子在审稿人眼里基本等于"我做了但你们别想复现"。
医学多模态的复现难度本来就比单模态高,因为涉及多路数据加载、模态预处理对齐、融合模块的维度匹配,以及病人类别平衡的约束。你提交代码前可以做一个"跟屁虫测试"——找一个没参与项目的新生,只给TA代码和README,看TA能不能在半天内跑通并复现出论文中的核心结果。如果不行,说明你的可复现性还不够。另外,随机种子要固定、数据增强的细节要写完整,这些看起来琐碎的东西,在评审阶段其实都是加分项。
6. 投稿相关的实操细节:时间规划、实验清单与写作避雷
最后一部分聊点实际操作的。方向选好了、实验做出来了,投稿能不能中,很大程度上取决于你的执行细节和写作策略。我周围有不少实验做得很好但投稿屡屡碰壁的师弟师妹,多数问题不在方法,而在不会把工作包装成顶会审稿人想看的样子。
6.1 实验清单:投ICML前必须覆盖的三类实验
如果要给一张"投ICML医学影像专辑前必须做齐的实验清单",我会列这几项:
- 对比实验:至少覆盖两到三个近两年的强baseline,不要只跟自己的一两个变体比。
- 消融实验:逐模块验证设计必要性,特别是多模态交互组件、不确定性模块、知识约束这三类"故事核心"组件。
- 可信性分析:包括不确定性校准曲线、ECE指标,以及高不确定性样本上的准确率分析。如果工作涉及解释性,还需要加解释忠实性的实验(如删除/扰动归因区域的性能变化)。
如果空间允许,还可以做一个跨数据集泛化实验,作为加分项。你不需要把每个实验都做得规模很大,但一定要保证每个实验的结论跟你论文的故事线一致,不能出现某个消融结果明显打脸你的核心主张。
6.2 写作上的几个禁忌和加分项
我在第一次写多模态相关论文时,犯过一个典型的错误:把Introduction写得像文献综述,前两大段都在铺陈多模态有多重要、医学影像有多复杂,真正的方法贡献藏在第三段里。顶会审稿人的耐心是有限的,前150个字里你最好就让他们明确知道你解决了什么问题、和已有工作有什么本质不同。
具体来说这几点值得注意:
- 不要用一个模糊的"我们提出了一种多模态融合方法"开头,可以改成"我们提出了一种基于共注意力的跨模态不确定性感知融合框架,解决了低剂量CT与病理报告在信息密度不对等条件下的可信融合问题"。
- 方法图要画得干净,审稿人第一眼应该能看懂你的pipeline分几步、每步输入输出是什么。
- Related Work不要只是罗列,最好明确指出前人缺什么,你的工作补上了什么。
- Abstract里至少出现一次你的方法名加核心贡献。
此外,如果你有条件,找一个不懂你具体方法但懂ML的同事帮你读一遍Introduction,看他能不能在三分钟内复述出你的核心贡献。不能的话,说明你的表达还不够"顶会化"。
6.3 关于合作:医学背景不是点缀,是实验设计的一部分
最后想强调一个很多计算机背景团队容易忽视的点:在医学影像专辑投稿中,医学知识不是论文里的背景介绍,它应该渗透到问题定义、方法设计和实验分析里。理想情况下,你的团队里应该有一个真正的临床医生或医学影像科研究者,而不是只在论文末尾挂个名。
我跟医生合作过程中的体会是,他们的介入能帮你避开很多"技术上很优雅但在临床上无意义"的设计。比如某个分割任务,计算机背景的人会盯着Dice不放,但医生真正关心的是边界处的安全距离是否足够、是否需要针对低密度区域做保守预测。这种临床视角一旦转化为方法设计,你的论文会比单纯堆性能的稿子高出一个层次。
7. 几个值得长期关注的方向:给准备押注未来的团队一点参考
最后再聊几个我个人觉得接下来两三年会持续升温的方向,这些方向不仅在ICML 2026专辑里有戏,在更长远的研究规划里也值得押注。
一个是多模态医学数据的时序建模。现在绝大部分工作都假设检查是一次性的,但临床上疾病是演化的,随访影像、连续检验指标、治疗前后的多模态对比,这些数据蕴含的信息量远比单一时间点的静态数据大。时序对齐、状态演化建模、治疗响应预测,这个方向的方法论空白还非常大。
另一个是多模态基础模型的高效适配。通用大模型不断涌现,但直接微调几十亿参数在医学场景里不是每个机构都做得起。参数高效微调(PEFT)、适配器、轻量化蒸馏这些方向在医学多模态上的应用还处于早期,谁先做出扎实的方法论和验证,谁就能占据一个很好的生态位。
还有一个是人机协同的可信交互。可信推理的终点不是模型独立给出完美诊断,而是模型与医生之间形成高效的协作——模型负责筛选、预警、提供解释,医生负责最终决策。这里面涉及到交互界面设计、不确定性如何呈现给医生、模型如何根据医生的反馈持续学习,问题非常多,但也正因为难,才有真正的学术价值。
我自己在这个方向上还会继续投入,特别是时序多模态建模和不确定性引导的人机协同这两块。如果你也在做相关的工作,欢迎多交流,毕竟医学影像AI走到今天这个阶段,单打独斗的窗口期已经过去了,开放合作、互相补位才是把这条路走宽的正确姿势。