最近看到一家AI生物技术公司融资的消息,融资金额不小,对外表达也很直接:AlphaFold不是生物世界天花板。这句话很容易被理解成“我要超越AlphaFold做结构预测”,但如果你真正跑过AlphaFold、也接触过生物信息学的实际场景,就知道这个说法的重点不在“超越”两个字,而在于对问题边界的重新界定。AlphaFold确实解决了蛋白质结构预测里一个非常重要的子问题,但生物世界远不止“序列到结构”这一件事。结构之外的相互作用、动态变化、功能机制、细胞成像、基因组解读、分子设计,每一个方向都还有大量问题等着AI参与。
这篇文章我不会去替那家公司背书,也不做融资分析。我想结合自己的使用和踩坑经历,把这几件事拆清楚:AlphaFold到底解决了什么、天花板在哪里、AI在生物世界还有哪些值得动手的方向,以及如果你想亲自跑一个生物AI项目,环境、步骤、指标和排查路径应该怎么设计。内容会偏实操,也会给出一套评估判断法,避免被单向度的技术叙事带走。
1. 融资消息看什么:先分清商业热度、技术能力和工程价值
1.1 融资金额高,不等于技术边界已经突破
先说一个容易混淆的点。一笔大额融资,说明资本对某个赛道有信心,也可能说明团队有不错的实验数据和产品验证。但它不能直接证明“这家公司已经解决了别人解决不了的问题”。商业叙事和技术事实之间,往往隔着一层。
AlphaFold当年能成为里程碑,不是因为营销说得好,而是因为它在公共数据集上完成了可复现的结构预测成绩,并且免费公开了模型和预测结构库。这样的成果有三个基础:大量标注数据、相对清晰的评估基准、以及能跑大规模计算的技术团队。任何一个做AI生物学项目的人,都应该先理解这个前提。
所以看到“又融了多少钱”的新闻时,我通常会问三个问题。第一,它输出的是什么类型的结果,是结构、序列、功能注释,还是实验流程优化?第二,这些结果有没有公开可比的基准或湿实验验证?第三,产品定义里,用户拿到预测结果后能不能在真实研究中形成闭环?如果三个问题都能回答,融资数字才有参考价值。如果只能回答“我们用了更强大的大模型”,那技术判断必须谨慎。
1.2 用“具体问题”倒推技术价值,而不是用技术名词倒推
很多AI生物项目喜欢说“我们用大模型解析生命规律”。这句话放在宣传上没毛病,但放在工程上等于没说。因为“解析生命规律”不是可执行的任务定义。真正可执行的问题是:给定一条蛋白质序列,预测它的三维结构;给定一组基因突变,预测是否致病;给定一个药物小分子,预测它与靶点蛋白的结合强度。
判断项目值不值得跟进,核心是看它是否把问题缩小到“可以验证”的范围。以AlphaFold为例,它的问题定义非常清楚:输入氨基酸序列,输出每个残基的三维坐标,并给出每个残基的置信度分数。因为问题边界清楚,它才能做大规模基准测试、和实验结构比对、被无数团队复现。
反过来,如果一家公司只强调“全能”“颠覆”“生命世界的终极模型”,却没有说明输入格式、输出对象和验证标准,那这个项目大概率还停留在探索阶段。探索不是坏事,但和“已经落地”是两码事。我在评估新工具时,会直接去查它的数据集划分、评估指标和示例输出。没有这些东西,再漂亮的概念图也说明不了问题。
2. AlphaFold解决了什么,它的能力边界在哪
2.1 AlphaFold真正做好的事:序列到静态结构的预测
AlphaFold解决的是“从氨基酸序列预测蛋白质三维结构”这个子问题。它利用多序列比对里的进化信息和注意力机制,对蛋白质的残基距离和几何关系做预测,再通过结构模块生成三维坐标。对于很多没有实验结构的蛋白质,它能给出质量相当高的理论模型,这在过去是难以想象的。
实际使用中有几个经常被忽略的重点。
AlphaFold的输出包含一个pLDDT分数,表示每个残基的预测可靠度。拿到模型后不能只看整体形状,要看低pLDDT区域在哪里。这些区域通常对应无序区或柔性区,不一定真的是错误,但它意味着这个区域的结构可信度不高。
另一个重点是,AlphaFold对单链蛋白效果好,但复合物、多结构域蛋白、膜蛋白、共翻译折叠这些情况,效果会根据实例浮动。它不是所有蛋白质类型都有同样的准确度。我在跑复合物时,会单独检查链间界面区域的pLDDT和PAE分数,而不是笼统看整条链好不好。
2.2 为什么说AlphaFold不是生物世界天花板
“结构预测”只是理解蛋白质的第一步,而且是一个以“静态三维坐标”为核心输出的步骤。真实的生物过程非常复杂,知道一个蛋白质长什么样,不等于知道它怎么执行功能。下面这些都是结构预测无法直接回答的问题。
蛋白质是动态的。很多蛋白质在行使功能时会经历构象变化,比如酶的domain开合、离子通道的门控、信号蛋白的激活。AlphaFold擅长给出一个相对稳定的结构模型,但不好给出一条可能的形变路径和不同构象的分布。
结构不等于功能。一个蛋白能结合什么配体、催化什么反应、在什么pH和温度下稳定、如何被修饰和降解,这些都不能从三维坐标直接读出。要预测这些,需要额外的物理化学模型、实验数据和功能数据库。
多尺度的生物问题也不是结构预测能够覆盖的。基因组里大量的非编码区域如何调控基因表达?细胞图像里的异常形态如何识别?一个基因敲除后,整个代谢网络会发生什么变化?这些问题涉及的数据类型和建模方法,和蛋白质结构预测完全不同。
所以“AlphaFold不是天花板”这句判断,准确理解应该是:蛋白质结构预测只是一个里程碑,AI在生物世界还有很多层级可以进入。序列、结构、功能、相互作用、细胞图像、临床试验数据,每一层都有独立问题,也都有机会。
3. 如果把视线从结构移开,AI在生物世界还有哪些方向
3.1 序列层:基因组解读和变异注释
蛋白质结构预测的输入是序列,但序列本身包含的信息远不止折叠方式。基因组里有编码区、非编码区、剪接位点、调控元件。AI可以学习大量基因组序列,用语言模型的方式捕捉序列模式,再应用到变异致病性预测、功能元件识别、物种亲缘关系推断等任务。
这类任务的优势是数据相对容易获取,公开数据库里有大量基因组和注释信息。缺点是标签质量参差不齐,有些变异是否致病需要长期实验验证。我在处理这类任务时,不会只看模型AUC,而是会把预测结果和ClinVar等高置信度数据库做交集验证,再判断模型输出是否可信。
3.2 分子层:蛋白设计、小分子生成和相互作用预测
AlphaFold做的是“读结构”,而蛋白设计是“写结构”。近年来,AI辅助的蛋白质设计工具逐渐成熟,比如用扩散模型生成新蛋白骨架,再用序列设计工具搜索适配序列,这个思路已经能设计出具有特定结合能力的蛋白质。
小分子方向同样活跃。AI可以生成候选小分子、预测药物靶点结合亲和力、评估ADMET属性。它解决的问题是缩短药物发现早期的筛选周期。需要注意,这类预测对训练数据的化学空间覆盖度非常敏感。新化合物一旦落到训练分布之外,预测可靠性会下降。真正进入临床前实验前,仍需要大量湿实验室验证。
还有一类是相互作用预测。蛋白和蛋白、蛋白和DNA、蛋白和RNA之间的结合位点,是理解生物机制的关键。这类任务往往依赖复合物结构数据,数据量比单体结构少,挑战也更大。
3.3 细胞层与多模态数据:图像、空间组学和文献挖掘
生物不只有序列和分子,还有细胞和组织层面的信息。AI在显微镜图像分类、细胞分割、组织切片诊断上已经有不少应用。空间转录组学把基因表达数据和空间位置结合,可以用来研究不同细胞亚群的微环境,这类多模态建模目前还很活跃。
另一个容易被忽视的方向是生物医学文献挖掘。大量研究结论以论文文本形式存在,用大模型做实体抽取、关系抽取、知识图谱构建,可以把分散在文献里的信息结构化成可检索的数据库。如果把多个AI工具串成一条分析链,让一个AI Agent负责序列检索,另一个负责结构预测,还有一个负责文献比对,就能自动化完成一个简单的生物信息分析任务。
这也是为什么我认为“AI Agent”这个概念在生物领域有实际价值:它不只是聊天的界面框架,而是把多个模型、数据库和工具组织成工作流的关键机制。
4. 想实际跑一个生物AI项目,从环境到验证怎么搭
4.1 先决定任务类型,再选工具和数据集
我看到很多初学者一上来就下载一个巨大的结构预测模型,结果配置文件、依赖版本、显存要求全部卡住。更稳妥的做法是先明确任务,再选工具。下面是一张简化版的选型表,适合用来做第一次实验规划。
| 任务类型 | 目标输出 | 常见公开工具/资源 | 验证方式 |
|---|---|---|---|
| 蛋白质结构预测 | 三维坐标 + 置信度 | AlphaFold、ESMFold、RoseTTAFold | 与PDB实验结构比对,看TM-score和RMSD |
| 蛋白质序列设计 | 适配某骨架的氨基酸序列 | ProteinMPNN等设计工具 | 重设计已知蛋白,检查恢复率和折叠成功率 |
| 变异致病性预测 | 突变位点分类概率 | ClinVar标注数据 | 用高置信度样本,看AUC和精度召回 |
| 蛋白-配体相互作用 | 结合模式或结合强度 | PDBbind等数据集,DiffDock等预测工具 | 与共晶结构或实验结合常数比对 |
| 文献信息抽取 | 实体、关系三元组 | 开放论文全文数据 | 人工抽检和已有数据库做交集 |
这张表不意味着工具之间可以随便替换,而是帮助你建立“输入-输出-验证”的闭环。任务类型不明确时,先不要选模型。
4.2 一个最小实验流程:从小样本开始,不追求一次到位
我自己跑生物AI项目时,会把第一次测试拆成五步。
第一步,准备好数据集。优先用公开数据,比如UniProt下载序列,PDB下载结构,ClinVar下载变异注释。下载后先确认文件编码、列名和ID格式,不然后续合并数据会非常痛苦。
第二步,做数据预处理。这一步在整个流程里最耗时。序列去冗余、去除低质量片段、按物种或功能类型划分、确认序列ID在不同数据库间能否正确映射。缺失一个ID映射规则,后面模型输出很可能全是错的。
第三步,选择最小的样例集。不追求一次跑全量,而是先拿10到20条小样本跑通。结构预测就挑几条已有实验结构的序列,变异预测就挑几十条高置信度标注样本。小样本能帮你快速暴露输入格式和依赖问题。
第四步,跑模型并保存原始输出。过程中记录运行时间、显存占用或内存占用、成功和失败数量。不要只看有没有结果,要记录每一步用了哪些参数、哪个依赖版本、随机种子是多少。
第五步,做结果验证。把预测结果和已知实验数据做对齐。如果存在严重冲突,先排查输入序列、ID映射和数据库版本。确认输入没有问题时,再考虑模型参数或方法本身的问题。
4.3 资源不够时怎么办
如果你的机器只有普通CPU或者显存比较低的消费级GPU,不要急着跑大模型。可以先用以下方式控制资源占用。
选择更小的模型或已有预测数据库。有些工具提供预计算结果,不需要本地从头跑。通过公共API使用现成服务时,注意确认单次请求的限制和超时设置。
调整输入长度和批量数。蛋白质序列较长时,显存消耗会快速上升。可以把序列截断,或逐段预测。对批量任务,不要一上来就把并发数拉满。先跑一条,确认输出正常,再开小批量。
如果只是学习验证,可以降低分辨率、减少采样步数或采用更轻量的版本,先理解流程。生产级别的长时间批量任务,需要单独考虑GPU、调度、断点续跑和日志管理。
5. 判断一个生物AI方案是否靠谱:从指标到验证闭环
5.1 算法指标必须和任务边界一起看
生物AI项目里最常见的坑,是只看单一指标就下结论。比如结构预测里,TM-score高只能说明整体骨架接近,不能说明结合位点侧链摆放正确。变异致病性预测里,AUC高可能只是因为训练分布里致病和非致病比例失衡。小分子亲和力预测里,相关系数好也可能在特定化学空间失效。
所以更稳妥的判断方式是三看:一看数据来源和划分方式,测试集是否和训练集重叠;二看指标定义,是否和业务目标一致;三看失败样本,模型在哪些输入上表现差。看失败样本往往比看平均分更有价值,因为你能直观看到模型的边界。
5.2 湿实验闭环:预测只是起点,不是终点
生物AI的最终验证往往绕不开湿实验。AI预测一个蛋白质结构可能很漂亮,但它在细胞里是否真实折叠、是否稳定表达、是否具备功能,仍然需要实验回答。反过来说,湿实验价格高、周期长,所以AI的价值是缩小需要实验验证的空间,而不是完全取代实验。
我在评估一个AI方案时,会特别关注它是否设计了“反馈迭代”机制。也就是AI预测结果进入实验之后,实验结果是否回传并更新模型。如果没有这个闭环,模型只能停留在离线预测阶段,长期价值有限。
一个可以做的小项目是选择一条已知功能蛋白,用AI做突变设计,选出几个候选突变体,然后通过公开的突变实验数据库比较预测效果。这样不需要自己跑湿实验,也能验证AI方案的可靠性。
6. 从工程落地角度看,这类项目最常见的坑和排查路径
6.1 数据和ID映射是最容易翻车的地方
在生物AI项目里,最终结果出错大概率不是模型问题,而是数据预处理问题。我自己遇到过几次这样的场景:从某个数据库下载的序列ID,在另一个数据库里对应的是完全不同的转录本;一个基因的链是反向互补,结果没有做链方向校正;旧版本数据库里已经标记废弃的序列,被当成新序列输入模型。
所以在排查错误时,我的顺序通常是:先检查输入文件和ID映射,再看预处理脚本,然后检查数据库版本,最后才怀疑模型参数。很多人一报错就调batch size、改学习率,其实问题出在数据上。排序错位会导致整批输出全部错乱,这种错误从算法指标看不出来,只能在数据检查阶段发现。
6.2 批量任务不能只看成功率,还要看可维护性
当任务从单条变成批量,问题的性质就变了。单条任务只需要关心它能不能跑通。批量任务还必须考虑四个问题:失败任务能不能重试、输出文件命名是否会冲突、日志是否能定位到具体输入、中断之后能不能续跑。
我一般会先把所有输入文件整理成统一的命名规范,比如“基因ID_物种_转录本ID.fasta”,并把输出目录按任务ID分层存放。日志单独保存一份,包含输入路径、模型版本、参数和运行时间。这样一旦某个样本失败,可以快速定位是哪一步出了问题。
对API型服务,还要明确限流策略、超时时间和返回格式。太多项目在单次调用时表现稳定,放到批量并发后出现大量超时和空返回。建议先从1并发开始,确认服务稳定后再逐步增加,同时给每次调用做好失败重试和结果校验。
6.3 从“能跑”到“可信”还差什么
如果要让一个生物AI项目达到“可信”状态,就必须做到可复现。可复现不只是固定随机种子,而是把整个运行环境固化成记录。我常用的检查清单包括以下内容。
- 数据集版本和下载时间
- 预处理脚本和参数
- 模型版本、配置文件、权重来源
- Python和相关库的版本号
- 运行参数,包括采样、截断、并发和GPU资源
- 生成结果时的日志文件
这些信息组合在一起,别人才能按相同步骤得到相同结果。很多论文项目在GitHub上公开,但缺少环境锁文件或预处理细节,导致别人复现困难。真正可信的项目会在文档里明确写清每一步。
最后说回标题。那家公司说AlphaFold不是生物世界天花板,从技术角度看没有错。但比这句话更有价值的,是它到底准备用这笔钱解决哪个具体问题。是做更好的结构预测,还是做全新的分子设计,还是把AI推进到细胞和组织尺度,这决定它是否会成为下一个重要起点。对想要进入这个领域的人来说,最值得做的事不是追着融资新闻跑,而是选一个能验证的小问题,搭好流程,跑通一次,然后逐步扩展。结构预测只是第一块拼图,AI生物学还有太多值得动手的地方。