AlphaFold蛋白质结构预测实操指南
2026/9/11 12:20:49 网站建设 项目流程

AlphaFold蛋白质结构预测实操指南

【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold

下午三点,PI 把一段刚测序得到的氨基酸序列甩给小王:“明天组会前,我要看到它的三维结构。”小王打开 AlphaFold 跑蛋白质结构预测,把序列贴进一个 FASTA 文件,十几分钟后,屏幕上就转出一帧按置信度着色的三维模型——这就是 AlphaFold 的全部卖点:吃进一条氨基酸序列,吐出一份能直接在 PyMOL 里打开的 PDB 结构文件,外加每个残基的置信度分数。它由 DeepMind 开源,是 AlphaFold 2 推理管线的完整实现,代码以 Apache 2.0 授权。

AlphaFold蛋白质结构预测,本地跑和托管服务怎么选

先说清你手里有什么。托管的网页服务把环境和数据库都藏起来,代价是序列受它限制、管线改不动;而这个仓库给的是全部源码和 Docker 镜像构建逻辑,数据库自己下、模型权重自己拉,换来对每条 MSA、每个残基的完全控制。硬件分两档:走reduced_dbs预设,8 个 CPU 核心、8 GB 内存、600 GB 磁盘就能跑通;上完整数据库则是 556 GB 下载量、解压后 2.62 TB,得配 SSD 和一块 A100。精度上,它在 CASP14 的两个代表靶点 T1037、T1049 拿到 90.7 与 93.3 的 GDT 分,下图把计算预测(蓝)与实验结果(绿)叠在一起,几乎重合。

把一段FASTA变成3D结构:完整流程走一遍

输入端只需要一个 FASTA 文件,单体蛋白最简写法:

>my_protein MAVTG...(你的氨基酸序列)

💡 若是多链复合物,就在同一 FASTA 里按链序写多条>记录,运行时把--model_preset设成multimer;注意单体模型单条序列上限 2500 残基、总长上限 4000,超长的单体要借 multimer 模型来跑。

执行端分两步。先git clone https://gitcode.com/GitHub_Trending/al/alphafold,进仓库后用docker build -f docker/Dockerfile -t alphafold .构建镜像,数据库用 scripts/download_all_data.sh 提前下好、放到仓库外。然后调 docker/run_docker.py:

python3 docker/run_docker.py \ --fasta_paths=my_protein.fasta \ --max_template_date=2022-01-01 \ --model_preset=monomer \ --db_preset=reduced_dbs \ --data_dir=$DOWNLOAD_DIR \ --output_dir=/home/user/out

命令跑起来后,日志依次经过 MSA 检索(查 UniRef90、BFD 等)、5 个随机种子的模型推理,再到 Amber 力场弛豫;timings.json记录各段耗时,A100 上一条 1000 残基的蛋白推理约 96 秒,relax_metrics.json则给出弛豫后剩余的几何违规数,数字越小说明局部构型越干净。

产出端是一个以靶点命名的子目录(默认落在/tmp/alphafold下):

my_protein/ ranked_0.pdb # 置信度最高的结构 ranked_{1..4}.pdb relaxed_model_*.pdb # 弛豫后 unrelaxed_model_*.pdb # 原始输出 result_model_*.pkl # pLDDT、PAE 等原始数组 ranking_debug.json timings.json msas/ # 各数据库命中的 MSA

判断标准很直接:打开ranked_0.pdb,在 PyMOL 或 ChimeraX 里能正常展开、没有明显穿模,再去看下面这个分数。

pLDDT怎么读:结构预测置信度的判断标准

每个残基的 pLDDT 落在 0–100,越高越可信,官方把它切成四档着色:90–100 深蓝、70–90 浅蓝、50–70 黄、0–50 橙(定义见 notebooks/AlphaFold.ipynb 第 383 行的PLDDT_BANDS)。这个数同时存在 PDB 的 B-factor 字段、result_model_*.pklplddt数组和ranking_debug.json里,三处可以互查。经验上,核心区普遍 90+ 说明折叠可信;某段连续低于 50,多半是无序区或同源信息不足,别拿那一段去下结论。若是复合物,再看同文件的predicted_aligned_error(PAE,0 最可信),它告诉你两个结构域之间的相对方位稳不稳——PAE 低代表界面可靠,PAE 高则提示构象异质,需要谨慎解读。

文档与源码入口:接着往哪走

🔗 想深挖模型与推理细节看 docs/technical_note_v2.3.0.md;要复现或改管线,源码集中在 alphafold/model 目录与 docker/run_docker.py;批量提交、配体与修饰等任务格式参考 server/README.md。把序列换成你的靶点,这条从 FASTA 到结构文件的链路就完整了。

【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询