颠倒的海德格尔头像
关注

Foldseek-Interface:大规模蛋白界面聚类

参考:https://github.com/steineggerlab/foldseek-interface-analysis
算法本身在 Foldseek 主程序
foldseek参考:https://github.com/steineggerlab/foldseek

核心方法概述

Foldseek-Interface 把蛋白三维相互作用界面转成可检索的3Di序列,实现蛋白界面快速比对与聚类:精度对标 iAlign,但速度最高快230倍。作者对PDB全部生物组装体做聚类:312万二聚体 → 189k非冗余二聚体代表 → 77167个蛋白界面簇,是首个仅依据界面三维结构聚类的实验蛋白界面数据集。整套计算耗时约6天。
配套开放资源:网页检索服务器、界面簇浏览器、Zenodo数据集、预印本。

跑基准测试、处理 PDB 组装体、调用 Foldseek 接口模块做二聚体 + 界面聚类、后注释

仓库目录分工

  1. scripts/:SLURM调度脚本,跑Foldseek、iAlign、MMseqs2,负责建库、聚类、NMR处理、物种溯源等批量任务。
  2. benchmarking/:构建基准数据集、评估精度,生成图1与配套附表。
    • 自建两类基准:有序-有序结构域互作DDI、无序-有序短基序互作DMI;
    • 批量全比对:Foldseek-Interface 和 iAlign 做对照;扫描LDDT/TM-score阈值;用AUC、调整兰德指数ARI评估聚类效果。
  3. annotations/:批量从外部数据库抓取注释,合并到界面簇表格:无序区域、二级结构、Pfam、CATH、GO、UniProt映射、物种、PDB提交时间等。
  4. analysis/:下游科学分析,生成图2–4及补充图表:
    • 界面二级结构统计、方差分析;
    • 结构/功能多样性:部分簇包含多套CATH结构域配对;
    • 病原体模拟互作:筛选同时含人-人、人-病原体界面的候选簇;
    • HumanPPI(AlphaFold/RoseTTAFold2预测复合物)聚类,找到1780个没有PDB已知匹配、推测全新的蛋白界面
    • ColabFold/AlphaFold-Multimer预测评估,DockQ打分;
    • ChimeraX可视化脚本。

核心Pipeline(4大阶段)

  1. Benchmark基准测试:构建DDI、DMI两套真值数据集,调参、对比iAlign,确定最优阈值(界面multimercluster用--multimer-tm-threshold 0.4)。
  2. PDB大规模聚类(两步聚类)
    • 第一步:二聚体水平聚类,严格阈值,得到189,830非冗余二聚体代表;
    • 第二步:提取界面、在界面层面聚类,得到77167界面簇;
    • 额外处理NMR多构象模型,检验聚类稳定性。
  3. 注释整合:把结构、无序、二级结构、Pfam、CATH、GO、物种等信息全部合并到界面簇表。
  4. 下游分析:统计、多样性分析、病原体模拟、HumanPPI新界面挖掘、AlphaFold预测验证、可视化。

软件依赖清单

  • Foldseek(带界面模块:createdimerdb / createinterfacedb / multimercluster)
  • MMseqs2,iAlign(基准对照),ColabFold
  • Python:pandas、scipy、sklearn、statsmodels、biopython、gemmi等
  • R:clusterProfiler、ggplot2(GO富集)

Foldseek-inference 思路

在这里插入图片描述

二阶段聚类:先二聚体聚类,再界面聚类

在这里插入图片描述
在这里插入图片描述

3Di 序列转换的算法原理

在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

转载自 CSDN-专业IT技术社区

原文链接:https://blog.csdn.net/weixin_62528784/article/details/165089273

文章来源转载

评论

赞0

评论列表

微信小程序
QQ小程序

关于作者

点赞数:0
关注数:0
粉丝:0
文章:0
关注标签:0
加入于:--