蛋白结构导向的序列设计 (ProteinMPNN & SolubleMPNN)

本工具依托性能领先的图神经网络算法 ProteinMPNN,专为蛋白质骨架定向氨基酸序列设计打造,兼顾天然结构还原精度与高速运算能力,可高效完成蛋白全新序列改造、天然骨架复原等分子设计工作,广泛适用于酶分子改造、抗原蛋白优化、载体蛋白重构、蛋白复合物界面设计等计算生物与蛋白工程场景。

上传 PDB 或 mmCIF 格式的蛋白质结构文件,系统将自动解析链信息。选择需要设计的链并设置参数后,模型将生成多条优化的氨基酸序列,并给出每条序列的评分(score = -log_prob,越低越好)与序列恢复率。

模型基于 ProteinMPNN (Dauparas et al., Science 2022),支持标准模型与仅-CA 模型,以及可溶性蛋白特化版本(SolubleMPNN)。

1. 上传蛋白质结构文件 (PDB / mmCIF):


3. 设计参数设置:

模型:
生成序列数: 每个目标生成 1-10 条
采样温度:
输入单个温度值,值越高生成序列的多样性越高
骨架噪声: 向骨架坐标添加高斯噪声 (A),提高生成多样性
随机种子: 填 0 表示每次随机;填非 0 整数表示固定随机种子
排除氨基酸:
勾选的氨基酸不会出现在生成序列中

4. 高级选项:

CA-Only 模式 适用场景:① 仅有 Cα 坐标的结构(如 cryo-EM 低分辨率、NMR 稀疏约束、de novo 设计骨架);② 侧链或主链原子坐标缺失/不完整时。
此模式仅读取 Cα 原子,忽略 N/C/O 等其他骨架原子。注意:暂不支持与可溶性模型同时使用。
可溶性模型 适用场景:① 设计可溶性蛋白(非跨膜蛋白);② 希望降低膜蛋白特征序列出现的概率;③ 对最终蛋白溶解度和表达有较高要求的场景。
训练时排除了膜蛋白结构,生成的序列更偏向可溶性蛋白的氨基酸分布。模型:SolubleMPNN
最大序列长度: 超过此长度的残基将被截断

5. 约束与偏置 (JSONL,可选):

以下 JSONL 提供比上方 UI 控件更精细的控制。若填写,将覆盖上方对应的链选择 / 排除 AA 设置。位置编号是1-based,与PDB文件的残基编号无关。

链设计指定 — 覆盖上方链选择 (chain_id_jsonl):

按链排除 AA — 覆盖上方排除列表 (omit_AA_jsonl):

固定位置 (fixed_positions_jsonl):

AA 组成偏置 (bias_AA_jsonl):

按残基位置偏置 (bias_by_res_jsonl):

对称/捆绑位置 (tied_positions_jsonl):


6. PSSM 选项 (Position-Specific Scoring Matrix,可选):

PSSM JSONL (pssm_jsonl):

PSSM 权重 (pssm_multi): 0.0=不使用 PSSM,1.0=忽略 MPNN 预测
PSSM 阈值 (pssm_threshold): 限制每个位置的 AA 选择范围
使用对数几率 (pssm_log_odds_flag) PSSM 偏置模式 (pssm_bias_flag)



ProteinMPNN 简介

ProteinMPNN (Dauparas et al., Science 2022) 是一种基于消息传递神经网络的蛋白质序列设计方法。

核心特点:
  - 以蛋白质骨架坐标(N, CA, C, O 等原子)为输入
  - 使用编码器-解码器架构,在 3D 结构图上传递信息
  - 自回归逐残基采样生成氨基酸序列
  - 支持多种噪声水平和模型变体
  - 可指定设计链 / 非设计上下文链 / 固定位置
  - 支持序列偏置(bias)、排除特定氨基酸等约束

可用模型:
  v_48_002 — 训练噪声 0.02A,48 条边(最保守,推荐对高精度结构使用)
  v_48_010 — 训练噪声 0.10A,48 条边
  v_48_020 — 训练噪声 0.20A,48 条边(推荐默认选项)
  v_48_030 — 训练噪声 0.30A,48 条边(对低精度/NMR 结构更友好)

引用: Dauparas, J., et al. "Robust deep learning–based protein sequence design using ProteinMPNN." Science 378.6615 (2022): 49-56.