文献来源

    论文题目: Miniaturizing and modifying natural proteins with Raygun
    作者: Kapil Devkota、Daichi Shonai、Joey Mao、Young Su Ko、Wei Wang、Scott Soderling、Rohit Singh
    单位: Duke University、University of California San Diego
    期刊:Nature
    年份: 2026
    DOI: 10.1038/s41586-026-10842-8
    代码链接: https://github.com/rohitsinghlab/raygun

    摘要

    现有 AI 蛋白设计大多擅长从头生成骨架或在固定长度序列上执行氨基酸替换,却很难像自然进化一样,协调完成大规模替换、插入和删除,同时保留原蛋白的结构与功能。Raygun 的核心做法,是利用 ESM-2 将蛋白序列编码为逐残基表示,再把不同长度的表示压缩成统一的 50×1,280 维固定表示,并将其作为模板特异的概率分布进行单步采样。用户只需指定目标长度和噪声强度,便可分别控制插入删除程度和序列多样性。作者进一步在荧光蛋白、TurboID 和 EGF 上进行实验验证。结果表明,Raygun 确实拓展了模板引导蛋白编辑的能力,但其功能保持仍明显依赖下游筛选,极端小型化和人工强化功能也仍是主要难点。

    为什么这篇论文值得关注?

    蛋白质设计领域近年的主线之一,是从零开始生成满足特定结构或功能条件的新蛋白。RFdiffusion、蛋白语言模型和序列扩散模型已经证明,AI 可以在庞大的序列与结构空间中构造自然界未直接出现的蛋白。

    但真实生物工程中的许多任务并不需要从零设计。

    研究者往往已经拥有一个可以工作的蛋白,只是希望它:

    • • 更短,以适应病毒载体容量或减少融合标签干扰;
    • • 更稳定、更易表达;
    • • 保留原有结构,但改变部分活性;
    • • 删除冗余结构域或缩短连接区;
    • • 在维持功能的同时产生足够大的序列多样性。

    这类问题更接近对现有蛋白进行重构,而不是重新创造一个蛋白。

    困难在于,传统定向进化主要围绕点突变展开。随着同时修改的位置增加,组合空间迅速爆炸。更重要的是,自然蛋白进化不仅包含氨基酸替换,还包含插入和删除。后两者会改变残基编号、二级结构边界、结构域连接方式和整体折叠拓扑,因此远比固定长度上的逐位替换难以建模。

    Raygun 关注的正是这一点:能否从一个天然或已有功能蛋白出发,同时执行替换、插入和删除,并在较大修改幅度下尽量保留原有功能?


    2. 研究背景:蛋白质小型化为什么如此困难?

    2.1 删除几个残基并不等于让蛋白整体变短

    蛋白序列不是可以任意删减的字符串。

    删除某一段残基,可能同时改变:

    • • 疏水核心的封装;
    • • α 螺旋和 β 折叠之间的配对;
    • • 长程残基接触;
    • • 催化残基的空间排列;
    • • 配体或蛋白结合界面;
    • • 局部柔性与构象转换;
    • • 结构域之间的相对方向。

    即使删除位置位于表面环区,也可能通过改变主链长度和构象熵,间接影响远端功能位点。因此,小型化并非简单寻找不重要残基,而是需要重新协调整条序列。

    2.2 固定长度表示限制了插入和删除设计

    蛋白语言模型通常将长度为 L 的蛋白表示为:

    其中,每个残基对应一个 d 维向量。

    这种表示适合预测点突变,因为突变前后长度相同,第 i 个残基仍可与第 i 个位置对应。但如果删除了20个残基,后续所有位置都会错位;如果插入一个片段,表示矩阵的长度也会发生变化。

    因此,不同长度蛋白的逐残基表示无法直接对齐,也很难在统一潜空间中进行连续操作。

    2.3 现有方法各自解决了部分问题

    点突变优化方法能够围绕模板搜索局部序列空间,但无法高效处理大量插入和删除。

    序列补全与 inpainting 方法可以对指定区域重新生成,但通常需要用户提前确定需要修改的位置,而且多数模型仍保持总长度不变。

    从头生成方法可以产生全新蛋白,却未必适合保留某个现有蛋白的整体功能。它们通常从简单先验分布出发,经过多步采样逐渐接近可行蛋白空间。

    结构域手工删除能够实现明显的小型化,例如通过已知结构与功能知识删除冗余结构域,但强烈依赖专家经验,难以扩展到未知蛋白和大规模自动设计。

    Raygun 的目标不是替代这些方法,而是建立一种面向模板的、长度可变的蛋白序列生成机制。


    3. 这篇论文的核心思想

    Raygun 的核心假设可以概括为:

    蛋白语言模型的逐残基表示存在大量上下文冗余。如果将相邻残基表示进行合理聚合,或许可以把任意长度蛋白压缩到同一固定维度,同时保留足够的全局结构与功能信息。

    因此,作者没有直接在可变长度序列上执行插入删除,也没有建立逐步去噪的离散扩散过程,而是设计了以下转换:

    完成这一转换后,不同长度的蛋白都可以进入相同潜空间。用户通过两个参数控制生成:

    • • 目标长度决定整体需要产生多少插入或删除;
    • • 噪声强度控制偏离模板的程度,主要表现为替换数量和序列多样性。

    这也是 Raygun 与扩散蛋白设计模型最本质的区别:扩散模型通常从通用先验分布出发,经过多步去噪得到一个蛋白;Raygun 从模板蛋白对应的局部概率分布出发,通过一次采样和一次解码直接生成候选序列。


    4. Raygun 设计的到底是什么?

    Raygun 主要设计的是蛋白质一级序列,并不直接生成三维骨架、侧链坐标或蛋白复合物结构。

    其设计对象包括:

    • • 氨基酸替换;
    • • 连续或分散的残基删除;
    • • 新残基插入;
    • • 蛋白整体长度变化;
    • • 在上述变化同时发生时,维持模板相关的结构和功能特征。

    模型没有显式输入三维结构,也没有要求用户标注:

    • • 必须保留的功能基序;
    • • 允许删除的环区;
    • • 结构域边界;
    • • 催化残基;
    • • 蛋白结合界面;
    • • 染色团形成位点。

    这些信息主要通过 ESM-2 表示中学习到的进化统计规律隐式传递。

    因此,Raygun 更准确的定位是:

    一个基于蛋白语言模型表示的、长度可变的模板引导序列编辑器。

    它不是结构扩散模型,也不是直接面向某项功能训练的蛋白优化器。

    5. 方法细节:Raygun 到底是怎么做的?

    5.1 输入与输出

    Raygun 接收三个输入:

    1. 1. 模板蛋白序列
    2. 2. 目标长度
    3. 3. 噪声参数

    输出是指定长度的新蛋白序列。

    目标长度可以小于、等于或大于原序列长度,分别对应小型化、固定长度改造和扩增。

    噪声为零时,模型倾向于尽量保持模板序列;噪声逐渐增大时,替换数量和序列多样性增加。论文测试范围约为0.01至6,在噪声接近2时已能产生较明显变化,超过约2.2后,序列相似性和预测结构质量下降速度明显加快。


    5.2 第一步:ESM-2 将序列转换为逐残基表示

    作者采用参数量为6.5亿的 ESM-2。

    对于长度为 L 的序列,ESM-2 产生:

    每一个 (h_i) 不只表示第 (i) 个氨基酸的类型,还包含其上下文、邻近残基、长程依赖以及从大规模进化序列中学习到的统计规律。

    作者还单独训练了一个从 ESM-2 表示返回氨基酸序列的神经网络,验证准确率超过99%。因此,模型可以在 embedding 空间中完成编辑,再将连续表示转换回离散序列。


    5.3 第二步:把任意长度蛋白压缩为50个表示块

    这是整篇工作的关键。

    作者将长度为 L 的逐残基表示划分成 K=50 个连续区块。每个区块包含的残基数随蛋白长度变化。

    例如,一个500残基的蛋白大致会被划分为50个区块,每个区块约10个残基。随后对区块内部的向量进行平均:

    最终得到:

    也就是一个64,000维的固定表示。无论原蛋白有100个残基还是2,500个残基,压缩后的尺寸都相同。

    作者选择50个区块,而不是25个区块,是因为比较实验表明,50块在序列重建方面更好。较多区块可以减轻压缩造成的信息损失,但也会增加模型容量和计算成本。

    作者进一步认为,区块内多个上下文表示的平均值可以近似服从多变量高斯分布。因此,每个模板不再只是潜空间中的单个点,而被处理为一个具有局部变化范围的模板特异概率分布。

    这一步带来两个能力:

    • • 不同长度蛋白可以在同一表示空间中比较;
    • • 可以围绕模板分布直接采样,产生多个相关但不同的候选。

    需要注意的是,论文的扩展数据表明这些表示并非严格高斯:Shapiro–Wilk 检验拒绝严格正态假设,但分布总体呈单峰,统计量中位数约为0.96。换言之,高斯在这里更接近一种有效近似,而不是经过严格证明的真实生成分布。


    5.4 第三步:Encoder 对压缩前后的特征进行精炼

    简单分块平均会丢失信息,特别是:

    • • 区块内部残基顺序;
    • • 局部基序的精确位置;
    • • 跨区块的长程相互作用;
    • • 结构域之间的依赖关系。

    因此,Raygun 并非只进行平均池化,而是在编码器中加入多级级联模块。

    每一级编码级联包含:

    • • Encoder Transformer Layer;
    • • Reduction 层;
    • • 参数共享的再次特征处理。

    Transformer 负责整合全局上下文,Reduction 负责将可变长度表示压缩为固定长度表示。不同级联产生的固定长度结果会被聚合,再通过线性投影得到最终的  潜表示。

    论文将其中主要的特征处理模块称为 T-Block。T-Block 同时包含:

    • • Transformer 模块,用于学习长程依赖;
    • • 一维卷积模块,用于学习邻近残基和局部序列模式。

    这种设计试图兼顾蛋白中的两类关系:局部序列语法与远距离协同作用。T-Block 也占据了 Raygun 约7.01亿可训练参数中的大部分。


    5.5 第四步:从模板特异高斯分布中加入噪声

    编码完成后,Raygun 围绕模板对应的概率分布进行采样。

    论文没有在正文中给出完整的协方差构造公式,但明确指出,噪声参数用于缩放高斯分布的协方差矩阵。

    直观上可以理解为:

    • • 噪声较小时,采样点靠近模板表示,生成序列与模板接近;
    • • 噪声增大时,采样点离模板中心更远,替换和整体重排增多;
    • • 噪声过大时,采样可能离开模板对应的可行蛋白区域,结构与功能保持下降。

    这与扩散模型存在明显区别。

    扩散模型需要建立多个时间步,逐步将噪声样本还原为生物序列或结构。Raygun 没有多步前向加噪和反向去噪链,而是直接从模板局部分布采样一次,再由解码器完成一次性重建。因此,作者将解码器称为单步去噪器。


    5.6 第五步:Repetition 层扩展到目标长度

    编码器输出固定的  表示后,解码器需要将其转换为用户指定长度  的逐残基表示:

    这一过程由 Repetition 层完成。

    Repetition 层是 Reduction 层的对应操作:它接收固定长度潜表示和目标长度,将压缩表示扩展为指定数量的残基级向量。

    随后,Decoder Transformer Layers 对扩展后的表示进行全局和局部修正,使其不只是机械重复,而能形成连贯的蛋白语言模型表示。

    不同解码级联的输出同样经过聚合和线性投影,最终得到目标长度的重构 embedding。再由预训练的 embedding-to-sequence 解码器,将每个位置转换为氨基酸类别。

    插入和删除并不是由模型显式输出一个编辑操作列表,而是由原长度  与目标长度  之间的差异,在重新生成整条序列时自然产生。

    这意味着 Raygun 并不是:

    在原序列上先定位某个残基,再执行删除或插入。

    而是:

    将模板压缩成整体表示,再从整体表示重建一条新长度的序列。

    这种整体重建方式使大范围协同变化成为可能,但也降低了对具体编辑位置的精确控制。


    5.7 训练目标:同时约束表示、序列和长度一致性

    Raygun 采用自监督训练,不要求蛋白功能标签或实验活性标签。

    总体损失可以概念性写为:

    论文正文没有给出各项权重,因此不宜进一步假设具体比例。

    表示重建损失

    要求经过编码、压缩和解码得到的逐残基 embedding 接近原始 ESM-2 embedding。

    这一项保证模型保留 PLM 表示中的上下文信息,而不只是输出形式上相似的序列。

    序列交叉熵损失

    重构 embedding 经预训练序列解码器转换为氨基酸概率分布,再与原序列计算交叉熵。

    这一项直接约束最终序列重建,避免 embedding 数值接近但解码后氨基酸错误。

    尺寸不变性或 replication loss

    模型先将固定表示解码成一条更短的序列表示,再重新编码回固定维度,要求前后两个固定表示一致。

    其目的不是单纯重建原长度,而是训练模型相信:

    同一个蛋白的不同长度版本,在固定维度空间中应保留相近的整体身份。

    没有这一损失,编码器可能只会记忆特定长度,改变目标长度后潜表示就会发生严重漂移。


    5.8 训练数据与微调策略

    论文主体展示的 Raygun 模型仅使用约8万条 UniRef50 蛋白序列训练。作者希望以此说明,固定长度概率表示具有一定的数据效率。

    扩展实验还比较了使用约10万和220万条序列训练的不同规模模型。结果显示:

    • • 小规模模型中,主要重建能力来自解码器;
    • • 数据和模型规模增大后,编码器的贡献逐渐增强;
    • • 更大的编码器能够在简单分块平均之外,进一步注入结构和功能相关信息。

    在特定蛋白家族上使用时,作者建议冻结编码器,只微调解码器。其逻辑是:

    • • 编码器负责探索范围和多样性;
    • • 解码器负责把潜表示可靠地恢复为家族合理序列。

    论文报告,家族微调可以将重建 BLOSUM 分数提高到0.99以上,同时没有明显压缩序列多样性。


    5.9 推理阶段:一次采样并不等于完整设计流程只需一步

    Raygun 本身的序列生成速度约为每条0.3秒,测试硬件为 NVIDIA A100,作者称其大约比多步扩散式从头生成快100倍。

    但0.3秒只对应生成环节,不包含后续:

    • • pLL 评分;
    • • Pfam 或 hmmscan 结构域筛选;
    • • AlphaFold3、OmegaFold 或 Boltz-2 结构预测;
    • • pLDDT 与 TM-score 计算;
    • • 稳定性或功能预测;
    • • 实验合成和测试。

    因此,Raygun 的优势主要是可以低成本产生大量候选,而不是完整蛋白设计管线在0.3秒内完成。

    作者还提出一次 recycling:将首次生成序列重新作为模板输入模型,再生成一次。这个额外循环能够改善质量和多样性,但严格来说已经从单步生成变成了两轮模型调用。


    5.10 生成后的多层筛选

    Raygun 是任务无关的生成模型,本身并不直接预测荧光亮度、酶活或受体结合力。因此,作者使用了多级筛选管线。

    第一层通常是 pseudo log-likelihood,pLL。它利用蛋白语言模型判断序列在进化统计上是否合理。

    由于普通 pLL 会随序列长度系统变化,作者构建了长度校正版本,使不同长度候选可以相对公平地排序。

    随后根据任务加入不同过滤器:

    • • hmmscan 或 Pfam:判断关键结构域是否保留;
    • • pLDDT、LDDT、TM-score:评估预测结构质量与模板相似性;
    • • TemStaPro:预测热稳定性;
    • • 自建亮度预测器:筛选荧光蛋白;
    • • ProTrek:评估功能或受体结合相关性;
    • • CLEAN:预测酶学 EC 分类。

    因此,实际工作流是:

    1. 1. Raygun 大规模生成序列;
    2. 2. 长度校正 pLL 初筛;
    3. 3. 结构域与任务属性过滤;
    4. 4. 结构预测与模板比较;
    5. 5. 选取少量候选进行实验。

    这套流程也说明,Raygun 的定位更接近候选生成器,而非独立完成最终功能优化的端到端模型。


    5.11 方法流程小结

    输入模板序列
           ↓
    ESM-2 生成  逐残基表示
           ↓
    T-Block 整合局部与全局上下文
           ↓
    Reduction 将表示压缩至 
           ↓
    围绕模板特异高斯分布加入可控噪声
           ↓
    Repetition 扩展至目标长度 
           ↓
    Decoder T-Block 修正目标长度表示
           ↓
    Embedding-to-sequence 网络输出氨基酸序列
           ↓
    pLL、结构域、功能预测与结构预测多级过滤
           ↓
    合成并进行实验验证


    6. 实验设计与关键结果

    6.1 不同长度蛋白上的整体结构保持

    作者首先选择了4个长度跨度约17倍的蛋白:

    • • 血红蛋白:147 aa;
    • • CCR1:355 aa;
    • • lacZ:1,024 aa;
    • • mTOR:2,549 aa。

    每个模板在多个目标长度下生成2,000条候选,噪声设为0.5,再按长度校正 pLL 保留前5%。

    作者利用 AlphaFold3、OmegaFold 和 Boltz-2 预测结构,并通过以下指标评价:

    pLDDT衡量模型对局部结构预测的信心,但高 pLDDT 不直接证明实验中一定折叠。

    LDDT比较局部原子距离是否保持,对局部几何变化较敏感。

    TM-score衡量整体折叠拓扑相似性。通常高于0.5意味着较可能具有相同总体折叠,但并不保证催化活性或结合能力不变。

    在目标长度改变不超过约±10%时,候选的中位 TM-score 约为0.78。mTOR 可缩短500多个残基并维持约0.7的 TM-score。不过,随着修改幅度扩大,pLDDT 和结构相似性均出现明显下降。例如,大幅扩增长度后的 CCR1 候选,TM-score 降至约0.45。

    这些结果支持 Raygun 能维持模板级折叠信息,但不能说明所有大幅小型化候选仍具有原功能。


    6.2 插入和删除是否只发生在环区?

    一种最简单的小型化策略,是优先删除预测上较柔性的环区。

    Raygun 确实在较小长度变化下表现出轻微的环区删除偏好,但删除并不只集中在环区。随着缩短幅度增大,这种偏好进一步减弱。

    作者还发现,α 螺旋和 β 折叠之间的删除比例总体保持平衡。对于增大后的蛋白,插入同样分布在螺旋、折叠和环区,而不是只在某一类二级结构中堆积。

    更重要的是,带有已知活性位点和结合位点的蛋白中,功能位点的保留率始终高于整体序列保留率,说明模型在没有显式功能位点标注的情况下,倾向于保留语言模型认为较重要的区域。


    6.3 跨蛋白家族的功能保持

    在覆盖 α、β、α/β 和 α+β 四类 SCOP 结构类别的 Pfam 测试中,作者让候选长度覆盖家族中位长度的50%至200%。

    总体上,50.65%的候选保留了对应 Pfam 结构域。与插入、删除和替换数量相匹配的随机序列基线相比,Raygun 的结构域保留率高约14.75%。

    ProTrek 功能评估显示,在19个可评估模板中,有14个模板的所有±10%长度候选都超过作者采用的功能相似性阈值。

    作者还开展了两项更激进的计算测试:

    • • 将蛋白酪氨酸激酶缩短到原长度的60%或70%,其正确 EC 分类保持率高于匹配随机基线;
    • • 将 spCas9 缩短到原长度的65%至75%,AlphaFold3 预测其蛋白—DNA—RNA界面质量优于匹配随机基线。

    这些结果具有广度,但主体仍是计算预测,不能与真实酶活或核酸编辑实验等同。


    6.4 与 EvoDiff 和 DPLM 的比较

    作者在60个酶蛋白上,将 Raygun 与 EvoDiff 和 DPLM 进行比较,并匹配不同方法生成序列的序列相似性分布。

    Raygun 在 OmegaFold 结构指标和 CLEAN 功能分类方面,与两种离散扩散方法总体相当。

    不过,该比较只针对相同长度生成。原因是 EvoDiff 和 DPLM 在作者采用的设置下无法直接执行长度变化。

    因此,这项实验能支持:

    Raygun 在固定长度序列改造上,质量不弱于相关扩散基线。

    但它不能严格支持:

    Raygun 在插入删除任务上优于扩散模型。

    因为后者并未在相同任务条件下接受比较。这是实验设计中需要明确区分的地方。


    6.5 荧光蛋白:6个候选保留荧光

    作者以 eGFP 和 mCherry 为模板,每个模板生成70,000条长度为195–235 aa的候选。

    筛选流程包括:

    1. 1. pLL 淘汰约90%;
    2. 2. hmmscan 保留正确 Pfam 结构域;
    3. 3. 自建荧光亮度预测器排序;
    4. 4. 最终选择8条序列进行实验。

    作者没有显式固定典型的 XYG 染色团基序,也没有像部分从头 GFP 设计工作那样固定染色团附近的关键残基和局部结构。

    将密码子优化后的序列转染 HEK293 细胞后,8个候选中有6个显示出高于阴性对照的荧光,并维持各自模板对应的光谱类型。但其亮度低于天然模板。

    根据论文 Fig. 3,eGFP 候选的最短长度为213 aa,mCherry 候选最短为199 aa;成功候选中有两条短于 FPbase 中约96%的已收录荧光蛋白。一个199 aa候选还对染色团区域进行了非经典修改,仍保留可检测荧光。

    这组实验最有价值的地方并非生成了更亮的荧光蛋白,而是证明了在同时发生数十个替换和 indel 后,部分序列仍能形成染色团并产生荧光。


    6.6 TurboID:模型找到了可删除结构域,但极端小型化没有保住强活性

    TurboID 是一种约335 aa的工程化生物素连接酶。其体积会干扰某些融合蛋白的定位或功能。

    作者生成了50万条候选:

    • • 中等小型化目标:195–235 aa;
    • • 极端小型化目标:150–180 aa。

    通过 pLL、hmmscan、TemStaPro、pLDDT 和 TM-score 筛选后,选择11条序列测试。

    一个重要现象是,Raygun 在没有结构域标注的情况下,自动删除了 DNA-binding domain,得到165 aa的 TurboID-11。这与人工开发 UltraID 时删除的结构域相同,而且作者指出 UltraID 不在 Raygun 训练数据中。

    实验结果却更加复杂:

    • • 11个候选中只有6个在 HEK 细胞中成功表达;
    • • TurboID-1 和 TurboID-5 显示显著生物素化活性;
    • • 两个有显著活性的候选都只是相对温和的缩短;
    • • 165 aa 的 TurboID-11 可以表达,但生物素化活性较弱,未达到显著水平。

    这说明 Raygun 能识别可能冗余的结构域,却不意味着删除结构域后仍可自动保留工程化酶的高强度活性。

    6.7 EGF:扩增两到四个残基后,出现更强 EGFR 结合

    EGF 只有53 aa,接近 Raygun 可处理的50 aa最小长度。因此,作者没有继续缩短,而是将目标长度设为55–57 aa。

    模型在5条 EGF-like 序列上微调,随后生成10,000条候选。作者没有显式固定已知 EGFR 结合位点,而是使用序列—结构—功能三模态模型 ProTrek 预测 EGFR 结合潜力。

    10条候选被提交到蛋白设计竞赛,4条进入实验测试,且均可表达。其中两条表现出高于野生型 EGF 的结合亲和力:

    蛋白
    野生型 EGF
    0.759 μM
    EGF-Raygun-1
    0.274 μM
    EGF-Raygun-2
    0.561 μM

     越低,通常表示结合越强。

    值得注意的是,两条表现更好的序列与野生型的一致性分别只有70.7%和76.8%,反而低于两条表现较弱的候选。主要变化也位于推测上远离直接结合界面的外围位置。

    这提示蛋白功能不完全由界面残基的局部保守决定,外围序列可能通过整体稳定性、构象分布或动力学间接影响结合。

    但4条候选、2条成功的规模仍然很小,尚不足以证明 Raygun 能普遍提高蛋白结合亲和力。


    7. 这篇文章带来的关键启发

    7.1 模板引导设计不只是点突变优化

    以往模板设计往往默认保持长度,仅在固定位置替换氨基酸。Raygun 表明,一旦建立长度无关表示,插入删除可以与替换进入同一个生成过程。

    这会明显扩大模板周围可探索的设计空间。

    7.2 蛋白语言模型可能学习了隐式功能约束

    Raygun 没有显式输入荧光染色团、RAS P-loop、TurboID 结构域或 EGF 结合位点,却能以高于随机或贪心策略的概率保留这些区域。

    这说明逐残基 PLM 表示中确实包含超出单个位点保守性的信息,包括长程上下文和全局序列协调关系。

    7.3 固定维度表示是长度控制的关键中介

    Raygun 最有原创性的部分未必是高斯采样本身,而是将长度变化问题分解为:

    • • 可变长度到固定长度;
    • • 固定长度概率采样;
    • • 固定长度到目标长度。

    这种表示层转换可能进一步用于 RNA、调控序列和其他可变长度生物聚合物。

    7.4 从可行蛋白附近出发,可能比从头搜索更适合工程优化

    从头生成需要从一个广泛先验分布逐渐找到可折叠、可表达、具有功能的序列。

    Raygun 从已经工作的蛋白出发,因此初始位置更接近可行蛋白流形。这种策略特别适合保留既有功能并调整尺寸,而不是发现完全新颖的折叠。

    7.5 生成与功能优化仍然是两个不同问题

    Raygun 能产生大量序列,但最终候选仍需要 pLL、Pfam、结构预测和任务特异模型筛选。

    模型学会如何生成看起来像蛋白的序列,并不自动等于学会最大化荧光、酶活或结合亲和力。


    8. 局限性

    8.1 高斯假设是实用近似,并非严格成立

    扩展数据中,固定表示的分布虽然总体呈单峰,但统计检验拒绝严格正态分布,而且部分维度存在重尾。

    真实蛋白功能空间很可能具有:

    • • 多个构象亚态;
    • • 不同功能子家族;
    • • 不连续的高适应度区域;
    • • 方向相关的突变耐受性。

    单个高斯分布难以表达多模态和不对称结构。未来可考虑高斯混合、正规化流或条件能量模型。

    8.2 所有蛋白都压缩成50个区块,会对长蛋白形成信息瓶颈

    对于100 aa蛋白,每块只包含少量残基;对于2,500 aa的 mTOR,每块平均对应约50个残基。

    同样的固定分辨率无法同时适应短肽、单结构域蛋白和大型多结构域蛋白。作者也承认,长蛋白的零样本重建更困难,需要额外微调。

    8.3 局部平均可能模糊精确基序和残基顺序

    Transformer 可以在压缩前后补偿部分信息损失,但区块平均本身不可避免地弱化:

    • • 区块内部的精细位置;
    • • 短功能基序;
    • • 跨结构域连接区;
    • • 插入删除的精确边界。

    因此,模型适合整体重构,却未必适合要求某个残基必须保留在精确位置的任务。

    8.4 结构和功能没有直接进入训练目标

    Raygun 的训练目标主要是重建 ESM-2 表示与原始序列,并保持潜表示对长度变化稳定。

    模型没有直接优化:

    • • 折叠自由能;
    • • 结合自由能;
    • • 催化几何;
    • • 蛋白动力学;
    • • 表达量;
    • • 聚集风险;
    • • 免疫原性。

    因此,功能保持来源于 PLM 的间接统计信息,而非显式物理或实验约束。

    8.5 预测结构相似不等于功能保持

    TM-score 和 pLDDT 能说明总体折叠可能相似,却无法保证:

    • • 活性位点处于正确质子化状态;
    • • 催化残基保持精确几何;
    • • 动力学通路没有改变;
    • • 蛋白仍可溶、可表达;
    • • 配体或底物具有原来的结合热力学。

    TurboID-11 正好说明了这一点:候选结构稳定且能表达,却没有保留足够强的酶活。

    8.6 下游过滤承担了相当一部分成功概率

    荧光蛋白从每个模板70,000条候选中仅挑选4条实验;TurboID 从50万条候选中挑选11条。

    这并不削弱 Raygun 作为生成器的价值,但需要区分两种能力:

    • • 模型能否提高候选池中的功能序列比例;
    • • 多级过滤能否从大池中挑出少数成功序列。

    论文通过未过滤候选与贪心删除基线的比较,证明 Raygun 本身确实具有一定功能位点保留能力,但实验成功仍是生成器和过滤器共同作用的结果。

    8.7 与扩散模型的比较并未覆盖核心 indel 任务

    Raygun 与 EvoDiff、DPLM 的比较只在固定长度条件下完成。

    这种比较可以评价序列替换质量,却没有回答长度变化任务中:

    • • 谁更能保留结构;
    • • 谁更能保留功能;
    • • 谁的候选多样性更高;
    • • 谁的完整筛选成本更低。

    论文宣称 Raygun 能处理扩散方法难以完成的 indel 编辑是合理的任务能力描述,但不能被理解为已经通过统一基准证明全面优于扩散方法。

    8.8 对人工强化功能的学习能力有限

    TurboID 的强生物素化能力来自人工定向进化,是超过自然 BirA 常见活性范围的工程化特征。

    蛋白语言模型主要从天然序列学习进化规律,因此对这类人工强化、自然界缺乏对应统计信号的性质可能表征不足。作者也将其称为 supra-evolutionary function。

    这意味着 Raygun 更容易保留天然功能语法,未必能自动保留人工优化出的极端性能。

    8.9 生成速度不等于总设计成本

    每条序列0.3秒非常快,但如果需要生成50万条候选,再对大量候选运行结构预测、功能模型和实验筛选,完整成本仍然较高。

    因此,更有意义的效率指标应包括:

    • • 每个通过筛选候选的总 GPU 时间;
    • • 每个实验成功设计的生成与评估成本;
    • • 相同计算预算下的实验命中率。

    9. 对 AI 蛋白设计与药物研发的未来意义

    9.1 为蛋白药和基因治疗提供尺寸工程工具

    AAV 等病毒载体存在严格包装容量。部分功能蛋白虽然有效,却因编码序列过大难以递送。

    Raygun 提供了一种自动寻找可删除区域并同步调整其他残基的方式。未来若结合结构域约束、免疫原性预测和功能筛选,可能用于:

    • • 基因编辑蛋白小型化;
    • • 细胞内蛋白药递送;
    • • 病毒载体负载优化;
    • • 更短的蛋白传感器和报告系统。

    9.2 连接从头设计和已有蛋白优化

    从头模型可以生成满足几何条件的新骨架,但生成结果可能过长、环区不理想或包含冗余结构。

    Raygun 可以作为后续编辑模块:

    这样,从头生成负责探索新折叠,Raygun 负责围绕已有设计执行尺寸和序列工程。

    9.3 与实验闭环结合比单次生成更有潜力

    Raygun 最适合的未来形态可能不是单独使用,而是与实验数据形成迭代闭环:

    1. 1. Raygun 生成不同长度候选;
    2. 2. 任务模型和物理模型筛选;
    3. 3. 实验测定活性、表达和稳定性;
    4. 4. 用实验结果微调生成器或训练奖励模型;
    5. 5. 再次围绕高性能候选探索。

    这可以弥补 PLM 对人工强化功能学习不足的问题。

    9.4 从高斯潜空间走向功能条件概率空间

    当前两个控制变量只有长度和噪声。

    未来更有价值的条件包括:

    • • 指定必须保留的催化基序;
    • • 指定不可修改残基;
    • • 指定删除某个结构域;
    • • 指定插入位置和插入片段;
    • • 指定热稳定性、结合亲和力或表达量;
    • • 指定多种属性的 Pareto 前沿。

    届时,Raygun 才会从通用模板编辑器进一步发展为可编程蛋白工程平台。

    9.5 引入结构感知 PLM 和多尺度表示

    作者提出可结合 ESM-3、SaProt 等包含结构信息的蛋白语言模型。

    此外,还可以将固定50区块改造成层级表示:

    • • 残基层;
    • • 二级结构层;
    • • 结构域层;
    • • 全蛋白层。

    这样,模型既能改变整体长度,也能精确控制局部功能区和结构域组织。


    总结与推荐理由

    Raygun 最值得关注的贡献,是把不同长度蛋白映射到同一个固定维度概率空间,从而使替换、插入和删除可以进入统一的模板引导生成过程。

    它证明了三件事:

    第一,逐残基蛋白语言模型表示可以被大幅压缩,同时保留足以重建整体折叠和部分功能的信息。

    第二,从一个已经可行的天然蛋白附近开始搜索,能够产生传统点突变方法和固定长度生成方法不容易覆盖的候选。

    第三,模型在实验中确实产生了可发光的缩短荧光蛋白、具有生物素化活性的 TurboID 变体,以及结合 EGFR 强于野生型 EGF 的扩增序列。

    但论文并未证明蛋白功能能够普遍、完整地独立于长度编码。极端小型化的 TurboID 未保留强活性,荧光蛋白亮度较低,大型多结构域蛋白仍需要微调,而且成功候选依赖大规模生成和多层筛选。

    因此,Raygun 更适合被理解为一种重要的新型蛋白编辑基础模型:它显著拓展了模板周围可以探索的序列与长度空间,但距离直接输入一个蛋白、输出一个更短且功能不减的蛋白,仍有结构建模、功能条件控制和实验闭环等关键环节需要补足。

    推荐理由: 这篇论文提出了一个简洁而有启发性的长度无关蛋白表示方案,并通过三类湿实验展示其真实设计潜力,同时也清楚暴露了序列语言模型在极端小型化和人工强化功能保持方面的边界。

内容中包含的图片若涉及版权问题,请及时与我们联系删除