|
|
|
|
|
蛋白质组学与互作研究的新工具:DIA-MS、APEX与深度学习 | MDPI Proteomes |
|
|
期刊名:Proteomes
期刊主页:https://www.mdpi.com/journal/proteomes
蛋白质组学技术的进步正在不断拓展我们对生命分子世界的认知边界。从质谱数据采集模式的革新,到活细胞中蛋白质相互作用的精准标记,再到人工智能驱动的跨物种蛋白质互作预测,新技术与新方法正在重塑蛋白质组学研究的范式。
Proteomes 发表的三篇文章,分别从DIA质谱鉴定单氨基酸变异的评估、APEX技术在蛋白质-配体相互作用网络中的应用、以及基于结构的深度学习框架预测人类-肠道细菌蛋白互作三个角度,展示了蛋白质组学技术的前沿进展。
一、DIA-MS鉴定单氨基酸变异的评估
Assessment of Data-Independent Acquisition Mass Spectrometry (DIA-MS) for the Identification of Single Amino Acid Variants
用于鉴定单氨基酸变异的数据非依赖性采集质谱(DIA-MS)评估
https://www.mdpi.com/2227-7382/12/4/33
研究背景
蛋白质基因组学(proteogenomics)整合基因组和蛋白质组学数据,通过鉴定变异肽段(包括单氨基酸变异,SAAVs)来阐明细胞过程。随着全基因组、外显子组和转录组测序的广泛应用,大量与肿瘤发生相关的结构变异和序列变异已被鉴定。然而,这些变异对蛋白质组功能影响的理解仍存在显著空白。
数据非依赖性采集(DIA)质谱通过系统地碎裂预定义质量范围内的所有离子,相比数据依赖性采集(DDA)具有更好的重现性和定量准确性。本研究旨在评估DIA-MS结合不同搜索引擎流程在鉴定HeLa细胞SAAV肽段方面的能力。
研究方法
研究者构建了包含HeLa基因组SAAV序列的定制化序列数据库(CPS-DB),并使用DIA-NN、Spectronaut和Fragpipe-MSFragger(FP-DIA)三种搜索引擎流程进行搜库。评估聚焦于真阳性SAAV肽段的鉴定和通过诱饵数据库(entrapment DB)进行的假阳性评估。研究还通过稳定同位素稀释和平行反应监测(SID-PRM)验证了鉴定结果。
关键发现
• SAAV肽段鉴定:共鉴定出10种不同的SAAV肽段,覆盖8个不同的SAAV位点。三种搜索引擎流程有70%的SAAV肽段鉴定是共同的,提示高鉴定置信度
• 诱饵数据库评估:使用基于HeLa SAAV替换频率生成的诱饵数据库(1×、10×、100×、400×大小)评估搜索引擎性能,发现SAAV肽段鉴定数量保持相对稳定(8-10个),但错误率随诱饵库增大而增加。FP-DIA表现出最低的假发现匹配比(FDMR),是最保守和有效的流程
• DIA与DDA比较:将DIA数据与DDA数据搜索相结合,增加了真阳性SAAV肽段的鉴定数量。FP-DIA与三种DDA搜索引擎(MaxQuant、FP-DDA、SpectroMine)共同鉴定出5个共有的SAAV肽段
• PRM验证:通过SID-PRM实验确认了9个SAAV肽段中的8个,验证率达88.9%
研究意义
本研究证实DIA-MS在蛋白质基因组学工作流程中鉴定SAAV肽段的有效性,为优化搜索引擎流程和数据库构建提供了见解。这些方法有助于全面表征蛋白质组的变异性和多样性,促进对复杂癌症蛋白质组中SAAV的鉴定和新型蛋白质变体治疗靶点的发现。

图 2.(A) HeLa DIA 数据搜索。在面板的顶部,维恩图显示了每个 DIA 搜索引擎管道输出之间共享的肽的数量(每个搜索引擎的缩写:Spectronaut (SN)、Fragpipe (MSFragger) - DIA 工作流程 (FP-DIA) 和 DIA-神经网络 (DIA-NN),如方法第 2.8 节中所述)。在面板的底部,条形图显示了每个 DIA 搜索引擎管道获得的肽总数的输出。 (B) 面板底部的条形图描绘了每个搜索引擎的管道输出变体肽的数量。下面是每个变体肽的列表,用红色表示取代的氨基酸。在面板的顶部,维恩图显示了每个 DIA 搜索引擎管道识别的常见变异肽的数量。
二、下一代蛋白质-配体相互作用网络:APEX技术
Next-Generation Protein–Ligand Interaction Networks: APEX as a Powerful Technology
下一代蛋白质-配体相互作用网络:APEX——一项强大的技术
https://www.mdpi.com/2227-7382/13/3/26
研究背景
蛋白质-配体相互作用构成了多种生物分子网络的基础,调控信号转导、基因表达、代谢过程等关键通路。然而,在活细胞中研究这些动态、瞬时的相互作用面临重大挑战。增强型抗坏血酸过氧化物酶(APEX)已成为研究活细胞中蛋白质-蛋白质、蛋白质-RNA和蛋白质-DNA相互作用网络的有力工具。
APEX的工程化改造
野生型APX是一个约28 kDa的II类过氧化物酶,以二聚体形式存在,催化抗坏血酸还原过氧化氢。其结构特征包括:缺乏二硫键、信号肽和糖基化,不依赖钙离子,使其能够在细胞内还原环境中保持活性。
通过定向进化和理性突变,研究者开发了一系列APEX变体:
• APEX:引入K14D和E112K突变减少二聚化,W41F恢复催化活性,形成单体
• APEX2:额外引入A134P突变,提高催化效率、热稳定性和过氧化氢耐受性
• APEX3:包含L242A突变,改善核定位,避免细胞质定位偏向
APEX的催化机制与邻近标记
APEX催化过氧化氢氧化底物的反应,生成高反应性、短寿命(<1 ms)的自由基,标记半径约269 ± 41 nm。最常见的底物生物素-酪酰胺在过氧化氢存在下被APEX氧化,生成生物素-酚氧自由基,共价结合到邻近蛋白质的酪氨酸、色氨酸和半胱氨酸残基上。生物素化蛋白质通过链霉亲和素树脂纯化,经LC-MS/MS鉴定。
主要应用
细胞器蛋白质组图谱:APEX融合靶向序列定位到特定亚细胞区室,催化邻近蛋白质的生物素化,实现细胞器蛋白质组的精细表征。已应用于线粒体、初级纤毛、内质网、应激颗粒等结构。
蛋白质-蛋白质相互作用鉴定:APEX融合到目标蛋白,标记和鉴定相互作用伙伴。该方法在活细胞中原位运行,避免了传统Co-IP的复合物解离问题。
RNA和DNA研究:APEX-seq利用生物素-酪酰胺自由基与RNA鸟苷残基的反应性,实现亚细胞转录组图谱。dCas9-APEX2系统(C-BERST)用于DNA相关蛋白质组图谱。APEX-RIP和Proximity-CLIP整合邻近标记与RNA捕获进行转录组分析。
跨物种应用:已在人细胞、果蝇、线虫、弓形虫、恶性疟原虫、布氏锥虫、结核分枝杆菌、酿酒酵母等多种系统中成功应用。
优势与挑战
APEX的优势包括:在活细胞中原位标记、快速反应(1分钟内)、高空间分辨率、与电镜兼容。挑战包括:生物素-链霉亲和素强相互作用的洗脱困难、生物素-酪酰胺膜通透性有限、非生物素化蛋白的背景污染。新的探针(如desthiobiotin-phenol、alkyne-phenol)和Spot-ID方法正在解决这些问题。
研究意义
APEX已成为研究蛋白质相互作用网络的有力工具,能够在活细胞中标记蛋白质,同时保持分子复合物和细胞区室完整性。该技术使我们能够更详细地研究蛋白质变体的亚细胞定位及其相互作用伙伴,从而推断不同蛋白质变体的功能差异。

图5. 利用工程化APEX进行的邻近依赖性标记。
三、基于结构的深度学习框架预测人类-肠道细菌蛋白互作
Structure-Based Deep Learning Framework for Modeling Human–Gut Bacterial Protein Interactions
基于结构的深度学习框架:用于建模人类与肠道细菌间的蛋白质相互作用
https://www.mdpi.com/2227-7382/13/1/10
研究背景
肠道微生物组(GM)被视为人体的重要器官,包含超过1014个微生物,编码约300万个基因。肠道菌群与宿主之间的蛋白质相互作用网络对建立人体健康至关重要,其失调直接导致疾病发展。然而,由于实验限制,这些跨物种蛋白质-蛋白质相互作用(PPIs)的实验数据非常稀少。目前公共数据库中仅包含不到2万个人类-细菌蛋白相互作用,远不足以覆盖肠道微生物组300-500种不同细菌与宿主之间的完整互作网络。
深度学习框架
本研究提出了一个基于结构数据的深度学习框架,用于预测人类与肠道细菌蛋白之间的PPIs:
蛋白质图嵌入:将每个蛋白质表示为异构图,氨基酸作为节点,包含三种边类型:序列边(连接连续氨基酸)、径向距离边(Cα-Cα距离<10 Å)和k近邻边。通过预训练的变分自编码器(VAE)计算蛋白质结构嵌入。
双向交叉注意力融合:将两个蛋白质的嵌入通过双向交叉注意力模块融合为统一的蛋白质对表示,动态识别不同特征的重要性。
分类器:通过全连接层预测互作概率。针对数据集中互作与非互作对的不平衡问题,采用focal loss函数(γ=2)强调难分类样本。
结果
模型在验证集和测试集上均表现稳健:
• 验证集:精度0.89,召回0.88,F1分数0.89,AUC 0.96
• 测试集:精度0.89,召回0.88,F1分数0.89,MCC 0.76
将模型应用于人类肠道(含脑组织)蛋白(24,345种)和肠道细菌蛋白(100,945种),共生成约24.6亿个蛋白对。采用0.99的高阈值筛选高置信度互作,预测出约1600万个PPIs,涉及19,054个人类蛋白和1886个细菌蛋白,约占全部蛋白对的0.6%。
蛋白质变体的纳入
研究特别强调了蛋白质变体(proteoforms)的重要性。同一基因的不同蛋白质变体在序列和结构上存在差异,且与不同的蛋白质相互作用——这表明它们直接贡献于蛋白质组的复杂性。本预测模型中纳入的24,345个人类蛋白和100,945个细菌蛋白包含同一基因的不同蛋白质变体,预测结果显示同一蛋白质的不同变体既有共享的互作伙伴,也有各自独特的互作伙伴。
研究意义
该框架填补了人类-肠道细菌蛋白互作数据的空白,为研究宿主-微生物组互作提供了可扩展的工具,可能为与微生物组相关的疾病提供新的治疗靶点和诊断方法。

图1. 整体深度学习模型架构。
四、小结
三篇文章从不同角度展示了蛋白质组学与互作研究的技术前沿:
• DIA-MS鉴定SAAV:通过诱饵数据库策略评估了三种DIA搜索引擎流程的性能,发现FP-DIA表现最保守有效,PRM验证率达88.9%,为蛋白质基因组学工作流程优化提供了系统评估框架
• APEX邻近标记技术:从野生型APX到APEX2、APEX3的工程化改造历程,使其成为活细胞中原位、高时空分辨率研究蛋白质-配体相互作用网络的强大工具,已广泛应用于细胞器蛋白质组图谱、PPI鉴定、RNA/DNA研究等多个领域
• 深度学习预测跨物种蛋白互作:基于蛋白质图嵌入、VAE编码和双向交叉注意力机制,在约24.6亿个蛋白对中预测出约1600万个高置信度的人类-肠道细菌蛋白互作,并特别纳入了蛋白质变体的分析
三篇文章共同表明:从质谱数据采集、活细胞邻近标记到人工智能驱动的跨物种互作预测,蛋白质组学技术正在多个维度上突破传统方法的局限,为理解蛋白质功能的复杂性提供越来越精准的工具。
Proteomes 期刊介绍
主编:Jens R. Coorssen, Institute for Globally Distributed Open Research and Education (IGDORE), Canada; Matthew P. Padula, The University of Technology Sydney, Australia
期刊专注于蛋白质组分析的各个方面,特别关注蛋白质组在蛋白质形式(proteoforms)、功能性生物学单元以及标准氨基酸序列水平上的表征和定量。目前已被Scopus、ESCI (Web of Science)、PubMed等数据库收录。
2025 Impact Factor: 4.3
2025 CiteScore: 6.4
Time to First Decision: 27.9 Days
Acceptance to Publication: 5.5 Days
特别声明:本文转载仅仅是出于传播信息的需要,并不意味着代表本网站观点或证实其内容的真实性;如其他媒体、网站或个人从本网站转载使用,须保留本网站注明的“来源”,并自负版权等法律责任;作者如果不希望被转载或者联系转载稿费等事宜,请与我们接洽。