|
|
|
|
|
AS | 华中大宁康团队发布首个微生物组通用大模型MGM:开启微生物组分析“Deepseek”时代 |
|
|


研究背景:
微生物群落广泛存在于人体、环境和工程系统中,对健康和生态至关重要。随着测序技术的普及,海量的微生物组数据被积累(如 MGnify 数据库)。然而,数据异质性(Data Heterogeneity)和批次效应(Batch Effects)成为了横亘在研究者面前的大山。
传统的监督学习方法往往难以捕捉跨研究、跨环境的通用模式;而现有的生物学大模型(如针对单细胞数据的 scBERT)由于词表和特征的根本差异,无法直接迁移到微生物组领域。
为了解决这一难题,宁康团队提出了MGM一个专为微生物组设计的、具备上下文感知能力的通用人工智能模型。

文章概述:
近日,华中科技大学生命科学与技术学院宁康教授团队在国际顶级综合性期刊Advanced Science在线发表了题为“MGM as a large-scale pretrained foundation model for microbiome analyses in diverse contexts”的研究论文。
该研究发布了首个面向微生物组分析的大规模预训练基础模型——MGM (Microbial General Model)。MGM 基于 Transformer 架构,在超过 26 万份多样化微生物组样本上进行自监督预训练,不仅在分类任务上全面超越传统方法,更展现出强大的跨区域泛化能力、时序动态捕捉能力,以及能够通过“图灵测试”的微生物群落生成能力。
图文导读:
01 核心创新:MGM 模型架构
MGM 采用了类似 GPT 的因果语言建模(Causal Language Modeling)策略。研究团队构建了包含 263,302 个样本的 Microcorpus-260K 数据集,涵盖宿主相关、环境、工程等多种生境。
独特的编码策略:为了解决微生物丰度数据的极值和标准化问题,MGM 创新性地采用了排序值编码(Rank Value Encoding),将微生物群落转化为离散的 Token 序列,既保留了相对丰度信息,又规避了绝对数值带来的噪音。
Transformer 架构:通过自注意力机制(Self-Attention),MGM 能够捕捉微生物群落中复杂的共现模式和生态互作网络。
迁移学习:预训练后的 MGM 可以通过简单的微调(Fine-tuning),迅速适配到各种下游任务中。

图1. MGM模型架构与迁移学习策略
02 性能突破:全面超越现有SOTA
在多项基准测试中,MGM 展现出了压倒性的优势:
1.微生物群落分类:准确率近乎完美 在基于 MGnify 数据的微生物溯源任务中,MGM 的平均 ROC-AUC 达到 0.99,显著优于随机森林(RF)、EXPERT、DeepPhylo 以及经典的 FEAST 方法。即便在未微调的情况下,MGM 的零样本表现也令人印象深刻。

图2.MGM在微生物群落溯源任务上显著优于已有方法
2. 跨区域疾病诊断:克服地理偏差 在炎症性肠病(IBD)的跨国诊断(爱尔兰与加拿大队列)中,MGM 展现了极强的泛化能力。在零样本(Zero-shot)跨区域测试中,MGM 的表现甚至超过了其他经过迁移学习微调的模型,证明其有效捕获了疾病相关的通用微生物特征,而非特定地区的噪音。
3. 捕捉时序动态:揭示婴儿肠道发育轨迹 在婴儿肠道发育的纵向队列研究中,MGM 成功区分了顺产与剖宫产婴儿的微生物群落演替轨迹。通过注意力权重分析,MGM 精准识别了关键物种(Keystone Taxa):
顺产:Bacteroides(拟杆菌属)和 Bifidobacterium(双歧杆菌属)权重显著较高;
剖宫产:Haemophilus(嗜血杆菌属)表现出持续的高权重。

图3.MGM 捕获婴儿发育的时序特征并基于注意力权重识别基石物种
4. 泛癌种诊断与生物标志物发现 在包含 5 种胃肠道肿瘤的 TCMA 数据集上,MGM 实现了0.97 的宏平均 ROC-AUC。通过计算机模拟(In silico)的扰动实验,模型准确识别了与已有工作相一致的致癌相关菌属。
03 生成式AI:微生物组的“图灵测试”
MGM不仅能“理解”微生物,还能“创造”微生物。研究团队开发了提示词引导(Prompt-guided)的生成流程,能够根据疾病标签生成逼真的微生物群落概况。
为了验证生成数据的质量,团队设计了“微生物组图灵测试(Microbiome Turing Test)”,从统计保真度和生物学意义两个维度进行评估。结果显示,MGM 生成的数据在 Beta 多样性、物种共现网络等指标上与真实数据高度一致,且能够欺骗分类器,表现显著优于 GAN 等生成模型。

图4.MGM根据提示词生成高质量的微生物组数据
总结与展望:
MGM的提出标志着微生物组研究进入了“DeepSeek”时代。它不仅是一个高精度的分类器,更是一个集成了表示学习、迁移学习、扰动分析和数据合成的统一框架。这一工作为解决微生物组数据整合难题提供了新思路,在疾病无创诊断、环境监测、合成生物学以及个性化医疗等领域具有广阔的应用前景。
华中科技大学宁康教授为通讯作者,华中科技大学博士生张皓鸿、博士生张玉丽、以及硕士生康子鑫为论文共同第一作者。华中科技大学生命科学与技术学院为第一完成单位。此外,该研究得到了国家重点研发计划和国家自然科学基金等项目的资助。
论文信息:
MGM as a Large-Scale Pretrained Foundation Model for Microbiome Analyses in Diverse Contexts
Haohong Zhang, Yuli Zhang, Zixin Kang, Jiayun Xiong, Ronghua Yang, Kang Ning
Advanced Science
DOI:10.1002/advs.202513333
原文链接:
https://doi.org/10.1002/advs.202513333
期刊介绍:

Advanced Science 是 Wiley旗舰期刊 Advanced 系列中的一种完全开放获取的跨学科科学期刊,发表材料科学、物理、化学、医学、生命科学、环境科学、工程和社会科学等领域的前沿基础和应用研究。我们的使命是通过开放获取出版,使前沿创新的科学研究具有更广泛的可访问性。Wiley 的 Advanced 系列是全球公认的高影响力期刊系列,传播来自资深和青年研究人员的科学成果,帮助他们实现使命并扩大科学发现的影响力。
Advanced Science 2025年影响因子为14.1,五年平均影响因子为15.6,期刊引文指标1.74,CiteScore 为 18.1。在 2025年中国科学院院文献情报中心期刊分区表中,Advanced Science 入选综合类期刊一区TOP。

特别声明:本文转载仅仅是出于传播信息的需要,并不意味着代表本网站观点或证实其内容的真实性;如其他媒体、网站或个人从本网站转载使用,须保留本网站注明的“来源”,并自负版权等法律责任;作者如果不希望被转载或者联系转载稿费等事宜,请与我们接洽。