来源:Advanced Science 发布时间:2026/7/27 12:55:52
选择字号:
Adv Sci | 刘永鑫/李小方/陈夏/陈同等发布微生物组PacBio与Nanopore长读扩增子分析流程

研究论文

● 期刊:Advanced Science (IF: 14.1)

● 标题:EasyAmplicon 2: Expanding PacBio and Nanopore Long Amplicon Sequencing Analysis Pipeline for Microbiome

● 中文标题:EasyAmplicon 2: 微生物组PacBio与Nanopore长读扩增子分析流程

● 文章DOI:https://doi.org/10.1002/advs.202512447

● 链接: https://advanced.onlinelibrary.wiley.com/doi/10.1002/advs.202512447

● 第一作者:罗豪、白德凤、朱志豪、Salsabeel Yousuf、杨海飞、荀佳妮、曾美尹

● 通讯作者:刘永鑫、李小方、陈夏、陈同、文涛、甘人友、白德凤

● 合作作者:王瑶、高云云、彭凯、许珊珊、周远平、张天缘、马闯、侯辉宇、万锈琳、周扬、贾保磊、黄适

● 发表日期:2025-10-27

● 主要单位:中国农业科学院深圳农业基因组研究所、广东医科大学、青岛农业大学、北京林业大学、扬州大学、合肥工业大学、湘湖实验室、香港大学、中国科学院遗传发育所、宁波大学第一附属医院、中国中医科学院、南京农业大学、香港理工大学

摘要

在过去十年中,第三代测序技术(如 Pacific Biosciences (PacBio)和 Nanopore)逐渐成熟,并被广泛应用于微生物的分类与定量研究。与 Illumina 测序相比,PacBio 和 Nanopore 在读长和分类分辨率方面具有显著优势。然而,目前仍缺乏一种简便易用、可重复、并得到社区支持的 PacBio 或 Nanopore 扩增子测序数据分析流程。为弥补这一不足,我们对被广泛引用的 EasyAmplicon 进行了更新,推出 EasyAmplicon 2这一完全支持第三代全长扩增子数据的分析流程。EasyAmplicon 2 提供了友好的用户界面,涵盖了多种测序平台(Illumina、华大基因(BGI)、PacBio、Nanopore 以及齐碳(Qitan))的数据分析与可视化功能。该流程整合了 DADA2、Emu 等主流工具,构建了从原始数据处理到可直接用于发表的可视化结果的一站式分析。EasyAmplicon 2 保留了前一版本的优势,并在可视化模块方面进行了进一步优化。新版流程包括数据预处理、扩增子序列变体(ASV)的注释与定量、组间比较及第三代测序结果的可视化功能。EasyAmplicon 2 为全长扩增子测序数据的分析提供了一个简洁、高效、易用的解决方案。该工具已在 GitHub 上免费开放获取(https://github.com/YongxinLiu/EasyAmplicon)。

引言

扩增子测序长期以来一直是微生物群落研究的重要基石,使研究者能够解析来自不同环境中微生物组的分类学与生态学多样性,包括人类、动物、植物及多种自然生态系统。在过去十余年中,传统的短读测序平台(如 Illumina)一直占据主导地位,通过扩增保守标记基因(如 16S/18S rRNA 或 ITS)的部分区域,提供了可靠但往往片段化的微生物多样性信息。然而,短读扩增子通常仅覆盖高变区的部分区域,导致物种水平的精确分类和系统发育重建受到限制。

随着长读测序技术(如 Pacific Biosciences〔PacBio〕和 Oxford Nanopore Technologies〔ONT〕)的出现,研究者能够获得覆盖完整基因的全长扩增子序列,例如约 1.5 kb 的细菌 16S rRNA 基因或多位点标记基因。长读序列显著提升了分类分辨率,有助于实现物种水平的分类、更精确的系统发育重建以及对微生物群落功能的深入解析。尽管长读测序在早期阶段存在较高的单读错误率,但近年来的技术进步已将测序准确率提升至 97% 以上。随着第三代测序技术的持续发展与优化,这类限制正逐步被克服,长读测序的广泛应用时代正在到来。

然而,全长扩增子数据的分析仍面临独特挑战,例如与传统短读分析流程兼容性有限,且缺乏从原始数据到高质量、可直接用于发表结果的标准化端到端工作流。为弥补这一不足,我们推出 EasyAmplicon 2 这一个结构精简、模块化、开源的全长扩增子测序分析流程。EasyAmplicon 2 是 EasyAmplicon 1.0 的更新与增强版本。EasyAmplicon 1.0 主要面向短读扩增子数据分析,整合了多种常用工具,包括:VSEARCH(用于序列拼接、引物剪切、质量控制、去冗余及特征表构建),USEARCH(用于 OTU/ASV 聚类、多样性分析及特征表定量),QIIME 2(用于短读扩增子处理),PICRUSt2 与 FAPROTAX(用于功能预测与注释),BugBase(用于细菌表型预测)。相比之下,EasyAmplicon 2 集成了基于 R 框架和 Snakemake 自动化流程的 Linux 环境,能够实现从原始数据到特征表分析与可视化的可重复处理。该流程全面支持 PacBio 与 ONT 数据集,涵盖质量控制、去噪、嵌合体去除和分类学注释等关键步骤。

EasyAmplicon 2 还整合了多种权威参考数据库(如 SILVA、GTDB、NCBI、UNITE、Greengenes 和 RDP)及兼容工具版本(如 Cutadapt、DADA2、Emu、USEARCH 和 VSEARCH),可实现高分辨率的分类学分析,同时最大限度地减少人工干预。

虽然 EasyAmplicon 2 目前主要聚焦于细菌注释与分析,但该流程同样关注长读测序在病毒研究领域的最新进展,如 INSaFLU-T-LEVIR 和 VirDetector 等。基于长读测序的病毒注释模块正在开发中,未来将陆续发布。与此同时,为克服现有在线平台(如 Qiita、MGnify、gcMeta 和 LotuS2)在长读数据分析、上传速度、运行效率、参数可调性及个性化方面的局限,EasyAmplicon 2 被设计为一个基于代码的可定制平台,既能实现可重复分析,又可通过脚本自定义进行灵活扩展。该设计理念延续了我们此前开发的 EasyAmplicon、EasyMetagenome、MicrobiomeStatPlots 和 EasyNanoMeta 等用户友好型生物信息学流程的特点。

与现有主要针对短读数据或需复杂配置才能处理长读数据的分析工具与流程相比,EasyAmplicon 2 更加注重可及性、可重复性和灵活性。该流程不仅提供命令行界面,还支持在 RStudio 中进行交互式操作,可实现多样本或多扩增区域的批量处理,并提供超过 30 种可定制的可视化样式,适用于生态学解释及发表级图表的生成。EasyAmplicon 2 有效应对了长读扩增子数据分析的特定需求,填补了微生物组生物信息学领域的重要空白。它使研究者能够充分发挥全长测序技术的潜力,广泛应用于微生物生态学、临床微生物学、农业科学及其他相关领域。

结果

EasyAmplicon 2 概述

EasyAmplicon 2 是一个模块化且高度集成的分析流程,用于处理全长扩增子数据并生成可直接用于发表的可视化结果,特别针对 PacBio 与 Oxford Nanopore Technologies (ONT) 等长读测序技术进行了优化。该流程设计轻量高效,既可在个人笔记本电脑上运行,也可在高性能计算(HPC)服务器上执行。它整合了多个新软件(见表 1),可生成特征表与高质量的可视化图形,以支持深入的结果解析。

表1.新增软件及R包

在典型的全长 16S rRNA 样本分析中(PacBio HiFi reads,约 20,000 条 reads/样本),EasyAmplicon 2 可在 双核 2.3 GHz 处理器、6 GB 内存条件下,于 2 小时内完成从头到尾的分析(包括质量控制、去噪、分类学注释与可视化)。这种高效性能使 EasyAmplicon 2 能够灵活适配从小规模探索性研究到大规模队列项目的多种分析需求。EasyAmplicon 2 提供了从原始数据输入到特征表生成及可视化展示的完整工作流程(图 1)。整个流程包含三个核心模块:1)安装模块(图 1A);2)预处理与分类学注释模块(图 1B);3)可视化模块(图 1C)。

图1. EasyAmplicon 2 分析 PacBio 与 Nanopore 扩增子序列的总体流程

A)软件与数据库的安装模块;B)核心分析流程,支持 PacBio CCS(环状一致性序列)与 Nanopore FASTQ 数据的处理;C)下游统计分析与可视化模块。

通过命令行或 RStudio 运行流程

用户可通过命令行脚本(Install.sh、pipeline.sh、PacBio_pipeline.sh、Nanopore_pipeline.sh)启动整个工作流程。只需指定工作目录并修改少量参数(如引物序列或参考数据库),即可分步执行全部分析。用户仅需提供原始测序数据与样本元数据,之后的各个步骤——包括质量过滤、错误校正、聚类与可视化——均由 EasyAmplicon 2 全自动完成。

对于偏好命令行操作的用户,所有步骤均可在 Linux/Mac 终端、Windows Git Bash 或远程服务器中执行,从而在不同计算平台上实现最大灵活性。系统默认将所有图形导出为 PDF 格式,确保符合学术期刊出版要求,并便于后续编辑与排版。此外,EasyAmplicon 2 还整合了常用的数据分析与可视化代码模块,可帮助用户快速生成并解释分析结果,从而显著提升长读扩增子测序数据分析的效率与可视化质量。

物种注释与微生物多样性分析

EasyAmplicon 2 可基于来自 Illumina、PacBio 或 Nanopore 测序数据生成的 OTU/ASV 表和分类注释结果,开展微生物多样性与群落组成分析(图 2A–E;补充信息图 S1A–G、S2A–G)。箱线图结果显示,牙菌斑和唾液样本的 α 多样性(物种丰富度)显著高于粪便样本,而牙菌斑与唾液之间无显著差异(图 2A;补充信息图 S1A)。Nanopore 数据的不同组间未观察到显著的丰富度差异(补充信息图 S2A)。主坐标分析(PCoA)揭示了组间 β 多样性存在显著差异(p < 0.05;图 2B;补充信息图 S1B、S2B)。在门水平的堆叠柱状图中,不同群落结构清晰可见:在 Illumina/PacBio 数据中,Bacillota(厚壁菌门)在粪便样本中富集(图 2C;补充信息图 S1C);而在 Nanopore 数据中,Pseudomonadota(假单胞菌门)在外部组中占优势(补充信息图 S2C)。环形图展示了四个群组(南方组、北方组、东方组和外部组)的主要门水平相对丰度组成(补充信息图 S2D)。气泡图进一步展示了不同样本及群组间微生物属水平相对丰度的变化(图 2D;补充信息图 S1D、S2E)。分面堆叠柱状图则揭示了短读(Illumina)与长读(PacBio)测序在相同样本中物种组成上的明显差异(图 2E)。除群落多样性与组成分析外,EasyAmplicon 2 还可通过 Mantel 检验和冗余分析(RDA)评估环境因子的影响。Mantel 热图量化了盐度、温度、总溶解固体(TDS)及总磷(TP)与细菌属间的相关性(图 2F);RDA 则可视化了这些环境梯度如何塑造不同地区的群落分布,其中箭头方向和长度分别表示环境与微生物驱动因素的方向与强度(图 2G)。

图 2. 使用 EasyAmplicon 2 生成的示例图

A)箱线图比较了不同组间的 α 多样性;B)主坐标分析(PCoA)展示了组间 β 多样性的差异;C)堆叠柱状图显示了三个组在门水平细菌相对丰度的变化;D)分组气泡图展示了不同样本间微生物属水平相对丰度的差异;E)分面堆叠柱状图展示了 Illumina 与 PacBio 在属水平微生物相对丰度上的差异;F)Mantel 检验相关性热图揭示了环境因子与主要微生物属相对丰度之间的相关关系;G)冗余分析(RDA)展示了环境变量与主要微生物属相对丰度之间的关系。(每组 n = 6 个样本;* 表示 p < 0.05;*** 表示 p < 0.001;“NS” 表示无显著差异)

样本组间差异丰度分析

除多样性与环境因子分析外,EasyAmplicon 2 还提供了多种高级可视化工具,用于组间差异比较(图 3A–F)。系统发育树(未显示进化距离)展示了不同组别的 ASV 相对丰度(粪便:红色,牙菌斑:蓝色,唾液:绿色;图 3A)。Venn 图显示了各组间共享与特异的扩增子序列变体(ASVs),并推荐使用 Evenn 生成可自定义图形(图 3B)。弦图突出了 Illumina 与 Nanopore 数据集在属水平上的差异(图 S1E 与 S2E)。三元图展示了门水平的分布,其中 Bacillota 在粪便、牙菌斑与唾液样本中占主导(图 3C;图 S1F),而 Pseudomonadota 在 Nanopore 数据中富集(图 S2G)。火山图揭示了差异丰度的 ASVs,其中 ASV_10 在粪便组显著富集(图 3D)。扩展误差条图定量展示了属水平的差异,并显示 95% 置信区间(图 3E;图 S1G)。研究者还可通过 STAMP(宏基因组统计分析软件) 进行相同的分析。最后,通过 Wekemo Biocloud 平台进行的 LEfSe(线性判别分析效应量) 分析表明,Streptococcus 在唾液组中显著富集,而 Faecalibacterium 在粪便组中显著富集(图 3F)。

图 3. 使用 EasyAmplicon 2 进行细菌数据差异分析

A) 系统发育树显示不同组中扩增子序列变体(ASVs)的相对丰度。B) Venn 图显示各组间相同和不同核心 ASVs 的数量。C) 三元图显示三个采样点微生物门水平的相对丰度分布。D) 火山图显示组间 ASVs 相对丰度的差异(红色表示丰度增加,绿色表示丰度降低)。E) 扩展误差条图显示粪便组与牙菌斑组微生物属相对丰度的差异及其 95% 置信区间。F) LEfSe 分析显示粪便组与唾液组微生物属相对丰度的差异。(每组 n = 6 样本;火山图和扩展误差条图的显著性检验方法为双侧 Wilcoxon 秩和检验)

功能预测与生物标志物识别

EasyAmplicon 2 进一步扩展了功能模块,新增了组间比较、生物标志物分类及功能预测分析(图 4A–E)。属水平热图揭示了粪便、牙菌斑与唾液样本间的微生物群落组成差异(图 4A)。带有进化距离的系统发育树展示了各组的 ASV 分布(图 4B)。基于 ggClusterNet 构建的共现网络揭示了 ASV 间的相互作用,其中紫色表示正相关,绿色表示负相关(图 4C)。基于已发表的 PacBio 数据,随机森林模型 用于识别微生物生物标志物,柱状图显示了各属的重要性(按门水平着色),内嵌折线图用于指导最佳标志物的选择(图 4D)。该流程集成了生物标志物识别模块,可直接应用于后续研究。最后,功能注释结果揭示了不同组间微生物功能的显著差异,热图中蓝色表示下降趋势,红色表示上升趋势,旁边的柱状图展示了各功能在不同组间的相对丰度(图 4E)。

图 4. 使用 EasyAmplicon 2 对细菌全长扩增子数据进行高级分析

A) 热图显示不同样本中丰度排名前 50 的微生物属相对丰度。B) 带有进化距离的系统发育树显示不同样本中各扩增子序列变体(ASVs)的分布情况。内部彩色分支表示不同门,外部彩色带表示不同纲。外圈的四个条形图分别显示粪便(蓝色)、唾液(橙色)、牙菌斑(粉色)及所有样本(粪便、唾液和牙菌斑组合)(紫色)中各 ASVs 的丰度。C) 共现网络显示不同组间 ASVs 相互作用的差异。节点的不同颜色表示不同门,边的颜色表示正相关(紫色)或负相关(绿色)相互作用。D) 基于 PacBio 长读测序数据的随机森林模型获得的生物标志物。条形图表示各标志物的重要性,内部误差率折线图用于选择最优标志物数量。E) 热图结合条形图显示不同组间功能相对丰度的差异。左侧热图中,红色表示丰度增加,蓝色表示丰度下降;右侧条形图显示各功能在不同组中的相对丰度。(每组 n = 6 样本;热图结合条形图的显著性检验方法为 MaAsLin2,* 表示 p < 0.05)

自定义与交互式报告

为实现用户友好与结果可重复性,EasyAmplicon 2 提供了可自定义的 Shell 脚本文件 StatPlot.sh,用户可根据需求调整图形布局、配色方案、分类注释与统计检验方式。系统支持生成可直接用于发表的多面板图、交互式 HTML 报告以及结构化表格,用于生态或临床结果的展示与解读。

对外部工具的支持

尽管 EasyAmplicon 2 提供了完整的长读扩增子分析解决方案,它仍保持与主流第三方微生物组分析工具的兼容性,如 LEfSe、STAMP 和 PICRUSt2。中间输出结果(如 ASV 表、分类学注释文件、元数据文件)均采用标准化格式,确保可无缝导入这些平台,从而支持研究者进行扩展分析与个性化定制。

EasyAmplicon 2 的升级

EasyAmplicon 2 在多个方面进行了重要升级。首先,先前版本不支持第三代测序扩增子分析,而本版本新增了对 PacBio 与 Nanopore 长读数据的全面支持,同时对短读分析流程进行了进一步优化。其次,EasyAmplicon 2 提供了面向主流长读数据集的用户友好流程,集成了 NanoFilt、Cutadapt、Emu 等核心软件,实现从质量控制、去噪到分类注释的完整分析链。第三,新增的 R 脚本可快速生成高质量图表,适用于短读与长读数据;同时支持多个主流数据库(如 GTDB、Emu),并优化了不同数据库之间的格式转换,显著提升了注释的灵活性与兼容性。

此外,GitHub 文件结构重新组织,新增 “Nanopore” 与 “PacBio” 文件夹用于长读数据分析与结果输出,并引入基于 Snakemake 的自动化工作流(位于 “Snakemake”文件夹中)。用户手册亦已全面更新(https://github.com/YongxinLiu/EasyAmplicon/wiki),涵盖软件依赖安装、多种分析流程、快速入门指南及可视化方法。

EasyAmplicon 2 在长读扩增子数据分析中实现了关键创新。其同时支持 PacBio 与 ONT 平台,采用先进的去噪算法,实现从单次测序到物种水平的分辨率;在统一工作流中无缝集成分类学、生态学与功能学分析;并可通过直观界面自动生成 30 余种高质量可发表图形,消除编程门槛。此外,EasyAmplicon 2 还在 R 框架中集成了生物标志物发现与网络分析模块,为微生物群落研究提供了全面、可靠且易用的解决方案。

短读分析流程在物种水平的分类分辨率明显较低(在各重复中仅达理论相对丰度的 52.74%),而 PacBio(95.07%)和 ONT(85.39%)流程则实现了更高的物种水平准确性(图 S3B,支持信息)。在使用相同模拟数据对比现有第三代扩增子分析流程时,EasyAmplicon 2 在 PacBio 和 ONT 数据上分别达到了理论相对丰度的 96.27% 和 85.39%,明显优于其他流程:PacBio 数据中,ampliseq 为 23.94%,Hifi-16S-workflow 为 30.30%;ONT 数据中,NanoCLUST 为 23.31%,TRANA 为 81.80%(图 S3C,D,支持信息)。此外,其他流程中错误注释的物种(即模拟群落中不存在的物种)的相对丰度均高于 EasyAmplicon 2。以 PacBio 模拟数据为例,错误率分别为 ampliseq 41.03%、Hifi-16S-workflow 16.06%,而 EasyAmplicon 2 仅为 3.73%(图 S3C,支持信息);Nanopore 模拟数据中,错误率分别为 NanoCLUST 56.04%、TRANA 18.19%,而 EasyAmplicon 2 为 14.61%(图 S3D,支持信息)。总体而言,EasyAmplicon 2 中实现的第三代扩增子分析流程在微生物物种注释方面表现出更高的准确性。

讨论

长读测序技术的快速发展,尤其是 PacBio 和 ONT 平台的应用,已经彻底改变了微生物生态学研究,使全长扩增子测序成为可能。与仅针对基因部分区域的传统短读方法不同,这些技术能够获取完整的 16S rRNA 基因及其他标记区域,从而在物种水平上实现前所未有的分类学分辨率。然而,长读扩增子测序在应用过程中仍面临多种计算挑战,包括相对较高的测序错误率(约 5–15%)、与现有短读分析流程的不兼容,以及缺乏标准化分析框架。

为应对这些挑战,我们开发了 EasyAmplicon 2,一个模块化、用户友好的流程,专门用于长读扩增子数据分析。基于前一版本的成功经验,EasyAmplicon 2 集成了最新的误差校正和分类学算法,同时增强了可视化功能。该流程有效弥合了短读与长读分析流程之间的差距,并保持了与现有微生物组分析工具和数据库的兼容性。

第三代扩增子测序(PacBio/ONT)具有覆盖全长 16S/ITS 的优势,可在属及物种水平提供更高分辨率,同时减少短片段测序引起的误分类。然而,其较高的原始错误率和通常较低的测序深度可能限制低丰度菌群的检测,因此计算流程(如环状一致性测序结合 DADA2)对于误差校正至关重要。尽管多项研究表明长读平台在物种注释上优于短读平台,短读测序仍在稳定丰度估计和稀有物种检测方面具有优势。第三代与短读注释流程在属水平丰度上的差异,可能来源于读长与测序准确性、引物偏倚、数据库覆盖范围、分类方法以及下游归一化或过滤方法的不同。在本研究中,通过模拟数据并采用相同注释方法,我们同样观察到短读与长读序列在属水平丰度上的差异,这可能反映了读长、测序准确性或引物偏倚的影响。综合考虑,我们推荐在微生物扩增子研究中使用第三代测序,以获得显著提升的物种水平分辨率。EasyAmplicon 2 的分析进一步确认,使用长读扩增子数据能够显著提高物种水平注释率。通过整合最新数据库和软件,流程实现了更高的注释准确性。

为节省时间,EasyAmplicon 2 提供了两种软件下载途径:一种来自 Nature Microbiology Data Center,另一种通过百度网盘。同时,我们更新了长读数据分析所需的软件和 R 包,并提供了详细的操作指南和分步说明。其简化安装流程与用户友好设计显著提高了长读扩增子数据分析的整体效率。流程计算效率高,可在普通笔记本上运行,同时兼容高性能计算环境。这种易用性结合基于 Markdown 的报告生成和与 QIIME 2、LEfSe、STAMP 等标准化输出的兼容性,使 EasyAmplicon 2 在促进可重复研究方面具有重要价值。

随着长读测序的广泛关注与应用,已有多条流程和在线平台用于处理此类数据,包括 TRANA、HiFi16S-workflow、ampliseq、NanoCLUST、NanaRTax、SituSeq、PRONAME 和 “long-read-tools”。然而,许多现有流程或平台并非专为长读扩增子数据设计,或尚未充分测试与优化,安装过程中也易出现难以解决的错误。为克服这些限制,EasyAmplicon 2 集成了用于分析 PacBio 与 Nanopore 数据的常用方法,并验证了注释准确性。本研究的比较分析显示,EasyAmplicon 2 在微生物物种注释方面优于其他流程,其优势主要来源于整合了最新软件与数据库,为扩增子数据分析提供了更准确、用户友好的解决方案。此外,不同于仅关注 PacBio 或 Nanopore 数据的流程,EasyAmplicon 2 提供了一个涵盖两类第三代扩增子数据的综合框架,并配套多样化可视化工具。

尽管 EasyAmplicon 2 在物种水平注释上表现优异,但比较结果可能受工具与软件选择的影响,因此应谨慎解读。总体而言,我们的研究表明,EasyAmplicon 2 是一个稳健且多功能的微生物扩增子分析流程。尽管现有比较结果显示了其在扩增子数据分析中的优势,仍有若干方面可进一步改进。未来发展将聚焦三大方向:1)对现有长读扩增子分析软件进行基准测试,以进一步优化流程;2)提升超深度测序数据(>1000万条序列)处理的计算效率;3)扩展功能,增加对多种标记基因的支持,以及提供更多长读扩增子数据的分析与可视化选项。此外,云端部署方案正在开发中,以便于大规模协作研究;同时,计划建设支持短读与长读数据的在线分析平台,为无编程经验的用户提供更高的可访问性。

结论

综上所述,EasyAmplicon 2 为分析来自长读测序平台的全长扩增子数据提供了强大、全面且易于使用的解决方案。该流程具有高操作效率,并支持多平台(Illumina、PacBio、Nanopore)数据,提供从质量控制、降噪、分类学注释、群落多样性分析、标志物检测到功能预测的全流程整合分析。通过支持主要分类数据库并提供无缝的可视化选项,EasyAmplicon 2 使研究者能够揭示微生物群落的详细生态模式和功能机制。随着全长测序在微生物生态学、临床微生物组学、农业以及环境科学中的应用不断扩大,EasyAmplicon 2 将成为高分辨率扩增子分析的关键工具,使复杂微生物组的结构与功能研究更加深入。

方法部分

流程实现与架构

EasyAmplicon 2 采用模块化架构,将 Shell 脚本用于核心处理任务,R 用于统计分析和可视化。双语言设计确保了大规模数据处理的计算效率,同时提供了高级统计分析的灵活性。流程支持两种操作模式:1)命令行界面,用于批量处理大型数据集;2)交互式 RStudio 界面,用于探索性分析和可视化。此外,我们利用 Snakemake 工作流管理系统实现了 EasyAmplicon 2 的自动化版本,支持任务调度、依赖跟踪及并行执行,进一步增强了可移植性和可重复性。跨平台兼容性已在 Windows(通过 Git Bash)、macOS 和 Linux 系统中验证。

数据来源与测序平台

本研究使用的测序数据来源于已发表的扩增子测序项目,涵盖三类人体微生物组样本(肠道、龈下菌斑生物膜及唾液)以及环境样本。这些数据涵盖 Illumina、PacBio 和 ONT 三大主要测序平台。Illumina 与 PacBio 数据均来自相同的人体样本(III–IV 期 A–B 级牙周炎患者),便于不同测序策略的直接比较。Illumina 数据通过 MiSeq 平台扩增 16S rRNA 基因 V3–V4 区域生成标准双端短读序列,而 PacBio 数据通过 Sequel II 平台的环状一致性测序(CCS)技术获得高精度全长 16S rRNA 序列。此双平台设计有助于深入评估不同测序技术对微生物多样性分辨率的影响。

ONT 数据来源于一个环境微生物组研究,涵盖四个采样点(南、北、东及室外)。文库构建与测序使用 Oxford Nanopore 16S 条形码套件(SQK-16S024)、流动池预处理套件(EXP-FLP002)及 MinION R9 流动池(FLO-MIN106D)。基于 GPU 的 Guppy 软件(v6.4.6)完成碱基调用与去重混合。序列经质量及长度过滤,保留长度在 1300–1650 bp 且平均 Q 值 ≥10 的读段,同时收集对应环境参数以支持后续生态与统计分析。

数据处理

原始 FASTQ 数据(来自 PacBio、ONT 或 Illumina 平台)经过优化的质量控制流程,包括双端数据的读段合并、质量过滤(Q 值 ≥20)以及接头去除,针对不同测序技术调整参数。对于长读数据,采用混合误差校正策略:PacBio HiFi 读段使用 CCS,Nanopore 数据结合信号级对齐进行自适应校正。序列去重与嵌合体去除基于 SILVA 138.2 数据库进行。降噪过程采用优化的 DADA2 算法并针对平台参数化,同时保留传统 97% 相似度 OTU 聚类方法。

分类学与系统发育分析

16S rRNA 基因序列的分类学注释采用三种方式:1)使用 VSEARCH 中的 SINTAX 算法进行快速参考数据库比对;2)DADA2 降噪并生成 ASV,再通过参考数据库进行分类;3)Emu 默认数据库及其内置分类器,并对数据库格式进行适配以兼容不同工作流程。三种方法可独立或组合应用。系统发育重建使用最大似然法,并通过自助法评估分支可靠性。

验证分析

为比较 EasyAmplicon 2 与 1.0 版本并评估流程准确性,使用模拟样本进行验证。模拟数据集来源于已发表研究。EasyAmplicon 2 的短读扩增子流程与 PacBio 流程均使用 Emu 默认数据库进行注释比较。为进一步展示流程性能,还与现有第三代扩增子分析流程(TRANA、HiFi16S-workflow、ampliseq、NanoCLUST)进行了基准测试,并比较成功执行流程的注释准确性。关于模拟数据的使用与比较细节,请参见附件支持信息。

统计分析

所有数据均使用 R 软件(v4.3)进行分析。分析框架包括全面的多样性评估,其中 α 多样性指标包括 Shannon 指数、Simpson 指数和 Chao1 指数,β 多样性指标包括加权/非加权 UniFrac 距离以及 Bray–Curtis 相异性。组间 α 多样性的差异采用双侧 Wilcoxon 秩和检验进行评估,β 多样性差异则使用 PERMANOVA(置换多元方差分析)进行显著性检验。差异丰度分析使用线性判别分析效应量(LEfSe)方法。具体而言,首先应用非参数 Kruskal–Wallis 秩和检验检测组间丰度存在显著差异的物种;对于显著物种,再使用 Wilcoxon 秩和检验评估亚组间的一致性。随后,通过线性判别分析(LDA)评估每个特征的效应量(LDA 分数)。标志物鉴定也采用随机森林分类方法进行。共现网络分析使用 ggClusterNet 2 构建,而功能预测则采用 PICRUSt2。MaAsLin 2 用于检测组间功能丰度的差异。可视化部分通过 ggplot2 实现,并结合 phyloseq 和 amplicon 扩展,以生成标准化的出版级 PDF 图。管线还支持生成带参数追踪和可自定义 RMarkdown 模板的交互式 HTML 报告,以确保结果可重复性。所有定量数据以均值 ± 标准误(mean ± SEM)表示,p 值 < 0.05 被认为具有统计学显著性。

伦理声明

本研究不涉及伦理审批,因为使用的所有样本均为公开可获取的开放获取数据。

作者简介

基因组所博士研究生罗豪、助理研究员白德凤、博士后朱志豪、Salsabeel Yousuf、硕士研究生荀佳妮、曾美尹、青岛农大联培硕士杨海飞为该论文的共同第一作者。基因组所刘永鑫研究员、白德凤助理研究员、遗传发育所李小方研究员、宁大一附院陈夏研究员、中医科学院陈同副研究员、南农文涛副教授、香港理工甘人友教授和为论文的共同通讯作者。刘永鑫、李小方、陈夏、陈同、文涛、甘人友、白德凤等共同构思并协调了本研究的整体工作,罗豪和白德凤负责流程代码开发的总体实施规划。朱志豪主导了部分Nanopore分析流程的开发,并进行了整体代码测试。Salsabeel Yousuf和杨海飞主导了PacBio分析流程的开发,并参与了整体代码测试。罗豪、白德凤、朱志豪、Salsabeel Yousuf和杨海飞撰写了论文的初稿。其他所有作者参与了流程测试和论文修改。

第一作者简介

罗豪

罗豪,中国农业科学院深圳农业基因组研究所,在读博士研究生;研究方向为微生物组方法开发与应用,在iMeta、Advanced Science、iMetaOmics、GigaScience、aBIOTECH等期刊发表论文8篇,其中第一/共同第一作者5篇。

白德凤

白德凤,中国农业科学院农业基因组研究所助理研究员。博士毕业于中国科学院动物所,目前研究方向为微生物组方法开发和应用,在iMeta、Advanced Science等发表论文20篇,2篇入选ESI高被引论文,以第一作者(含共同)发表论文10篇,其中SCI论文9篇,近5年以第一作者(含共同)发表SCI论文8篇,累计IF>155,单篇最高影响因子33.2。获得软件著作权登记证书两项(均排名第二)。担任iMeta青年编委。获得深圳市大鹏新区“D”类人才。

朱志豪

朱志豪,博士后,中国农科院深圳基因组所/广东医科大学。研究方向为长寿老人肠道功能益生菌株的多组学挖掘,以第一作者(含共同)在iMeta、Advanced Science等期刊发表SCI论文7篇。

Salsabeel Yousuf

Salsabeel Yousuf,中国农业科学院深圳农业基因组研究所博士后。研究横跨动物科学、育种、繁殖、遗传学和微生物学。在iMetaOmics、Cells、Ovarian research等著名SCI期刊以第一作者(含合著者)发表SCI论文15篇。

杨海飞

杨海飞,青岛农业大学硕士研究生。目前研究方向为食物微生物组,在iMeta、Advanced Science等发表论文7篇,以第一作者(含共同)发表论文4篇,获软件著作权登记证书两项。

荀佳妮

荀佳妮,中国农科院基因组所生物信息学硕士在读,本科毕业于华北理工大学生物信息学专业。主要研究方向为宏基因组数据分析及挖掘。在iMeta、Advanced Science等期刊发表文章6篇,其中第一作者(含共同)4篇,2篇入选ESI高被引论文。

曾美尹

曾美尹,中国农业科学院深圳基因组所硕士研究生在读,曾以第一作者身份在iMetaOmics发表文章“Unveiling microbial communities with EasyAmplicon: A user-centric guide to perform amplicon sequencing data analysis”,研究方向为基于宏基因组筛选传统发酵食品中的抗炎益生菌。

通讯作者简介

甘人友

甘人友博士,担任香港理工大学理学院食品科学及营养系助理教授&校长青年学者,iMetaOmics执行主编。博士毕业于香港大学,曾担任新加坡A*STAR下属新加坡食品与生物技术创新研究院研究员。主要从事食品与肠道菌群互作机制及相关健康效应的应用基础研究。在iMeta、Engineering等发表论文200多篇,30篇入选ESI高被引论文,获批专利20余项。

文涛

文涛,南京农业大学钟山青年研究员,iMeta期刊青年编委。研究方向为微生物组学等多组学分析方法开发及其流程构建,微生物与植物健康,全球微生物跨界传播与生物健康。先后主持国家自然基金青年基金,中国博士后创新人才支持计划,江苏省青年基金,国家自然基金联合重点课题,国家重点研发子课题等项目。在iMeta、Nature Communications、ISME J、Microbiome、Protein & Cell、New Phytologist、Fundamental Research、等期刊上发表了十余篇篇论文。开发了ggClusterNet、EasyStat、EasyMultiOmics等R包,Easyamplicon、Easymetagenome、EasyMetaPro等组学分析流程。iMeta期刊青年编委,土壤学会土壤生物和化学专业委员会青年委员。获大北农科技奖青年科技创新奖,博士后业绩评估I档资助等奖励。

陈同

陈同,博士,中国中医科学院副研究员,道地药材品质保障与资源持续利用全国重点实验室青年 PI,iMeta执行主编 (IF 33.2),创立生信宝典公众号 (16万+关注),连续三年入选全球前2%顶尖科学家。聚焦中药资源数据整合和开发研究,在 iMeta, Cell Stem Cell (封面文章),Nucleic Acids Research,Nature communications, Protein & Cell等高水平杂志以第一或通讯作者发表文章十二篇,累积引用 5000 +次;开发在线绘图和分析平台 ImageGP、BIC、EVenn、植物整合基因组平台IMP (获中华中医药学会 2023 年年度十大学术进展之一),使用超 300 万人次,3 篇文章获评科睿唯安 ESI 高被引论文(Top 1%)。

陈夏

陈夏,宁波大学附属第一医院致和科创中心主任。聚焦肠道微生物与妇产疾病的机制研究、临床转化及复杂妇产疾病精准诊疗。以第一或通讯作者在Gut、Immunity、Nature Communications、Cell Reports Medicine等著名国际期刊发表论文20余篇,其中ESI高被引论文4篇,入选国家级青年人才项目。兼任中国妇幼保健协会妇科泌尿与盆底重建专业委员会副主任委员、中国医师协会妇产医师分会普通妇科组委员。主持多项国家自然科学基金项目,获授权国家发明专利3项,相关成果为女性生殖障碍疾病防治提供全新理论依据与干预策略。

李小方

李小方(Xfli@sjziam.ac.cn),中国科学院遗传发育所农业资源研究中心研究员,2019-2024兼任盐城土壤生态研究所副所长、所长,2023-2024任作物遗传与育种研究室主任。团队开展农业环境生物技术研究,以全链条创新为特色。近年针对华北镉麦防控开展了系列技术研发,在低镉作物和促生微生物方向取得显著进展。促生微生物方面的发现开辟了使用微生物创制小麦广谱抗逆表型的新路径。迄今发表SCI论文近60篇,获批专利17件,转化6件并孵化国家高新技术企业一家。

刘永鑫

 

刘永鑫,中国农科院深圳基因组所研究员,iMeta执行主编。聚焦微生物组方法开发、功能挖掘和科学传播,在Nature Biotechnology、Nature Microbiology等发表论文80篇,14篇入选ESI高被引论文,被引29000+次,入选全球前2%科学家榜单、国家级青年人才项目。兼任中国微生物组、计算合成生物学专委会委员,创办18万+同行关注的宏基因组公众号,主编《微生物组实验手册》专著,发起iMeta 期刊(IF 33.2),位列全球前千分之三。兼职为Cell子刊、NC、NAR、Microbiome等期刊审稿360余次。

期刊介绍:

Advanced Science 是 Wiley旗舰期刊 Advanced 系列中的一种完全开放获取的跨学科科学期刊,发表材料科学、物理、化学、医学、生命科学、环境科学、工程和社会科学等领域的前沿基础和应用研究。我们的使命是通过开放获取出版,使前沿创新的科学研究具有更广泛的可访问性。Wiley 的 Advanced 系列是全球公认的高影响力期刊系列,传播来自资深和青年研究人员的科学成果,帮助他们实现使命并扩大科学发现的影响力。

Advanced Science 2025年影响因子为14.1,五年平均影响因子为15.6,期刊引文指标1.74,CiteScore 为 18.1。在 2025年中国科学院院文献情报中心期刊分区表中,Advanced Science 入选综合类期刊一区TOP。

 
 
 
特别声明:本文转载仅仅是出于传播信息的需要,并不意味着代表本网站观点或证实其内容的真实性;如其他媒体、网站或个人从本网站转载使用,须保留本网站注明的“来源”,并自负版权等法律责任;作者如果不希望被转载或者联系转载稿费等事宜,请与我们接洽。
 
 打印  发E-mail给: 
    
 
相关新闻 相关论文

图片新闻
青藏高原首个综合性汞数据集发布 科学家首次观测到“系外月球”
里程碑:一系法实现杂交稻不再年年制种 地球磁层“调速”,让月背“晒太阳”更深
>>更多
 
一周新闻排行
 
编辑部推荐博文