宏基因组测序

宏基因组测序介绍及核心生信分析图

宏基因组测序(Metagenomic Sequencing)是对特定环境样本中 全部微生物(细菌、古菌、真菌、病毒等)的总 DNA 进行无靶向高通量测序,无需分离培养单个微生物,即可全面解析样本中微生物的 物种组成、基因功能、代谢通路及互作网络。其核心优势是 “无偏性” 和 “全面性”,不仅能揭示微生物群落的物种多样性,还能深入挖掘功能潜力,广泛应用于肠道微生物、环境生态、农业土壤、工业发酵、疾病诊断等领域。

一、宏基因组测序核心基础

1. 技术原理与核心特点

  • 核心逻辑:直接提取环境样本(如肠道粪便、土壤、水体)中的总微生物 DNA,构建基因组文库后进行高通量测序(Illumina NovaSeq/HiSeq、PacBio HiFi、Nanopore 等平台),通过生物信息学分析拼接微生物基因组、注释物种和功能。
  • 与扩增子测序的区别:
    对比维度      宏基因组测序 扩增子测序
    测序对象 全部微生物总 DNA(无靶向) 特定目标基因(如 16S rRNA、ITS)
    物种覆盖 细菌、古菌、真菌、病毒、原生生物(全面) 仅目标基因对应的类群(如 16S 对应原核)
    核心产出 物种组成 + 基因功能 + 代谢通路 + 微生物基因组(MAGs) 物种组成 + 多样性(无直接功能信息)
    优势 无偏性、功能解析深入、可组装微生物基因组 成本低、周期短、物种分类快速
    适用场景 功能机制研究、新物种挖掘、复杂群落解析 大规模样本筛查、物种多样性快速评估

2. 核心分析流程

  1. 样本处理:提取微生物总 DNA(需保证纯度和完整性,避免宿主 DNA 污染);
  2. 文库构建:打断 DNA 片段(Illumina 平台常用 350bp 插入片段),连接接头和 barcode;
  3. 高通量测序:生成短读长(Illumina)或长读长(PacBio/Nanopore)测序数据;
  4. 生信分析核心步骤:
    • 数据质控:过滤低质量序列、宿主 DNA(如人源、植物源)、污染序列;
    • 序列组装:拼接 contig/scaffold(可选择 “组装后分箱” 或 “分箱后组装”);
    • 微生物分箱(Binning):将拼接序列分配到不同微生物基因组(MAGs,宏基因组组装基因组);
    • 物种注释:基于 MAGs 或 reads 直接比对,实现门到种水平的物种分类;
    • 功能注释:注释基因的 COG/KOG、KEGG、CAZy、VFDB(毒力因子)等功能数据库;
    • 差异分析:比较分组间的物种丰度、功能基因丰度、代谢通路差异。

3. 核心分析目标

  • 物种全景:样本中所有可检测微生物的种类、丰度及分布(含难培养 / 未培养微生物);
  • 功能解析:微生物群落携带的功能基因库、核心代谢通路(如碳代谢、氮循环、耐药基因);
  • 基因组挖掘:组装高质量 MAGs(完成度≥90%,污染率≤5%),发现新物种或功能菌株;
  • 差异机制:不同分组(如健康 vs 疾病、处理 vs 对照)的物种 / 功能差异及关联机制。

二、宏基因组测序核心生信分析图(按分析逻辑分类)

(一)数据质控与预处理图(验证数据可靠性)

用于筛选高质量数据、去除干扰(宿主污染、低质量序列),为后续组装和注释奠定基础。
  1. 测序数据质量分布图(FastQC/Trimmomatic 图)
    • 核心用途:评估原始测序数据的碱基质量、GC 含量、接头污染情况。
    • 解读要点:
      • 碱基质量值(纵轴):所有位置 Phred 质量值≥20(合格),≥30(优质),避免末端低质量序列影响组装;
      • GC 含量分布(辅助图):若出现异常峰(如宿主 DNA 的 GC 峰),提示需加强宿主去除;
      • 接头污染:Adapter 含量需≤1%(超标需用 Cutadapt 工具去除)。
    • 示例:Illumina NovaSeq 测序数据,150bp 读长的前 120bp 质量值≥30,末端 30bp 质量值≥25,无明显接头污染,数据合格。
  2. 宿主 DNA 去除效率图
    • 核心用途:展示宿主(如人、小鼠、植物)DNA 的去除效果(宏基因组样本常含宿主污染,需优先去除)。
    • 解读要点:常用饼图或柱状图展示 “去除前宿主 DNA 占比” 与 “去除后占比”,合格标准为去除后宿主 DNA 占比≤5%(肠道样本宿主 DNA 占比易偏高,需用专门去宿主工具如 Bowtie2、Kraken2 筛选)。
    • 示例:人肠道样本去除前宿主 DNA 占比 68%,去除后降至 3.2%,满足分析要求。
  3. 序列组装质量评估图
    • 核心用途:验证 contig/scaffold 的组装完整性和可靠性(组装质量直接影响后续分箱和注释)。
    • 常用指标与图表:
      • N50 长度(Contig N50):箱线图展示各样本的 Contig N50 分布(N50≥1kb 为合格,≥5kb 为优质,越长说明组装越完整);
      • 组装序列长度分布直方图:横轴为 Contig 长度,纵轴为序列数量,优质组装应呈现 “少量长 Contig + 大量中短 Contig”,无过多短片段(<200bp)。
    • 示例:样本 Contig N50 中位数为 8.2kb,最长 Contig 达 50kb,组装质量良好。

(二)物种组成分析图(解析 “有哪些微生物”)

全面展示样本中微生物的物种分类及丰度分布,兼顾细菌、古菌、真菌、病毒等所有类群。
  1. 物种组成堆叠柱状图(门 / 属 / 种水平)
    • 核心用途:展示不同样本在特定分类水平的物种丰度占比,直观对比分组间优势物种差异。
    • 解读要点:
      • 横轴为样本(按分组排列),纵轴为物种丰度占比(0-100%);
      • 不同颜色代表不同物种(门 / 属 / 种),“Others” 归类低丰度物种(占比 < 1%);
      • 重点关注:核心优势物种(如肠道样本中拟杆菌门、厚壁菌门)、分组特异性物种(如疾病组特有的致病菌)、稀有物种的分布。
    • 示例:健康组肠道样本以拟杆菌门(42%)、厚壁菌门(38%)为优势门;疾病组中厚壁菌门降至 25%,变形菌门(含致病菌)升至 30%,提示菌群失调。
  2. 物种丰度热图(属 / 种水平)
    • 核心用途:聚焦高丰度物种(如前 50 个属)或差异物种,展示其在不同样本中的丰度聚类模式。
    • 解读要点:
      • 横轴为样本(带分组聚类树),纵轴为物种(带物种进化树);
      • 颜色深浅代表标准化后的丰度(红色 = 高丰度,蓝色 = 低丰度);
      • 核心结果:样本聚类与分组一致(验证分组合理性),物种聚类可识别 “协同丰度变化的物种模块”(如 A 属与 B 属始终共丰度,可能存在互作关系)。
  3. 物种分布气泡图(属 / 种水平)
    • 核心用途:展示 “样本 - 物种” 的丰度关联,适合多样本、多物种的可视化(比热图更适合展示低丰度物种)。
    • 解读要点:
      • 横轴为样本,纵轴为物种;
      • 气泡大小代表物种丰度(越大丰度越高),气泡颜色代表分组;
      • 优势:直观展示某一物种在不同样本中的丰度梯度(如 C 属在健康组样本中气泡大,疾病组气泡小,提示丰度显著下降)。
  4. 病毒 / 真菌特异性组成图(针对特殊研究目标)
    • 核心用途:单独展示病毒、真菌等特定类群的组成(宏基因组可同时捕获这些类群,扩增子测序难以覆盖)。
    • 示例:病毒组成堆叠图(按病毒科水平),显示健康组以温和噬菌体为主(占比 75%),疾病组烈性噬菌体占比升至 50%,提示噬菌体群落与疾病相关。

(三)多样性与群落差异分析图(解析 “微生物群落差异”)

与扩增子测序逻辑类似,但覆盖所有微生物类群,结果更全面。
  1. α 多样性分析图(样本内多样性)
    • 核心指标:Observed species(观测物种数)、Shannon 指数(丰富度 + 均匀度)、Simpson 指数(优势度)、Faith's PD(系统发育多样性)。
    • 常用图表:箱线图 / 小提琴图(按分组展示指标分布)
      • 解读要点:横轴为分组,纵轴为多样性指数;若两组间存在显著差异(ANOVA/Kruskal-Wallis 检验 P<0.05),说明样本内微生物丰富度或均匀度不同。
      • 示例:健康组 Shannon 指数中位数为 7.8,疾病组为 5.2(P=0.003),提示疾病状态显著降低肠道微生物多样性。
  2. β 多样性分析图(样本间多样性)
    • 核心逻辑:基于物种组成矩阵(Bray-Curtis、Jaccard 距离)或功能基因矩阵,展示样本间群落差异。
    • 常用图表:
      (1)主坐标分析(PCoA 图)
      • 解读要点:横轴(PC1)和纵轴(PC2)解释的差异比例越高,图表可靠性越强;同一分组样本聚集、不同分组分离,说明分组间群落结构差异显著(PERMANOVA 检验 P<0.05)。
      • 示例:Bray-Curtis 距离 PCoA 图中,健康组与疾病组样本完全分离,PC1 解释 62.4% 差异(P=0.001),证明两组微生物群落结构极显著不同。
        (2)非度量多维尺度分析(NMDS 图)
      • 解读要点:应力值(Stress)<0.2 为合格,<0.1 为优秀;适合非正态分布的宏基因组数据,更稳健。

(四)宏基因组特有分析图(分箱与 MAGs 分析)

宏基因组的核心优势的之一是能组装微生物基因组(MAGs),以下图表聚焦 MAGs 质量和功能。
  1. MAGs 质量评估散点图(CheckM 评估)
    • 核心用途:展示组装的 MAGs 的 “完成度(Completeness)” 和 “污染率(Contamination)”,筛选高质量 MAGs。
    • 解读要点:
      • 横轴为完成度(越高越好,≥90% 为优质),纵轴为污染率(越低越好,≤5% 为优质);
      • 每个点代表一个 MAG,颜色代表物种门水平分类;
      • 筛选标准:完成度≥70%、污染率≤10%(合格),完成度≥90%、污染率≤5%(优质,可用于后续功能解析)。
    • 示例:共组装获得 32 个 MAGs,其中 15 个为优质 MAGs(完成度 92%-98%,污染率 1.2%-3.8%),分属拟杆菌门、厚壁菌门等 6 个门。
  2. MAGs 物种分类树(Phylogenetic Tree)
    • 核心用途:展示高质量 MAGs 的系统发育地位,判断是否为新物种。
    • 解读要点:
      • 基于保守基因(如 16S rRNA、核糖体蛋白基因)构建进化树,结合已知参考基因组标注;
      • 若某 MAG 与所有参考基因组的进化距离较远(形成独立分支),提示可能是未报道的新物种。
    • 示例:MAG-08 与拟杆菌门已知物种的序列相似性仅 85%,形成独立分支,推测为新物种。
  3. MAGs 功能基因富集热图
    • 核心用途:比较不同 MAGs 携带的核心功能基因(如耐药基因、降解酶基因)的丰度差异。
    • 解读要点:
      • 横轴为 MAGs(按物种聚类),纵轴为功能基因(如 β- 内酰胺类耐药基因、纤维素降解酶基因);
      • 颜色深浅代表基因拷贝数或丰度,可快速定位 “功能特异性 MAGs”(如 MAG-12 携带大量耐药基因,可能是耐药菌株)。

(五)功能解析分析图(解析 “微生物功能潜力”)

宏基因组的核心价值在于功能挖掘,以下图表聚焦基因功能、代谢通路的分布与差异。
  1. 功能基因分类柱状图 / 堆叠图(COG/KEGG Level 1/2)
    • 核心用途:展示样本中功能基因在不同功能大类 / 亚类的丰度分布。
    • 解读要点:
      • 以 COG 为例:横轴为 COG 功能大类(如 J = 翻译、K = 转录、E = 氨基酸代谢、P = 无机离子转运),纵轴为基因丰度占比;
      • 重点关注:分组间差异显著的功能类别(如疾病组 “防御机制(V 类)” 基因占比显著升高,提示耐药或应激功能增强)。
    • 示例:土壤样本中,处理组(施加农药)的 “解毒功能(Q 类)” 基因占比从 5% 升至 12%,提示微生物群落通过增强解毒功能适应农药胁迫。
  2. KEGG 代谢通路富集气泡图 / 网络图
    • 核心用途:展示差异功能通路的富集情况,聚焦关键代谢通路(如碳代谢、氮循环、耐药通路)。
    • 解读要点:
      • 气泡图:横轴为富集倍数,纵轴为 KEGG 通路名称(如 “ABC 转运蛋白通路”“青霉素生物合成通路”),气泡大小 = 功能基因数量,颜色 = Padj 值(越红越显著);
      • 通路网络图:节点代表通路,线条代表通路间的关联(如代谢物互通),可展示 “核心功能通路模块”(如肠道样本中 “糖代谢 - 氨基酸代谢” 通路模块在健康组更活跃)。
  3. 功能基因热图(核心功能基因集)
    • 核心用途:聚焦特定功能基因集(如耐药基因 ARGs、碳水化合物活性酶 CAZy、毒力因子 VFDB),展示其在不同样本中的丰度差异。
    • 解读要点:
      • 横轴为样本,纵轴为目标功能基因(如不同类型的 ARGs);
      • 颜色深浅代表基因丰度,可快速识别 “分组特异性功能基因”(如医院污水样本中 β- 内酰胺类 ARGs 丰度显著高于普通污水)。
  4. CAZy 酶家族分布热图(针对碳代谢研究)
    • 核心用途:展示碳水化合物活性酶(如糖苷水解酶 GH、糖基转移酶 GT、酯酶 CE)的家族分布,反映微生物降解碳水化合物的能力。
    • 示例:堆肥样本中,高温阶段 GH 家族(如 GH1、GH3)丰度显著升高,提示微生物通过分泌纤维素降解酶加速有机物分解。

(六)差异比较分析图(解析 “分组间物种 / 功能差异”)

聚焦分组间的显著差异,验证实验假设。
  1. 差异物种火山图(属 / 种 / MAGs 水平)
    • 核心用途:筛选分组间显著差异的物种(兼顾丰度倍数和统计显著性)。
    • 解读要点:与扩增子测序火山图逻辑一致,横轴为 log2 (FC),纵轴为−log10 (Padj);红色 = 显著上调物种,蓝色 = 显著下调物种。
    • 差异点:宏基因组可在种水平或 MAGs 水平筛选差异,分辨率更高(如筛选出疾病组特有的致病菌种 D,Padj=0.002)。
  2. 差异功能基因火山图
    • 核心用途:筛选分组间显著差异的功能基因(如 ARGs、代谢酶基因)。
    • 示例:共筛选出 48 个显著差异 ARGs,其中 32 个在耐药组上调(如 blaTEM 基因,FC=8.3),16 个下调,提示耐药组微生物携带更多耐药基因。
  3. LEfSe 功能富集图(功能标志物筛选)
    • 核心用途:筛选 “分组特异性功能标志物”(如某通路或基因集),适合多分组比较。
    • 解读要点:左侧为 LDA 分值(≥2 为阈值),纵轴为功能类别 / 基因集;右侧为功能层级图,展示标志物的功能归属(如筛选出健康组特有的 “丁酸合成通路”,LDA=4.5,为核心功能标志物)。

三、核心总结

  1. 技术核心:宏基因组测序以 “无靶向、全基因组覆盖” 为特点,同时产出 “物种组成” 和 “功能信息”,适合深入解析微生物群落的机制性问题;
  2. 必做核心图:物种组成堆叠柱状图、α/β 多样性分析图、MAGs 质量评估图、KEGG 功能通路富集图、差异物种 / 功能火山图;
  3. 特有优势图:MAGs 系统发育树、MAGs 功能热图、功能基因集(ARGs/CAZy)热图、代谢通路网络图(区别于扩增子测序的核心图表);
  4. 分析逻辑:从 “数据质控→组装分箱→物种组成→MAGs 解析→功能注释→差异比较” 逐步深入,核心是 “物种与功能的关联分析”(如 “某差异物种是否携带核心功能基因?”);
  5. 工具推荐:组装(Megahit、Spades)、分箱(MetaBAT2、MaxBin2、VAMB)、质量评估(CheckM)、注释(Kraken2、Metaphlan4、eggNOG-mapper、KEGG GhostKOALA)、绘图(R ggplot2、Python seaborn、Cytoscape)。
这些图表覆盖了宏基因组测序从 “数据验证” 到 “机制解析” 的全流程,是科研论文和项目报告的核心展示载体,解读时需结合样本类型和实验假设,重点突出 “物种 - 功能 - 表型” 的关联(如 “某致病菌 MAG 携带毒力因子,与疾病表型相关”)。

021-57668026