生物信息学是把高通量测序产出的原始读长,一步步还原成变异、表达量与结构结论的计算流水线。本专题覆盖完整工程链路:生信数据流与文件格式生态、二代与三代测序原理、FASTQ 质控与预处理、序列比对算法与 BWA、SAM/BAM 格式与 samtools、变异检测与 VCF 处理、RNA-seq 转录组分析、Nextflow 与 nf-core 流程编排、单细胞测序分析、系统发育建树、蛋白质结构预测,以及可复现性与容器化实践。
📚 专题导览
本专题共 18 篇,前 12 篇按「概览 → 基础 → 预处理 → 比对 → 分析 → 流程 → 工程」的顺序组织,后 6 篇为补充进阶内容(组装 → 宏基因组 → 表观 → 注释 → 蛋白 → 多组学),建议按表序通读:
| 阶段 | 文章 | 技术要点 |
|---|---|---|
| 概览 | 生物信息学工程全景 | 生信数据流全景、中心法则、文件格式与工具生态 |
| 基础 | 测序技术原理与数据产出 | 二代与三代测序原理、读长与质量、数据量估算 |
| 预处理 | FASTQ 质控与预处理 | FASTQ 格式解析、质量评估、接头修剪与过滤 |
| 比对 | 序列比对:BWA 与比对算法 | BWA 与比对算法、索引构建、比对率与质量指标 |
| 比对 | SAM/BAM 格式与 samtools 实战 | SAM/BAM 格式、samtools 常用操作、排序与去重 |
| 分析 | 变异检测与 VCF 处理 | 变异检测流程、GATK 最佳实践、VCF 注释与过滤 |
| 分析 | RNA-seq 转录组分析流程 | RNA-seq 定量、差异表达分析、功能富集 |
| 流程 | 生信流程编排:Nextflow 与 Snakemake | Nextflow 与 Snakemake、nf-core 生态、资源估算 |
| 分析 | 单细胞测序数据分析 | 单细胞测序流程、降维聚类、细胞类型注释 |
| 分析 | 系统发育与进化分析 | 多序列比对与建树、进化模型、置信度评估 |
| 分析 | 蛋白质结构预测与 AlphaFold 应用 | 蛋白质结构预测、AlphaFold 使用、结构比对 |
| 工程 | 生信可复现性与容器化 | 可复现性保障、容器与版本锁定、参考基因组管理 |
| 组装 | 基因组组装 | de Bruijn 图与 OLC、k-mer 纠错、contig/scaffold 与 gap 填补、Hi-C 挂载、BUSCO/QUAST 评估 |
| 宏基因组 | 宏基因组与微生物组 | 16S 与全宏基因组取舍、Kraken2/MetaPhlAn 分类、HUMAnN 功能注释、低生物量与污染控制 |
| 表观 | 表观基因组与染色质分析 | ChIP-seq/ATAC-seq 质控、MACS2 峰值检测与 IDR、motif 富集、差异结合与 Hi-C 概览 |
| 注释 | 变异注释与临床解读 | VEP/snpEff 流程、gnomAD/ClinVar 整合、ACMG 判读准则、SV/CNV 注释与报告生成 |
| 蛋白 | 蛋白质组学与质谱分析 | LC-MS/MS 与数据格式、肽段鉴定与 FDR、label-free/iTRAQ/TMT/DIA 定量、PTM 与蛋白推断 |
| 多组学 | 多组学整合与批次效应 | 多组学整合策略、批次效应校正 ComBat/limma、降维聚类、MOFA 与调控网络推断 |