All chapters

NGS Workflow Overview

beginner

NGS Pipeline at a Glance

Standard WES Pipeline Steps

๐Ÿงช
Sample & Library Prep

DNA extraction โ†’ fragmentation โ†’ adapter ligation โ†’ capture (WES)

โšก
Sequencing

Illumina NovaSeq โ†’ FASTQ generation; target 100x mean depth

๐Ÿ”
QC & Trimming

FastQC + fastp; check Q30, adapter content, GC bias

๐Ÿ—บ
Alignment

BWA-MEM2 โ†’ hg38; sort + index BAM; flagstat QC

โš™๏ธ
BAM Processing

MarkDuplicates + BQSR; coverage metrics with mosdepth

๐ŸŽฏ
Variant Calling

GATK HaplotypeCaller GVCF mode โ†’ joint genotyping โ†’ VQSR

๐Ÿ“
Annotation

ANNOVAR/VEP; gnomAD, ClinVar, CADD, ACMG criteria

๐Ÿ“‹
Clinical Report

ACMG classification + Exomiser phenotype prioritization

End-to-End Pipeline

Sample Collection
DNA Extraction
QC (NanoDrop/Qubit/Bioanalyzer)
Library Preparation
Capture (WES)
Sequencing
FASTQ Generation
Raw QC
Trimming
Alignment
BAM Processing
Variant Calling
Filtering
Annotation
Clinical Interpretation
Report

Pre-Sequencing (Wet Lab)

  • DNA extraction: blood (EDTA tube), saliva, FFPE tissue, buccal swab
  • DNA QC: NanoDrop (purity A260/A280 โ‰ฅ1.8), Qubit (concentration โ‰ฅ50 ng/ยตL), Bioanalyzer/TapeStation (integrity DIN/RIN โ‰ฅ7)
  • Library prep: fragmentation โ†’ end repair โ†’ A-tail โ†’ adapter ligation โ†’ PCR amplification
  • WES capture: hybridisation with biotinylated baits, streptavidin bead pulldown, 2 rounds of capture
  • Library QC: Bioanalyzer peak at ~300โ€“400 bp, qPCR for quantification
  • Pooling: normalise library concentrations, pool for multiplexed sequencing

Bioinformatics Steps

  • 1. Raw QC - FastQC/MultiQC: check quality, adapter content, GC bias
  • 2. Trimming - fastp/Trimmomatic: remove adapters, low-quality bases
  • 3. Alignment - BWA-MEM2: map to hg38 reference genome
  • 4. Sort & Index - samtools sort/index: required for downstream tools
  • 5. Mark Duplicates - GATK MarkDuplicates: flag PCR duplicates
  • 6. BQSR - GATK BaseRecalibrator + ApplyBQSR: correct systematic base quality errors
  • 7. Variant Calling - GATK HaplotypeCaller: generate g.VCF per sample
  • 8. Genotyping - GATK GenotypeGVCFs: joint calling across samples
  • 9. Variant Filtration - VQSR or hard filters: remove low-quality calls
  • 10. Annotation - ANNOVAR/VEP: add functional and clinical context
  • 11. Prioritisation - filter by MAF, impact, HPO phenotype

Quality Checkpoints

  • Mean coverage โ‰ฅ100ร— for WES (clinical)
  • Uniformity: โ‰ฅ80% of target at โ‰ฅ20ร—
  • On-target rate โ‰ฅ60%
  • Duplicate rate <20%
  • Ts/Tv ratio: ~2.0โ€“2.1 for WGS, ~3.0โ€“3.3 for WES (high ratios = good calls)
  • Het/Hom ratio: ~1.5โ€“2.5 for germline (deviation suggests contamination or errors)
  • Contamination: <3% (VerifyBamID FREEMIX score)