次世代シーケンサー(NGS)データ解析:実践パイプライン

次世代シーケンサー(Next-Generation Sequencer、NGS)データ解析は、DNA逆工学の情報工学側を担う実践的分野である。2005年の454社登場以来、NGSはIllumina・PacBio・Oxford Nanopore等の複数プラットフォームに発展し、2025年現在、全世界で年間50エクサバイトを超えるゲノムデータを生み出す。これを解析し、生物学的発見に変換するのがNGSデータ解析である。本記事では、NGS解析の標準パイプライン・主要ツール・実践フロー・最新動向を体系的に解説する。

1. NGSデータの基本:FASTQフォーマット

NGSの生データは、FASTQフォーマットで出力される。各リードは4行で表現:

@SEQ_ID
GATCGGAAGAGCACACGTCTGAACTCCAGTCAC
+
FFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFFF

第1行:リードID・座標情報(Illuminaの場合)。第2行:塩基配列。第3行:「+」区切り。第4行:品質スコア(Phred品質スコア+33をASCII文字で表示)。Q30(エラー率0.1%)が高品質の目安。Illuminaはペアエンド(paired-end)で出力され、R1(正向き)・R2(逆向け)の2ファイル。ペアエンドは、同一DNA断片の両端から読むことで、断片長情報・正確な配置が可能。

生データファイルサイズは膨大。ヒトゲノム(30x)のFASTQは約100GB。これを解析・保管するため、圧縮(gzip)・クラウドストレージ・専用インフラが必要。

2. 品質管理(QC)

QCはNGS解析の最初の必須ステップ。低品質データは後続解析に悪影響を与える。

FastQC:Sanger Institute開発。入力FASTQファイルを解析し、品質レポートを出力。HTML形式で、以下を評価:(1) Per-base sequence quality(各位置の品質スコア分布)、(2) Per-sequence quality scores(リード全体の品質分布)、(3) Per-base sequence content(各位置の塩基組成、バイアス検出)、(4) GC content、(5) Adapter contamination等。

MultiQC:複数サンプルのFastQCレポートを統合。1つのHTMLで全体把握。パイプライン途中の全ツール出力を統合可能。

Trimmomatic:Bolgerら開発(2014年)。Javaベース。SLIDINGWINDOW quality trimming・adapter removal・length filtering等を実施。Illuminaアダプター除去に標準。

fastp:Chenら開発(2018年)。C++実装で高速・高機能。Trimmomaticの機能に加え、ペアエンド同時処理・ポリG尾トリミング・UMI処理等。現在の標準。1サンプルを数分で処理。

cutadapt:Marcel Martin開発。Pythonベース。柔軟なアダプター除去。マルチアダプター対応。日本の解析ツールとしても人気。

NGSデータ解析パイプライン シーケンサ bcl2fastq FastQC Trimmomatic 清浄化 アラインメント BWA/Bowtie2 SAM→BAM samtools バリアント GATK/VarScan アノテーション SnpEff/VEP VCF 主な応用: WGS(全ゲノム) / WES(全エクソン) / RNA-seq / ChIP-seq / メタゲノム / がんゲノム 出力: VCF (Variant Call Format) → 臨床診断・創薬・農業育種

3. アラインメント:参照ゲノムへのマッピング

QC後のクリーンリードを、参照ゲノムにマッピング(アラインメント)。これで各リードのゲノム上位置が決定。

BWA(Burrows-Wheeler Aligner):Li & Durbin開発(2009年)。Burrows-Wheeler Transform + FM-indexで高速・高精度。BWA-MEM(2013年、最新版)は70bp-1Mbリード対応。ヒトゲノム30xを数時間で処理。DNA-seq標準。

Bowtie2:Langmead & Salzberg開発(2012年)。Bowtie後継。高速・軽量。BWA-MEMと同等の精度。RNA-seq以外のDNA解析で広く使用。

STAR(Spliced Transcripts Alignment to a Reference):Dobinら開発(2013年)。RNA-seqアラインメントの標準。スプライス部位を認識し、エクソンを跨ぐリードを正しくマッピング。ヒトゲノム全体を参照に、1億リードを数十分で処理。

HISAT2:Kimら開発(2019年)。STAR後継・高速化。低メモリ使用。現在のRNA-seqアラインメントの標準。

minimap2:Li開発(2018年)。ロングリード(PacBio・Nanopore)アラインメント標準。高速・高精度。PacBio Iso-Seq・Nanopore direct RNA等に対応。

アラインメント結果はSAM(Sequence Alignment/Map)形式で出力。SAMは人間可読テキスト・大容量。BAM(binary SAM)に変換・圧縮して使用。

samtools:Liら開発。SAM/BAM操作の標準ツール。BAM変換・ソート・インデックス・カバレッジ計算・フィルタリング等を実行。変換:samtools view -bS input.sam > output.bam。ソート:samtools sort -o sorted.bam input.bam。インデックス:samtools index sorted.bam。これらは全パイプラインで必須。

4. 変異コール

DNA-seqの場合、BAMファイルから変異をコール。

GATK(Genome Analysis Toolkit):Broad Institute開発。変異コールの標準。HaplotypeCallerが局所的de novoアセンブリで変異コール。SNP・IndelをVCF(Variant Call Format)形式で出力。Base Quality Score Recalibration(BQSR)で系統的エラーを補正。VQSR(Variant Quality Score Recalibration)で品質フィルタリング。

VarScan2:Koboldtら開発。SNP・Indel・LOH・体細胞変異を検出。簡易的だが、GATKと異なるアルゴリズムで、クロスチェックに有用。

FreeBayes:Garrison & Marth開発。Bayesian変異コール。ヘテロ接合性・多アレルに対応。シンプルな設計。

DeepVariant:Google開発。深層学習ベースの変異コール。CNN(畳み込みニューラルネットワーク)で、リード・品質・マッピング情報等から変異を分類。GATKより感度・精度が高い場合が多い。2020年代の新標準。

Mutect2:GATKの一部。体細胞変異(がん変異)コールに特化。腫瘍-対照比較で体細胞変異を同定。がんゲノム解析の中核。

5. 変異アノテーション

VCFの変異に生物学的・臨床的意味を付与。

SnpEff:Cingolani開発。遺伝子・エクソン・コドンへの影響(frameshift・missense・nonsense等)を予測。超高速・軽量。 GenomeWorks SnpSiftでVCFフィルタリング。

ANNOVAR:Wangら開発。多様なデータベース(dbSNP・ClinVar・gnomAD・COSMIC等)の情報を付与。機能的影響(SIFT・PolyPhen・CADD等)予測スコアも統合。

VEP(Variant Effect Predictor):EBI開発。Ensemblの標準アノテーションツール。多様な情報源を統合。Web API・コマンドライン版が提供される。

Oncokb:Sloan Kettering Cancer Center運営。がん変異の臨床的意義を提供。FDA承認薬・治験薬の標的変異を整理。CIViC・JAX CKB等の同種データベースと併用。

6. RNA-seq解析パイプライン

RNA-seqは、遺伝子発現・スプライシング・融合遺伝子等を網羅解析。

標準フロー:HISAT2(アラインメント)→ featureCounts(遺伝子レベルカウント)→ DESeq2(差次発現解析)→ clusterProfiler(パスウェイ解析)。

featureCounts:Liaoら開発。GTFアノテーションに基づき、BAMファイルから各遺伝子にマップされたリード数をカウント。高速・軽量。HTSeq-countより高速。

Salmon:Patroら開発(2017年)。アライメントフリー定量。リードを直接トランスクリプトにマッピングし、発現量を計算。HISAT2-StringTieより高速・高精度。現在の標準。

kallisto:Brayら開発(2016年)。Salmonと同様のアライメントフリー定量。疑似アラインメント手法。超高速。

DESeq2:Loveら開発。R/Bioconductorパッケージ。差次発現解析の標準。負の二項分布モデル・size factor補正・多重検定補正(BH法)等を実装。

edgeR:Robinsonら開発。DESeq2と並ぶ標準。特に小サンプル数に有用。

limma-voom:limmaパッケージの拡張。線形モデル・voom変換でRNA-seqデータ対応。複雑な実験デザインに適する。

clusterProfiler:Yu開発。R/Bioconductorパッケージ。GO(Gene Ontology)・KEGG・Reactome等のパスウェイエンリッチメント解析。差次発現遺伝子群の生物学的解釈に必須。

7. パイプライン管理と再現性

NGS解析パイプラインは複雑で、再現性確保が課題。

Nextflow:Di Tommasoら開発(2017年)。GroovyベースのDSL。ワークフロー定義。Docker・Singularityコンテナで環境統一。nf-core(https://nf-co.re/)がコミュニティ製パイプライン集。rnaseq・chipseq・sarek(がんゲノム)等の標準パイプラインを提供。

Snakemake:Köster開発(2012年)。Pythonベース。Makefile風の記法。Bioconda統合。学術界で人気。

WDL(Workflow Description Language):Broad Institute開発。Cromwellエンジンで実行。GATK Best Practicesに標準使用。クラウド実行対応。

CWL(Common Workflow Language):標準化されたワークフロー記述言語。異なるエンジン・実行環境間の互換性を確保。

Conda・Bioconda:パッケージ管理。仮想環境で依存関係を隔離。Biocondaチャンネルでバイオインフォマティクスツールを統合配布。YAMLファイルで環境定義。

Docker・Singularity:コンテナ技術。実行環境を完全にカプセル化。再現性を確保。HPC環境ではSingularityが標準。

8. シングルセルRNA-seq解析

2010年代以降、シングルセル解析が発展。1細胞単位で遺伝子発現を解析。

10x Genomics Chromium:主流のシングルセルRNA-seqプラットフォーム。1ランで1万-10万細胞を解析。バーコード付きビーズで各細胞を識別。CellRangerが公式解析ツール。

Seurat:Rパッケージ。Satijaら開発。シングルセル解析の標準。データ読込・正規化・PCA・UMAP・クラスタリング・マーカー遺伝子同定・軌跡解析等を統合。

Scanpy:Wolfら開発(2018年)。Pythonベース。Seuratと同等機能。大規模データ(100万細胞以上)に対応。機械学習ライブラリ(scikit-learn・PyTorch等)との統合が容易。

scVI(single-cell Variational Inference):深層学習ベースのシングルセル解析フレームワーク。Variational Autoencoderでバッチ効果補正・次元圧縮・細胞型分類等。

RNA velocity:Mannoら開発(2018年)。スプライス前・スプライス後mRNAの比率から、細胞の「動き」を予測。発生分化の運命推定・細胞状態遷移の可視化に有用。scVeloがPython実装。

9. 応用:がんゲノム解析

NGS解析の重要応用が、がんゲノム解析。患者の腫瘍ゲノムを解析し、診断・治療方針を決定。

標準フロー:腫瘍・対照(血液等)DNA抽出 → WGS/WESライブラリー作製 → NGS(Illumina NovaSeq等、100-200xカバレッジ) → 変異コール(Mutect2等) → アノテーション(Oncokb・CIViC等) → 臨床解釈。

がん遺伝子パネル:FoundationOne CDx(324遺伝子)・OncoGuide NCC Oncopanel(114遺伝子)等。特定遺伝子のみを深く解析。保険適用・臨床実装済み。1-2週間で結果。治療薬選択の重要情報。

MRD(Minimal Residual Disease)モニタリング:がん治療後の微量残存腫瘍を検出。Signatera等のアッセイは、患者固有変異をカスタムパネルで追跡。10万細胞中1個の腫瘍細胞を検出。再発早期発見・治療効果モニタリングに有用。

液体生検:血液中のctDNA(cell-free tumor DNA)を解析。腫瘍組織生検不要。変異検出・治療モニタリング・早期発見等。Guardant Health・Foundation Liquid等のキットが実用化。

10. 最新動向と課題

AI統合:DeepVariant(Google)等のAIベース変異コールが主流に。AlphaMissense(DeepMind)で変異病原性予測。Enformerで遺伝子発現予測。Boltz-1(AlphaFold3代替)で構造予測。AIとNGS解析が融合する時代。

ロングリード解析:PacBio HiFi reads + Oxford Nanopore Ultra-longで、ヒトゲノム完全解読(T2T-CHM13、2022年)。構造変異・反復領域・エピゲノム等の完全解析が可能。ロングリード専用ツール(minimap2・HiFiasm・Flye等)が発展。

リアルタイム解析:Nanopore MinIONでシーケンシング中に解析開始。数十分で結果。現場検査・感染症診断・がん術中診断等に革命。

クラウド解析:AWS・Google Cloud・Azure等のクラウド計算。巨大データの保存・解析に必要。DNAnexus・Seven Bridges・Terra等のプラットフォーム。日本ではNBDC(NBDC Human Database)が整備。

データ共有:Sequence Read Archive(SRA)等でNGS生データを共有。論文再現性・二次解析の基盤。ただし、ヒトデータはプライバシー保護が必要。控制アクセス(controlled access)が標準。

課題:(1) データ量爆発。年間50 EB超。ストレージ・転送コスト。(2) 解析スキル不足。専門バイオインフォマティシャン不足。教育の充実が必要。(3) 再現性確保。ワークフロー管理・コンテナ技術の徹底。(4) 公平性。先進国に集中するデータ・インフラ。発展途上国での活用支援。(5) 倫理・プライバシー。ゲノムデータは個人情報。匿名化・暗号化・アクセス制御。

11. おわりに

NGSデータ解析は、DNA逆工学の情報工学側を担う中核技術。1990年代のヒトゲノム計画から30年、技術革新は留まることを知らず、2022年のヒトゲノム完全解読(T2T-CHM13)に到達。次は、多様性を完全に捉えるHuman Pangenome Project、そして地球全体の生物ゲノム解読(Earth BioGenome Project)が進む。本連載23回を通じて、DNA逆工学の基礎から応用までを体系的に解説してきた。読者の皆様の研究・学習に役立つことを願っている。

Comments