ホーム多重検定

HEALTH WORDS / 用語解説

多重検定

Multiple Testing

多重検定とは、同一のデータセットに対して帰無仮説の検定を繰り返し行うこと、またはその統計的プロセスのことである。1 医学研究や生物学の分野において、多数の遺伝子発現量やバイオマーカーを一斉に評価する際などに頻繁に用いられる。2

統計的仮説検定においては、通常1回の検定につき有意水準(通常は5%など)が設定される。 これは、帰無仮説が真であるにもかかわらずそれを誤りて棄却してしまう確率、すなわち第一種の過誤(偽陽性)を起こす許容限界を示すものである。 しかし、1つのデータセットに対して$m$回の独立な多重検定を繰り返した場合、少なくとも1回は第一種の過誤を犯す確率(ファミリーワイズエラー率: FWER)は、1回の検定における有意水準を$\alpha$とすると、$1 - (1 - \alpha)^m$へと急激に増大することになる。 例えば、有意水準を0.05として20回の検定を独立に行うと、少なくとも1つの仮説で誤って有意差を検出してしまう確率は約64%にまで上昇する。1

このように、多重検定をそのまま放置して個別のp値(有意確率)だけで判断を下すと、実際には偶然による変動に過ぎない現象を統計的有意であると誤認してしまうリスクが極めて高くなる。 この問題は多重性の問題と呼ばれており、現代のゲノム科学やトランスクリプトミクスのような網羅的解析においては特に深刻な課題となる。 数万個の遺伝子を同時に比較するDNAマイクロアレイ解析などでは、何らの補正も行わなければ大量の偽陽性が生じ、信頼性のある生物学的結論を導くことが不可能になるため、適切な統計的手法による調整が不可欠である。2

この多重検定に伴う第一種の過誤の増大を防ぎ、全体としてのエラー率をコントロールするために、様々な多重検定補正の手法が開発されてきた。 代表的なアプローチの一つが、ファミリーワイズエラー率(FWER)を厳格に制御する方法である。 最も古典的かつ保守的な補正方法として、個々のp値に検定の総数$m$を乗算するか、あるいは有意水準のほうを$m$で除算するボンフェローニの補正(Bonferroni correction)が挙げられる。 この方法は計算が非常に単純であるという利点を持つが、検定の回数$m$が増えるにつれて検出力(第二種の過誤を避け、真の対立仮説を正しく検出する確率)が著しく低下し、本来見出すべき有意差まで見落としてしまう(偽陰性の増加)という欠点も併せ持っている。 そのため、より検出力を改善させた Holm法などの段階的多重検定手順も提案されている。1

もう一つの主要なアプローチとして、FWERではなく偽発見率(False Discovery Rate: FDR)を制御する手法がある。 FDRとは、有意と判定されたすべての仮説のうち、実際には帰無仮説が真である(すなわち偽陽性である)割合の期待値のことである。 DNAマイクロアレイや次世代シーケンサーを用いた網羅的解析のように、数千から数万という膨大な数の検定を行う場合、FWERを厳しく制御すると検出力がほとんど失われてしまう。 そこで、多少の偽陽性の混入を許容しつつも、全体としての発見の信頼性を担保する指標としてFDRが導入された。 その代表的な手法であるBenjamini-Hochberg法(BH法)は、p値を小さい順に並べ替え、それぞれの順位に応じたしきい値と比較することで多重検定によるエラーを効率的にコントロールする。 このFDR制御の概念の登場により、現代のライフサイエンス研究における大規模データ解析の精度と実用性が飛躍的に向上した。2

このように、多重検定における統計的補正は、科学的検証の客観性と信頼性を担保するための根幹をなす技術である。 特に近年の臨床試験や分子生物学の領域では、探索的データ解析と確証的データ解析の区別を明確にし、事前に定められた統計解析計画に基づいて適切に多重性への配慮が行われることが、学術論文の採択や医薬品承認審査においても厳しく求められている。2

参考文献・出典

  1. 統計数理研究所 統計的推測の基礎: https://www.ism.ac.jp/edit/toukei/pdf/48_2_183.pdf ↩1 ↩2 ↩3
  2. 厚生労働省 医薬品の臨床試験の実施に関する基準について: https://www.mhlw.go.jp/web/t_doc?dataId=00l65545&dataType=1&pageNo=1 ↩1 ↩2 ↩3 ↩4