ホームBenjamini-Hochberg法

HEALTH WORDS / 用語解説

Benjamini-Hochberg法

Benjamini-Hochberg procedure

Benjamini-Hochberg法とは、多重検定を行う際に問題となる偽陽性の増加を制御するため、統計学において用いられる多重比較補正の手法の一つである。1 統計的仮説検定を同時に多数行う状況において、第一種の過誤(帰無仮説が真であるにもかかわらず、誤ってそれを棄却してしまう確率)を適切にコントロールすることを目的としている。1

多くの生物学的研究や医学的網羅的解析、例えばマイクロアレイや次世代シーケンサーを用いた遺伝子発現解析などでは、数千から数万という膨大な数の統計検定が同時に実施される。2 このような状況下で従来の有意水準(例えば$p < 0.05$)をそのまま適用すると、多重性の問題により、偶然によって多数の偽陽性(誤検出)が生じてしまう。1 これを防ぐため、個別のp値に対して厳格な補正を行う必要がある。1

古典的な手法であるBonferroni法は、ファミリーワイズエラー率(FWER)を厳格に制御することを目的としているため、検定の数が膨大になる網羅的解析においては、真に有意な結果まで見逃してしまう偽陰性の増加が深刻な課題となる。1 これに対し、Yoav BenjaminiとYosef Hochbergによって1995年に提案されたBenjamini-Hochberg法は、偽発見率(FDR: False Discovery Rate)という新しい指標に基づいてエラーを制御する。1 偽発見率とは、帰無仮説を棄却して有意と判定されたもののうち、実際には帰無仮説が真である(つまり偽りである)割合の期待値のことを指す。1 全体のエラー率を厳しく抑え込むBonferroni法等と比較して、Benjamini-Hochberg法は「偽陽性が含まれる割合を一定以下に許容する」という柔軟なアプローチをとるため、検出力を高く維持できるという大きな利点がある。1

Benjamini-Hochberg法の具体的なアルゴリズムは、得られた複数のp値を用いた以下のステップによって実行される。1 まず、$m$個の帰無仮説に対するp値を計算し、それらを小さい順に並べ替えて$p(1) \le p(2) \le \dots \le p(m)$とする。3 次に、あらかじめ設定した偽発見率の許容水準を$\alpha$としたとき、$p(i) \le \frac{i}{m} \alpha$を満たすような最大の順位$i$を見つけ出す。1 もしそのような$i$が存在するならば、$p(1)$から$p(i)$までのすべての対応する帰無仮説を棄却し、これらを統計的に有意であると判定する。1 この手順により、大規模なデータ解析においても偽発見率を制御しつつ、多くの有用な発見を得ることが可能となる。1

参考文献・出典

  1. 統計数理研究所 統計的機械学習センター: https://www.ism.ac.jp/edit/toukei/vol67/no2_p381.pdf ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12
  2. NIBIOHN 医薬基盤・健康・栄養研究所: https://www.nibiohn.go.jp/eiken/keiahp/column/gene_analysis.html ↩
  3. 統計数理研究所 統計国勢調査等の解説資料: https://www.stat.go.jp/library/faq/faq15/faq15a01.html ↩