DOI: 10.1145/3409382
URL: https://doi.org/10.1145/3409382
書誌: Yu, K., Liu, L., & Li, J. (2020). Causality-based Feature Selection: Methods and Evaluations. ACM Computing Surveys, 53(5), 1–36.
AI要約
【背景】
- 古典的な特徴量選択は、特徴量とクラス変数の相関(共起)に基づく。因果関係は捉えない。相関だけで選ばれた特徴(例: 喫煙者の黄色い指と肺がん)は、予測に効いても機構の説明にならない。データの分布が変わると、予測も崩れる。
- 因果特徴量、特にMarkov boundary(MB: クラス変数の親・子・配偶者)には理論保証がある。忠実性等の仮定の下で、MBは最大予測力を持つ最小の特徴集合になる。解釈可能で頑健なモデルにつながる。
- 多数の因果特徴量選択アルゴリズムが提案されてきた。しかし、包括的なレビューは存在しなかった。比較の基盤となるオープンソース実装も存在しなかった。
【手法】
因果ベース特徴量選択の包括的レビューと大規模実証評価である。まず、ベイジアンネットワーク・Markov blanket/Markov boundary・忠実性・因果十分性といった基礎概念を定義する。対象は、クラス変数のMBまたはPC(親子: 直接原因と直接結果)をデータから学習する枠組みである。アルゴリズムは2系統に分類される。制約ベースは、条件付き独立性検定を用いる。この系統は、さらに2型に分かれる。IAMB系は、MBを一括推定する(同時学習型)。MMMB・HITON-MBは、PCと配偶者を分けて探す(分割統治型)。スコアベースは、SLL・S2TMBなどBN構造スコアを用いる。MB内で原因と結果を区別するアルゴリズムも概観される。次に、代表的アルゴリズムを実装したオープンソースパッケージCausalFSを開発した(C言語、GitHubで公開)。評価には2種のデータを用いた。一つは、ベンチマークBNから生成した合成データである。もう一つは、特徴量数57〜100,000の8つの実データセット(spambase、madelon、gisette、arcene、dexter、dorothea、infant、bankruptcy)である。選択された特徴集合で、NB・KNN・SVMの分類器を学習した。予測精度・コンパクト性(選択特徴数)・AUC・計算時間を比較した。
【結果】
- クラス変数のPC(親子)集合による分類性能は、MBに劣らなかった。PC学習は、MB学習よりはるかに効率的だった。実用上はPC学習が現実的と確認された。
- 標本サイズが大きい場合、同時MB学習型(IAMB系等)は他のアルゴリズムより有意に高速だった。予測精度も競合した。FBEDが最速だった。
- スコアベースのMB/PC学習は、MBが大きいと計算コストが法外になった(例: spambaseでMBサイズ30超のSLL・S2TMB)。制約ベースに対する明確な優位を示さなかった。
- 合成データでは、後退戦略や対称性チェックが偽陽性の除去を通じて精度を大きく改善した。一方、実データでは、偽陽性を許容する方が分類に有利な場合があった。理由は、ノイズと小標本である。
- クラス不均衡データ(infant、bankruptcy、dorothea)では、全アルゴリズムのAUCが大きく低下した。既存手法は、不均衡データに対処できていない。
【考察】
- MBの理論保証を持つ因果特徴量選択は、解釈可能で頑健な機械学習への有望な方向とされる。CausalFSが、手法比較と新規開発の共通基盤になる。
- 忠実性・因果十分性の仮定は、実データでしばしば破れる。欠測・ノイズを含む低品質データ、ストリーミングデータ、不均衡クラスへの対応が未解決課題として残る。
- 相関ベースの予測変数は、分布シフトの下で予測を誤りうる(黄色い指の例)。本論文は、この予測と因果の乖離を明確に概念整理した。