2026年9月21日月曜日

文献:Metalearners for estimating heterogeneous treatment effects using machine learning

DOI: 10.1073/pnas.1804597116
URL: https://doi.org/10.1073/pnas.1804597116
書誌: Künzel, S. R., Sekhon, J. S., Bickel, P. J., & Yu, B. (2019). Metalearners for estimating heterogeneous treatment effects using machine learning. PNAS, 116(10), 4156–4165.

AI要約

【背景】

  • 平均処置効果(ATE)を超えて、属性で条件付けた効果=条件付き平均処置効果(CATE)を推定したい需要が高まっていた。しかし、教師あり学習アルゴリズムはCATEを直接推定するようには設計されていない。
  • 既存の代表的なメタ学習器には、T-learnerとS-learnerがある。前者は、処置群と対照群を別々に回帰して差をとる。後者は、処置の有無を通常の特徴として1本のモデルで回帰する。どちらも、群サイズが不均衡な場合やCATEが応答関数より単純な場合に非効率になる。
  • 同一の対象では、「処置あり」「処置なし」の両方の結果を観測できない。そのため、個別の処置効果は直接には識別できない(因果推論の根本問題)。

【手法】

任意の教師あり学習アルゴリズムをCATE推定器へ変換する「メタ学習器」の枠組みを整理した。その上で、新手法X-learnerを提案した。X-learnerは3段階からなる。第1段では、対照群・処置群それぞれの応答関数(共変量から結果を予測する関数)を任意の基学習器で推定する。第2段では、「代入処置効果」を作る。処置群では、観測結果から対照側モデルの予測値を引く。対照群では、処置側モデルの予測値から観測結果を引く。この代入処置効果を目的変数として、各群でCATEを回帰する。第3段では、2つのCATE推定を重み関数(傾向スコアの推定値を推奨)で加重平均する。この構成の利点は2つある。一方の群の情報を、他方の群の推定に活かせる。CATEの線形性・疎性・平滑性といった構造を、第2段の回帰で直接利用できる。理論面では、応答関数の収束レートとCATEの収束レートを分けて解析した。実装では、ランダムフォレスト(honest RF)とBART(ベイズ的な回帰木のアンサンブル)を基学習器に用いた。広範なシミュレーションに加え、政治学の2つのフィールド実験(社会的圧力による投票率向上実験・戸別訪問による偏見低減実験)を再解析した。実装はソフトウェアパッケージhteとして公開されている。CATEのブートストラップ信頼区間も備える。

【結果】

  • シミュレーションでは、どのメタ学習器も一様には最良でなかった。ただし、X-learnerは最悪になることが無かった。群サイズが不均衡な場合や、CATEに線形・疎などの正則性がある場合に特に良好だった。
  • 理論では、CATEが線形で対照群が十分大きいとき、X-learnerが処置群サイズnについてパラメトリックレートn^(-1)を達成することを証明した(Theorem 2)。CATEに正則性を仮定しない場合は、T-learnerと同じミニマックス最適レートを達成する。
  • 投票率向上実験(対照191,243人・処置38,218人、ATE 0.081)の再解析では、過去の投票が1回のみの層に有意な負の反動(backlash)を検出した。効果は投票履歴3回の層で最大だった。この異質性は標的化に有用である。
  • 偏見低減実験(最終標本n=501、ATE 0.22)では、原著者が線形モデルで見つけられなかった効果の異質性をX-RFが検出した。S-learnerは推定を0へ縮小し、T-learnerは散らばりが最大で、X-learnerは中間だった。
  • 実データに基づくシミュレーションでは、小標本でX-RFのRMSEがS-RF・T-RFより小さかった。

【考察】

  • X-learnerの本質的な強みは、「CATEが応答関数より滑らかで単純」という実データで頻繁に見られる状況を利用できる点にある。逆に、CATEがほぼ0ならS-learnerが有利になる。応答関数が群間で全く異なるなら、T-learnerが有利になる。この使い分けの指針を与えた。
  • 基学習器の選択も精度を大きく左右する。小データ・大域的構造にはBART、大データ・局所的構造にはRFが向く。因果フォレストの性能は、RFを基学習器とするメタ学習器と同程度だった。
  • CATEの信頼区間はブートストラップに依拠する。形式的な保証のある区間の構成は、今後の課題と明記されている。


0 件のコメント:

コメントを投稿