Meta-Learner は「任意の汎用 ML モデルを部品として組み合わせ、因果効果を推定する枠組み」と説明される。整理すると3つの軸がある。①問題の還元(CATE 推定を既製の教師あり学習に翻訳するレシピか=学習器非依存か)、②推論理論(直交化とクロスフィッティングを備えるか)、③学習器そのもの(因果推定専用にアルゴリズムを書き換えるか)。
S/T/X-Learner は ① のみ。DR/DML は ② の理論であり、それを CATE に向けた DR-learner / R-learner は ①②にある。 因果フォレストは ③ で、木の分割基準そのものを書き換えるため学習器を差し替えられない。この意味で 因果フォレストはMeta-Learner ではない。
3. DR / DML 系、因果フォレスト
| Learner | step | モデルNo. | 説明変数 | 目的変数 | 推定対象 |
|---|---|---|---|---|---|
| DR | 0 | — | — | — | 標本を K 個に分け、以降の1段目の予測はすべて out-of-fold で作る(交差適合)。同じデータで局外パラメータと効果を両方推定すると、正則化バイアスがそのまま τ に乗る |
| 1 | 1a 1b |
X (T=0) X (T=1) |
Y Y |
T-Learner と同じ(μ₀, μ₁) | |
| 1 | 1c | X | T | 傾向スコア; e(X) | |
| 2 | — | — | — | DR擬似アウトカムの計算;(例)ṫ(X) = (μ₁(X) − μ₀(X)) + [(T − e(X)) / (e(X)·(1 − e(X)))] · (Y − μ_{T=T}(X)) |
|
| 3 | 2 | X | ṫ(X) | CATE; τ(X) = E[ṫ(X)|X] | |
| DML | 0 | — | — | — | (追加)DR と同じく交差適合。DML の理論はこれを前提に組まれている |
| 1 | 1a | X | Y | Y の応答関数 μY(X) = E[Y|X](m(X) とも書く) | |
| 1 | 1b | X | T | T の応答関数 μT(X) = E[T|X]。処置が二値ならこれは傾向スコア e(X) そのもの | |
| 2 | — | — | — | 残差を計算; εY = Y − μY(X), εT = T − μT(X) | |
| 3 | 2 | εT(および εT × X の交互作用) | εY | CATE; τ(X) = β₀ + β′φ(X) (εT 単独に回帰すると τ は定数となり ATE になる。 LinearDML では featurizer で φ(X) を与えて初めて CATE になる) | |
| Causal Forest | 0 | — | — | — | 交差適合に加えて、木を育てる標本と効果を推定する標本を分ける(誠実性 honesty)。信頼区間を出すための条件 |
| 1 | 1a 1b |
X X |
Y T |
DML と同じ | |
| 2 | — | — | — | DML と同じ(局所中心化: 木を育てる前に交絡の影響を残差で抜いておく) | |
| 3 | — | X, εT, εY | — | ランダムフォレストを使用して、各ノードで処置効果の異質性(分散)を最大化する分割を選択。ノードでの処置効果 = Σ(εY × εT) / Σ(εT²) | |
| 4 | — | — | — | CATE; τ(X)(各特徴量 X の組み合わせに対して、局所的な処置効果を推定) |
用途
| 手法 | 出力される τ(X) の形 | 向いている場面 | 弱点 | 原典 |
|---|---|---|---|---|
| DR(DR-Learner / AIPW) | 自由(2段目に何を使うかで決まる) | μ と e のどちらが当たるか自信がないとき。片方が正しければ一致する | e(X) が 0 か 1 に近い領域で分母が爆発し、推定値が暴れる。overlap の確認が必須 | Robins+ 1994 / Kennedy 2023 |
| DML(LinearDML) | 線形 θ₀+θᵀX(指定した形) | 効果の形を単純に置きたいとき。信頼区間が素直に出る | 交互作用の設計を誤ると異質性を取り逃がす。εT の分散が小さいと不安定 | Chernozhukov+ 2018 |
| Causal Forest | 非線形(木が決める) | 異質性の形が事前に分からないとき。探索的に使える | 解釈が難しく、標本数を要する。木の出力をそのまま因果の強さと読まない | Wager & Athey 2018 / Athey+ 2019 (GRF) |
周辺の用語
| 用語 | 説明 | 出典 |
|---|---|---|
| 二重頑健性(double robustness) | 応答関数 μ と傾向スコア e のどちらか一方が正しく推定できていれば、CATE の推定が一致するという性質。DR の名前の由来 | Robins+ 1994 |
| Neyman 直交性 | 局外パラメータ(μ, e)の推定誤差が、1次の項では効果の推定に効かないようにモーメント条件を組むこと。DR と DML の理論的な核 | Chernozhukov+ 2018 |
| 交差適合(cross-fitting) | 局外パラメータの学習と効果の推定を別々の fold で行う手続き。機械学習の過学習・正則化バイアスが効果推定へ漏れるのを遮断する | Chernozhukov+ 2018 |
| 局所中心化(local centering) | Causal Forest で木を育てる前に Y と T を残差化しておくこと。交絡の影響を先に抜いてから異質性を探す | Athey+ 2019 |
| 誠実性(honesty) | 木の分割に使うデータと、ノード内で効果を推定するデータを分ける工夫。これがないと信頼区間が過度に狭くなる | Wager & Athey 2018 |
| GRF(generalized random forest) | Causal Forest を含む一般化枠組み。木を「局所的な重みを作る装置」とみなす見方 | Athey+ 2019 |
| R-Learner との関係 | DML の残差化は R-Learner と同じ目的関数。Causal Forest はその目的関数を木で解いていると読める。つまり3手法は別物というより同じ骨格の変奏 | Nie & Wager 2021 |
| overlap 違反 | e(X) が 0 か 1 に近い領域では比較相手が実在しない。DR は分母として直接効くので最も影響を受ける。e(X) のヒストグラムを必ず見る | — |
- e(X)は「データからの比率」から求めるか、X→T のモデルで推定(DR)。
- DR:μ₀, μ₁, e を一つの式で混ぜた DR擬似効果 ṫ(X) を作り、それを1本の τ(X) モデルで学習。
- DML(LinearDML):Y と T を X で残差化し、εY を εT および εT×X の交互作用項に線形回帰して τ(X) を得る。交互作用を入れないと τ は定数(=ATE)になる点に注意。非線形な異質性を扱うなら NonParamDML / CausalForestDML を使う。
3つの中だとDMLが好みです。
0 件のコメント:
コメントを投稿