2026年9月21日月曜日

文献:Causality-based Feature Selection: Methods and Evaluations

DOI: 10.1145/3409382
URL: https://doi.org/10.1145/3409382
書誌: Yu, K., Liu, L., & Li, J. (2020). Causality-based Feature Selection: Methods and Evaluations. ACM Computing Surveys, 53(5), 1–36.

AI要約

【背景】

  • 古典的な特徴量選択は、特徴量とクラス変数の相関(共起)に基づく。因果関係は捉えない。相関だけで選ばれた特徴(例: 喫煙者の黄色い指と肺がん)は、予測に効いても機構の説明にならない。データの分布が変わると、予測も崩れる。
  • 因果特徴量、特にMarkov boundary(MB: クラス変数の親・子・配偶者)には理論保証がある。忠実性等の仮定の下で、MBは最大予測力を持つ最小の特徴集合になる。解釈可能で頑健なモデルにつながる。
  • 多数の因果特徴量選択アルゴリズムが提案されてきた。しかし、包括的なレビューは存在しなかった。比較の基盤となるオープンソース実装も存在しなかった。

【手法】

因果ベース特徴量選択の包括的レビューと大規模実証評価である。まず、ベイジアンネットワーク・Markov blanket/Markov boundary・忠実性・因果十分性といった基礎概念を定義する。対象は、クラス変数のMBまたはPC(親子: 直接原因と直接結果)をデータから学習する枠組みである。アルゴリズムは2系統に分類される。制約ベースは、条件付き独立性検定を用いる。この系統は、さらに2型に分かれる。IAMB系は、MBを一括推定する(同時学習型)。MMMB・HITON-MBは、PCと配偶者を分けて探す(分割統治型)。スコアベースは、SLL・S2TMBなどBN構造スコアを用いる。MB内で原因と結果を区別するアルゴリズムも概観される。次に、代表的アルゴリズムを実装したオープンソースパッケージCausalFSを開発した(C言語、GitHubで公開)。評価には2種のデータを用いた。一つは、ベンチマークBNから生成した合成データである。もう一つは、特徴量数57〜100,000の8つの実データセット(spambase、madelon、gisette、arcene、dexter、dorothea、infant、bankruptcy)である。選択された特徴集合で、NB・KNN・SVMの分類器を学習した。予測精度・コンパクト性(選択特徴数)・AUC・計算時間を比較した。

【結果】

  • クラス変数のPC(親子)集合による分類性能は、MBに劣らなかった。PC学習は、MB学習よりはるかに効率的だった。実用上はPC学習が現実的と確認された。
  • 標本サイズが大きい場合、同時MB学習型(IAMB系等)は他のアルゴリズムより有意に高速だった。予測精度も競合した。FBEDが最速だった。
  • スコアベースのMB/PC学習は、MBが大きいと計算コストが法外になった(例: spambaseでMBサイズ30超のSLL・S2TMB)。制約ベースに対する明確な優位を示さなかった。
  • 合成データでは、後退戦略や対称性チェックが偽陽性の除去を通じて精度を大きく改善した。一方、実データでは、偽陽性を許容する方が分類に有利な場合があった。理由は、ノイズと小標本である。
  • クラス不均衡データ(infant、bankruptcy、dorothea)では、全アルゴリズムのAUCが大きく低下した。既存手法は、不均衡データに対処できていない。

【考察】

  • MBの理論保証を持つ因果特徴量選択は、解釈可能で頑健な機械学習への有望な方向とされる。CausalFSが、手法比較と新規開発の共通基盤になる。
  • 忠実性・因果十分性の仮定は、実データでしばしば破れる。欠測・ノイズを含む低品質データ、ストリーミングデータ、不均衡クラスへの対応が未解決課題として残る。
  • 相関ベースの予測変数は、分布シフトの下で予測を誤りうる(黄色い指の例)。本論文は、この予測と因果の乖離を明確に概念整理した。


文献:DirectLiNGAM: A Direct Method for Learning a Linear Non-Gaussian Structural Equation Model

書誌: Shimizu, S., Inazumi, T., Sogawa, Y., et al. (2011). DirectLiNGAM: A Direct Method for Learning a Linear Non-Gaussian Structural Equation Model. JMLR, 12, 1225–1248.

AI要約

【背景】
  • 共分散構造のみを使う従来の構造方程式モデルやベイジアンネットワークの推定は、構造に関する事前知識なしには、因果順序と接続強度を含む完全な構造を識別できない。
  • 非ガウス性を利用するLiNGAM(Shimizu et al., 2006)では、完全な構造が識別可能である。しかし既存のICAベースの推定(ICA-LiNGAM)は反復探索に依存する。初期値や収束基準しだいで局所最適に陥る。有限ステップでの正解収束も保証されない。
  • ICA-LiNGAMの置換ステップは尺度不変でない。そのため、変数のスケールの違いで誤った順序を返しうる。

【手法】
対象は線形非ガウス非巡回モデル(LiNGAM)である。このモデルはx=Bx+eと書ける。外生擾乱eは非ガウスで相互に独立とする。潜在交絡はないと仮定する。提案手法DirectLiNGAMは、このモデルの因果順序を反復探索なしに直接推定する。核は、Darmois-Skitovitchの定理から導いた補題である。この補題によれば、変数x_jが外生であることと、他の各変数をx_jに単回帰した残差のすべてがx_jと独立であることは同値である。そこで、カーネル法による相互情報量の推定(Bach-Jordanのカーネル独立性尺度)を用いる。残差との独立性が最も高い変数を外生と判定し、因果順序の先頭に置く。次に、その変数の影響を最小二乗回帰で残りの全変数から除去する。残差ベクトルにも再びLiNGAMが成り立つ。残差の因果順序は、元の変数の因果順序と一致する。したがって、この操作の繰り返しだけで、変数の個数と同じ固定ステップ数で因果順序全体が決まる。順序の確定後、接続強度行列Bは最小二乗などの通常の回帰で推定する。さらに、「x_iからx_jへ有向道がある/ない」を成分とする事前知識行列を組み込む拡張も与えた。この拡張は、外生候補の絞り込みと残差計算の省略により、精度と計算時間を改善する。評価では、人工データ(変数10〜100、標本500〜2000、疎・密ネットワーク×18種の非ガウス分布)でICA-LiNGAMと比較した。物理(二重振り子)と社会学(地位達成モデル)の実データにも適用した。実データではPC・GESとも比較した。

【結果】
  • モデル仮定が満たされ標本サイズが無限のとき、DirectLiNGAMは変数数と同じ固定ステップ数での正解収束を保証する。初期値や収束基準などのアルゴリズム的パラメータは不要である。
  • 人工データの全条件(疎・密×次元10〜100×n=500〜2000)で、真のBとの誤差(Frobenius距離)はICA-LiNGAMより小さかった(例: 疎・100次元・n=2000で2.35対36.52)。
  • 事前知識(50%)の利用で、精度はさらに向上した。計算時間も短縮された(密・100次元・n=2000で17.24時間→19.80分)。
  • 計算量はO(np^3M^2+p^4M^3)で、ICA-LiNGAMより大きい。ただし収束保証と既知の計算量をもつ。
  • 実データでは、領域知識と整合する結果を得た。二重振り子では、「角速度は角度で決まる」という知識と整合する有意な辺を検出した(ICA-LiNGAMは有意な辺なし、PC/GESは一部の辺の向きを誤る)。社会学データでは、推定された辺のほぼすべてが領域知識と整合した(誤りは息子の学歴→父の学歴の1辺のみ)。

【考察】
  • 非ガウス性を使えば、辺の向きまで識別できる。このLiNGAMの理論的利点を、収束保証つきの実用アルゴリズムとして実現した。
  • カーネル独立性尺度の計算が、実行時間のボトルネックである。仮定(線形性・非ガウス性・潜在交絡なし)の破れの検定、計算効率の改善、潜在交絡がある場合への拡張が、今後の課題と明記されている。社会学データでの1辺の誤りは、仮定の破れの兆候と解釈されている。
  • 事前知識行列により、「有向道の有無」を制約として与えられる。部分的な領域知識の注入で、精度と速度の両方が改善する。




文献:Metalearners for estimating heterogeneous treatment effects using machine learning

DOI: 10.1073/pnas.1804597116
URL: https://doi.org/10.1073/pnas.1804597116
書誌: Künzel, S. R., Sekhon, J. S., Bickel, P. J., & Yu, B. (2019). Metalearners for estimating heterogeneous treatment effects using machine learning. PNAS, 116(10), 4156–4165.

AI要約

【背景】

  • 平均処置効果(ATE)を超えて、属性で条件付けた効果=条件付き平均処置効果(CATE)を推定したい需要が高まっていた。しかし、教師あり学習アルゴリズムはCATEを直接推定するようには設計されていない。
  • 既存の代表的なメタ学習器には、T-learnerとS-learnerがある。前者は、処置群と対照群を別々に回帰して差をとる。後者は、処置の有無を通常の特徴として1本のモデルで回帰する。どちらも、群サイズが不均衡な場合やCATEが応答関数より単純な場合に非効率になる。
  • 同一の対象では、「処置あり」「処置なし」の両方の結果を観測できない。そのため、個別の処置効果は直接には識別できない(因果推論の根本問題)。

【手法】

任意の教師あり学習アルゴリズムをCATE推定器へ変換する「メタ学習器」の枠組みを整理した。その上で、新手法X-learnerを提案した。X-learnerは3段階からなる。第1段では、対照群・処置群それぞれの応答関数(共変量から結果を予測する関数)を任意の基学習器で推定する。第2段では、「代入処置効果」を作る。処置群では、観測結果から対照側モデルの予測値を引く。対照群では、処置側モデルの予測値から観測結果を引く。この代入処置効果を目的変数として、各群でCATEを回帰する。第3段では、2つのCATE推定を重み関数(傾向スコアの推定値を推奨)で加重平均する。この構成の利点は2つある。一方の群の情報を、他方の群の推定に活かせる。CATEの線形性・疎性・平滑性といった構造を、第2段の回帰で直接利用できる。理論面では、応答関数の収束レートとCATEの収束レートを分けて解析した。実装では、ランダムフォレスト(honest RF)とBART(ベイズ的な回帰木のアンサンブル)を基学習器に用いた。広範なシミュレーションに加え、政治学の2つのフィールド実験(社会的圧力による投票率向上実験・戸別訪問による偏見低減実験)を再解析した。実装はソフトウェアパッケージhteとして公開されている。CATEのブートストラップ信頼区間も備える。

【結果】

  • シミュレーションでは、どのメタ学習器も一様には最良でなかった。ただし、X-learnerは最悪になることが無かった。群サイズが不均衡な場合や、CATEに線形・疎などの正則性がある場合に特に良好だった。
  • 理論では、CATEが線形で対照群が十分大きいとき、X-learnerが処置群サイズnについてパラメトリックレートn^(-1)を達成することを証明した(Theorem 2)。CATEに正則性を仮定しない場合は、T-learnerと同じミニマックス最適レートを達成する。
  • 投票率向上実験(対照191,243人・処置38,218人、ATE 0.081)の再解析では、過去の投票が1回のみの層に有意な負の反動(backlash)を検出した。効果は投票履歴3回の層で最大だった。この異質性は標的化に有用である。
  • 偏見低減実験(最終標本n=501、ATE 0.22)では、原著者が線形モデルで見つけられなかった効果の異質性をX-RFが検出した。S-learnerは推定を0へ縮小し、T-learnerは散らばりが最大で、X-learnerは中間だった。
  • 実データに基づくシミュレーションでは、小標本でX-RFのRMSEがS-RF・T-RFより小さかった。

【考察】

  • X-learnerの本質的な強みは、「CATEが応答関数より滑らかで単純」という実データで頻繁に見られる状況を利用できる点にある。逆に、CATEがほぼ0ならS-learnerが有利になる。応答関数が群間で全く異なるなら、T-learnerが有利になる。この使い分けの指針を与えた。
  • 基学習器の選択も精度を大きく左右する。小データ・大域的構造にはBART、大データ・局所的構造にはRFが向く。因果フォレストの性能は、RFを基学習器とするメタ学習器と同程度だった。
  • CATEの信頼区間はブートストラップに依拠する。形式的な保証のある区間の構成は、今後の課題と明記されている。


文献:Spatial Causal Inference in the Presence of Unmeasured Confounding and Interference

DOI: 10.48550/arXiv.2303.08218
URL: https://arxiv.org/abs/2303.08218
書誌: Papadogeorgou, G., & Samanta, S. (2023). Spatial Causal Inference in the Presence of Unmeasured Confounding and Interference. arXiv:2303.08218.

AI要約

【背景】

  • 空間データの因果推論では、空間的干渉と未計測の空間交絡が絡み合う。一方だけを調べると、他方をそれと誤認する恐れがある。誤認は誤った結論につながる。両者を同時に扱う方法論は乏しかった。
  • 曝露(効果を知りたい原因側の変数)自体が、共通の空間トレンドという固有の空間依存を持つ場合がある。この依存は、交絡が全く無い場合でさえ、独立観測を前提とする標準的な推定を無効にし得る。
  • 動機となる応用は、米国の発電所からのSO2排出が高齢者の心血管死亡率へ与える効果の推定である(2,440郡。局所と近傍50km圏の曝露)。

【手法】

空間データ用の因果ダイアグラム(spatial causal graphs)を導入した。まずペア構造の空間データで、局所効果と干渉効果をポテンシャルアウトカムにより定義した。未計測共変量Uと曝露Zの固有の空間依存は、潜在的な共通トレンドとして表した。直接空間交絡・間接空間交絡・干渉とその組合せからなる6つのDAGシナリオを解析した。解析の結果、次を理論的に示した。空間交絡と干渉は互いに化ける。曝露が空間的だと標準解析は無効になり得る。したがって局所と近傍の共変量を同時に調整し、局所効果と干渉効果を同時に推定すべきである。次に、相互接続した空間ネットワークでは、隣接行列と近傍平均曝露により両効果を定義した。推定はベイズ因果推論(欠測ポテンシャルアウトカムの事後分布からの補定)の枠組みで行う。未計測交絡がある場合、アウトカムモデルに空間ランダム効果を入れるだけでは不十分である。曝露モデルの同時指定が必要になる。著者らは(U,Z)にCAR型精度行列を持つ多変量正規の同時分布を仮定した。線形のポテンシャルアウトカムモデルの下、リング状グラフでの識別定理を証明した(Theorem 1)。未計測空間交絡が存在しても、標本数無限大の極限で局所効果・干渉効果を含む全パラメータが識別可能である。評価はシミュレーションとSO2排出の実データ解析(MCMC・B-スプラインの曝露反応曲線・感度分析)で行った。

【結果】

  • シミュレーション(6シナリオ×3標本数×500データセット)では、未計測空間交絡があると、測定共変量のみを調整したOLSが大きく偏った。95%区間の被覆率は局所効果で0〜0.3%まで崩壊した。
  • 提案法は同じ交絡下でバイアスを大幅に縮小した。全シナリオで被覆率をほぼ名目(約90〜99%)に維持した。
  • 交絡が無いシナリオでは、提案法はほぼ不偏だった。OLSに対する効率の損失もわずかだった。
  • 実データ(SO2→心血管死亡)では、OLSと提案法の曝露反応曲線が互いの信用区間の内側にあった。仮定した形の未計測空間交絡は、OLSを偏らせるほど強くなかった。ただし空間相関パラメータの事後平均は−0.26だった(95%CI −0.41〜−0.10)。曝露と局所的に相関する未計測変数の存在自体は示唆された。
  • 曝露を対数線形で入れる感度分析では、未計測空間交絡の証拠がやや現れた。提案法の効果推定はOLSより正方向にシフトした。

【考察】

  • 空間交絡と干渉は互いに誤認され得る。このため実務では、局所と近傍の共変量調整、および局所効果と干渉効果の同時推定を必ず行うべきである。
  • 未計測空間交絡は完全な欠落変数だけから生じるのではない。測定誤差や関数形の誤指定からも生じ得る。
  • 限界: アウトカム変数自体の固有の空間依存は未対応である(実データでもその兆候がみられた)。識別定理はリング状グラフと線形モデルの設定で証明されている。一般の空間構造は今後の課題である。近傍曝露の地理的近接による定義は、大気輸送の実態と乖離し得る。



文献:The Central Role of the Propensity Score in Observational Studies for Causal Effects

DOI: 10.1093/biomet/70.1.41
URL: https://doi.org/10.1093/biomet/70.1.41
書誌: Rosenbaum, P. R., & Rubin, D. B. (1983). The Central Role of the Propensity Score in Observational Studies for Causal Effects. Biometrika, 70(1), 41–55.

AI要約

【背景】

  • 無作為化のない観察研究では、処置群と対照群で共変量の分布が系統的に異なる。そのため結果の単純比較は交絡バイアスを受ける。
  • 多数の共変量で直接に層別やマッチングを行うと、セルは指数的に細分化される。比較相手のいないセルが続出し、調整は実行不能になる。
  • 多次元の共変量を、交絡調整に十分な情報を保ったまま1次元に縮約するスコアの理論的基盤が求められていた。

【手法】

本論文は理論論文である。潜在結果枠組みの下で議論を進める。この枠組みでは、各個体の処置下と非処置下の結果のうち一方しか観測できない。まず傾向スコアe(x)を定義する。これは、共変量xを与えたときに処置を受ける条件付き確率である。より一般に「バランシングスコアb(x)」を定義する。これは、b(x)で条件付けると共変量xと処置指示zが独立になる関数である。次に両者の関係を定理群として整理する。さらに、因果効果の識別条件として「強く無視できる処置割当(strongly ignorable treatment assignment)」を導入する。この条件は2つの要求からなる。第1に、xを与えたとき潜在結果の組(r1, r0)と処置zが条件付き独立である。第2に、すべてのxで0<e(x)<1が成り立つ。後半の条件は、のちにoverlap(共通サポート)条件と呼ばれる。この条件の下で、同じスコア値をもつ処置群と対照群の結果の差の期待値は、その点での平均処置効果に一致する。応用として、傾向スコアによるペアマッチング・層別(サブクラス化)・共分散調整の3手法を統一的に正当化する。その際、単一共変量の5層別に関するCochran(1968)の結果を、多次元共変量の場合へ拡張する形で接続する。実務では傾向スコアは未知である。そのため、ロジスティック回帰などによる推定スコアの利用も論じている。

【結果】

  • 傾向スコアe(x)はバランシングスコアである。すなわち、e(x)で条件付けると共変量xと処置zは独立になる。
  • b(x)がバランシングスコアであるための必要十分条件は、e(x)がb(x)の関数になることである。すなわち傾向スコアは「最も粗い」バランシングスコアである。これにより、多次元共変量の調整を1次元に縮約できる。
  • 処置割当がxを与えて強く無視できるならば、任意のバランシングスコアを与えても強く無視できる。このとき、同一スコア値での処置群と対照群の結果の差の期待値は、その点での平均処置効果に一致する。
  • この理論により、傾向スコアによるペアマッチング・層別・共分散調整が、因果効果の不偏推定として統一的に正当化される。
  • 傾向スコアの5層別は、測定された共変量による偏りの約9割を除去すると期待できる。

【考察】

  • 傾向スコアが釣り合わせるのは、測定された共変量の分布のみである。未測定の交絡には対処できない。
  • 割当の無視可能性は検証不能な仮定である。感度分析などによる補完が必要になる。
  • 0<e(x)<1(overlap)は識別の必須要件である。処置確率が0や1に近い領域では、「共変量が同じで処置だけが違う」比較相手が実質的に存在しない。その領域の効果推定は、モデルによる外挿にならざるを得ない。



文献:Principles of confounder selection

DOI: 10.1007/s10654-019-00494-6
URL: https://doi.org/10.1007/s10654-019-00494-6
書誌: VanderWeele, T. J. (2019). Principles of confounder selection. European Journal of Epidemiology, 34(3), 211–219.

AI要約

【背景】

  • 観察研究の因果推論では、調整すべき共変量集合の選択が決定的である。Pearlのバックドア基準は、全共変量間の因果構造(完全なDAG)の知識を要する。この知識は、実際には得られないことが多い。
  • 実務でよく使われる「処置前の全変数を調整する」基準は、コライダー調整によるM-biasを招きうる。「曝露と結果の共通原因のみを調整する」基準は、本来バイアスを消せる変数の調整漏れを招きうる。
  • 統計的な変数選択(10%変化基準、前進/後退選択など)は、交絡因子と媒介因子を区別できない。実質的知識の代替にはならない。

【手法】

各共変量について「曝露の原因か」「アウトカムの原因か」だけが分かると想定する。この完全なDAGより弱い知識の下で、実用的な交絡選択基準を提案する。まず、反実仮想の記法で交絡制御の条件(Ya⊥A|C)を定義する。次に、2つの通説的基準の失敗例をDAGで示す。処置前基準の下では、コライダーである処置前変数Lの調整がバックドアパスを開く(M-bias)。共通原因基準は、未測定共通原因の代理変数Cの調整を見落とす。そのうえで、disjunctive cause criterion(曝露またはアウトカムの原因である共変量をすべて調整する基準)を導入する。理論的根拠は次の性質である(VanderWeele & Shpitser 2011)。測定共変量のいずれかの部分集合で交絡制御が可能なら、この基準で選んだ集合でも必ず制御が可能になる。さらに、実用上の2つの修正を加える。第一に、操作変数と分かっている変数を除外する。除外の目的は、未測定交絡下でのバイアス増幅(Z-bias)の回避である。第二に、未測定共通原因の代理(proxy)変数を追加する。加えて、共変量の測定タイミングの問題を論じる。BMIと運動の例では、同時測定は交絡と媒介を区別できない。処置より前の時点の測定値の調整が望ましい。最後に、統計的選択法(前進/後退選択、change-in-estimate、高次元傾向スコアHDPS、TMLE等の機械学習)を体系的に評価する。評価の観点は、交絡制御の妥当性・選択後推論・非崩壊性である。

【結果】

  • 「修正disjunctive cause criterion」を定式化した。すなわち、曝露またはアウトカム(または双方)の原因である共変量をすべて調整する。既知の操作変数は除外する。未測定共通原因の代理変数は追加する。
  • disjunctive cause criterionは次の性質を持つ。測定共変量のどこかに交絡制御に十分な部分集合が存在すれば、この基準の選択集合も必ず十分になる。処置前基準と共通原因基準は、この性質を持たない。
  • 操作変数の調整は、未測定交絡の下でバイアスをむしろ増幅しうる(Z-bias)。このため、判明している操作変数は調整から除外すべきと整理した。
  • change-in-estimate基準は、オッズ比・ハザード比の非崩壊性の下で不適切である。また、データ駆動の変数選択後にそのまま当てはめた信頼区間は無効になる。
  • 統計的選択を使う場合も、初期共変量集合そのものが交絡制御に十分であることが前提になる。したがって、実質的知識は省略できないと結論した。

【考察】

  • ・完全なDAGの知識なしでも、理論的裏付けのある調整集合を設計できる。ただし、各共変量が曝露/アウトカムの原因か否かという実質的知識は依然として必要である。
  • ・TMLE等の原理的な機械学習ベースの選択は有望とされる。ただし、小標本での性能は未解明とされる。



文献:Double/Debiased Machine Learning for Treatment and Structural Parameters

DOI: 10.1111/ectj.12097
URL: https://doi.org/10.1111/ectj.12097
書誌: Chernozhukov, V., Chetverikov, D., Demirer, M., Duflo, E., Hansen, C., Newey, W., & Robins, J. (2018). Double/Debiased Machine Learning for Treatment and Structural Parameters. The Econometrics Journal, 21(1), C1–C68.

AI要約

【背景】

  • 高次元の局外(ニュイサンス)パラメータの存在下で、低次元の因果パラメータθ0を推定したい。しかし、局外パラメータ空間の複雑さが標本サイズとともに増える現代的設定では、古典的セミパラメトリック理論の前提(Donsker性など)が破綻する。
  • 機械学習で局外関数を推定して素朴に推定式へ代入すると、正則化バイアスと過学習がθ0の推定量に一次で流れ込む。その結果、√N一致性が失われる。
  • lasso・ランダムフォレスト等の任意の機械学習手法を局外推定に使いながら、θ0の妥当な信頼区間を得られる一般理論が必要だった。

【手法】

本論文は、部分線形回帰モデル Y=Dθ0+g0(X)+U、D=m0(X)+V を主導例とする。まず、素朴なプラグイン推定量の誤差を分解し、g0の学習バイアスに由来する項の発散を示す。この問題を除去する要素として、2つが提案される。第一は、Neyman直交スコアの使用である。これは、局外パラメータの推定誤差への感度が一次でゼロになるモーメント条件を指す。具体的には、処置Dから調整変数Xの効果を回帰m0で取り除いた残差と、結果Yからg0の寄与を取り除いた残差の双方を使って回帰する。この「二重の予測」が、double machine learning(DML)の名の由来である。第二は、cross-fitting(交差適合)である。標本を分割し、局外関数を補助標本で学習し、主標本でθ0を推定する。役割を入れ替えて平均すると、過学習による自己バイアスを避けつつ全標本の効率を回復できる。理論条件は、局外推定量の収束レートに関する弱い要請のみである。このため、lasso・ridge・ランダムフォレスト・ブースティング木・深層ニューラルネットやそれらのアンサンブルを利用できる。この一般理論は、部分線形回帰、部分線形IVモデル、非交絡下のATE・ATT、IV設定のLATEの推定に適用された。さらに、3つの実証例(ペンシルベニア再就職ボーナス実験、401(k)の資産効果、Acemoglu et al. (2001)の制度と経済成長のIV)が使用法を例示する。

【結果】

  • DML推定量は、真値のN^(−1/2)近傍に集中する。近似的に不偏で、正規分布に従う。妥当な信頼区間も構成できる。これらの性質が、弱い条件下で証明された。
  • 数値実験では、非直交の素朴な機械学習推定量の分布が真値から大きく偏った。正規近似も破綻した。直交化したDML推定量は、ほぼ不偏だった。正規近似も良く成立した。
  • ボーナス実験の再分析では、失業期間(対数)へのATEがどの機械学習手法でも−0.073〜−0.085となった。いずれも、5%水準で有意だった。
  • 401(k)適格性の純金融資産へのATEは、無調整で$19,559(SE 1413)だった。柔軟な調整により、推定値は大幅に減衰した。適格性を操作変数とする加入のLATEは、全手法で正かつ有意($8,944〜$11,764)だった。
  • lasso・回帰木・フォレスト・ブースティング・ニューラルネット・アンサンブルの推定値は、広く整合した。この結果は、直交化の理論的予測と一致する。

【考察】

  • Neyman直交化とcross-fittingという2つの単純な要素が、任意の高性能な機械学習器を因果パラメータ推定へ安全に組み込む汎用手続きを与える。
  • 局外関数の推定には、収束レート条件が必要である。極端に複雑な局外関数では、推定は依然として失敗しうる。
  • 401(k)の例では、5分割の交差適合が2分割より標準誤差を小さくした。ただし、分割数と精度の一般的関係はないと注意されている。