タグ・2本
SMOTE
不均衡データにSMOTEやクラス重みを最初から入れるべきか、LightGBMの無処置を基準に測りました。合成データ4水準でも実データ1件でも、4つの対策は無処置の平均PR-AUCを一度も上回れません。少数派1%では無処置0.558に対しSMOTE 0.494で、差は不均衡が強いほど広がりました。
交差検証の前に前処理するとCVはどれだけ変わるか—特徴選択・SMOTE・標準化を実測
交差検証の前に前処理を全データへ当てると、CVスコアが本来より高く出ることがあります。4種類を測ると、標準化と欠損補完では差を確認できず、列数の多いデータでの特徴選択で平均0.027、分割前のSMOTEは木モデルで0.1を超えました。合成データ10シードの実測とコピペで動くサンプルつき。