タグ・4本
GBDT
LightGBMでゼロが多い件数・金額を予測する—Poisson・Tweedieの選び方
ゼロが多い件数・金額データで、LightGBMのPoisson・Tweedie・二乗誤差・log1pを比較しました。1行ごとの誤差と予測合計で結果が逆になった条件から、目的関数を選ぶ基準を整理します。
SHAPの特徴量重要度は正しい?—正解つきデータでずれの原因を検証
SHAPの特徴量重要度は本当に当たっているのか、真の答えが分かる合成データで採点しました。重要度に開きがあれば木モデルの並び順は当たる一方、効果がゼロの列にも重要度が配られ、相関が強いと上位へ食い込みます。手元のモデルを乱数列で点検する手順まで載せています。
特徴量の「全部盛り」はGBDTの精度を下げるか—5手法を実測比較
特徴量を全部盛りにしても、GBDT(LightGBM)の held-out 精度は今回は壊れませんでした。数値信号が豊富な合成データではむしろ改善する一方、実データ adult では精度が動かないまま特徴量数と学習時間だけが数倍に増えました。合成2種と実データ2種でablation比較し、手元で試せる実装例つきで記録します。
XGBoost・LightGBM・CatBoost比較—精度と学習時間で選ぶ
既定設定ではCatBoostのROC-AUCが最も高いものの、その差は学習データが数万件まで増えるとほぼ消えました。学習時間はCatBoostが全条件で最も遅く、最速ライブラリの16〜40倍。二値分類3データセット計10条件の実測から、データ規模と学習回数に応じた選び方を整理します。