シリーズ
ひとつのテーマを工程ごとに切り分けて、条件を揃えたまま順に検証しています。どこから読んでも構いませんが、シリーズのページには連載順に並べてあります。
日本語RAGの検索品質
全7本
日本語RAGの「検索が当たるか」を工程ごとに実測する
表形式データの機械学習
全2本
どのモデルで学習するかを、条件を揃えた比較で決める
モデル解釈と特徴量重要度
全7本
SHAP・LIME・PDPなどの説明手法をどこまで信じてよいかを測る
回帰の評価指標と目的関数
全4本
RMSE・MAEなどの指標と目的関数・予測区間の選び方を実測で決める
時系列予測と変化点検知
全2本
定番手法を素朴な基準と同じ土俵に載せて測る
機械学習モデルの運用
全3本
モデルを本番で動かし続けるための検証・保存・速度を実測する
前処理と特徴量はどこまで効くのか
全3本
定番の前処理と特徴量づくりを、一つずつ入れ外しして測る
不均衡データと予測確率の扱い方
全4本
少数派をどう評価し、しきい値と確率をどう決めるか
データリークと検証の落とし穴
全4本
検証スコアが本番より良く出る仕組みを、盛れ幅で測る
モデル比較と統計の作法
全3本
「AがBに勝った」をどこまで信じてよいかを測る
Claude Code活用術の実測検証
全4本
Claude Codeの設定や指示で、挙動がどう変わるかを比べる