シリーズ・全3本

モデル比較と統計の作法

モデルAがモデルBをわずかに上回った。この差は本物でしょうか、それともたまたまでしょうか。このシリーズでは、乱数の種を変えるだけで順位がどれだけ入れ替わるのか、候補をたくさん並べて一番を選ぶと何が起きるのか、そして有意差という言葉をどう扱うべきかを、シミュレーションと実データの両方で確かめています。A/Bテストの途中確認や、LLMによる自動評価の平均といった、比較の結論を歪める手続きの問題も同じレンズで扱います。当ラボが比較記事を書くときに自分へ課している作法を、そのまま実測で確かめる場でもあります。

このシリーズで確かめていること

連載順に読む