実践としての AI · 中級

実験:変更が何かを改善したことをどう知るか

一行でいうと: 同じトラフィックで同時に二つのバージョンを比較する——すべての「前後比較」は世界も測定し、あなただけではない。

なぜ前後比較でないか

季節性、実行中のキャンペーン、ユーザーミックスの変化——すべてが影響する。同時のランダム分割はそれらを中和し、だから信頼できる答えを与える唯一のツールだ。

正しく実行する方法

主要指標、サンプルサイズ、期間を事前に決め、改善が現れた瞬間に止めない——早停は自分を欺く最も一般的な方法だ。

他の何かを犠牲にして達成された改善を検出するために、少なくとも一つのバランス指標を保持する。

十分なトラフィックがないとき

内部システムには常に統計的なサンプルがあるわけではない。その場合、固定の評価セットで比較し、定性的なチェックを追加する:二十の実際のケース、二人の評価者、根拠のある決定。

さらに深く

各実験を一箇所に記録する:仮説、指標、結果、決定。組織は何が試みられたかを忘れ、同じアイデアを年に一度実行する。実験ログは最も安い組織の記憶だ。