落地的人工智能 · 综合

实验:怎么知道这次改动确实改善了什么

一句话: 在同一时间、同一批流量上比较两个版本——任何「前后对比」度量的都不只是你,还有整个世界。

为什么不能用前后对比

季节性、正在跑的活动、用户构成的变化——它们都有影响。同时进行的随机分流能中和掉这些因素,所以它是唯一能给出可靠答案的工具。

怎么跑才对

事先定好主指标、样本量和实验时长,并且不要在改善刚一出现时就停下——提前停止是最常见的自欺方式。

至少保留一个制衡指标,用来发现那种「以牺牲别处为代价换来的改善」。

流量不够的时候

内部系统里未必有统计意义上的样本。那就在一个固定的评估集上比较,并加上定性检查:二十个真实case、两位评估者、一个有理由的结论。

深入一层

把每个实验记录在同一个地方:假设、指标、结果和决定。组织会忘记已经试过什么,然后一年一次地重跑同一个想法。实验日志是最便宜的组织记忆。