В эксперименте сравнивают выручку на клиента, но одни участники и раньше покупали часто, а другие почти не покупали. Случайное распределение делает группы сопоставимыми в среднем, однако в конкретном тесте их состав может различаться. История до запуска помогает учесть часть этих различий.

CUPED — метод повышения точности оценки эффекта с помощью данных, не затронутых экспериментом. Например, выручки того же клиента до назначения варианта. Он не исправляет сломанную рандомизацию и не превращает историческое сравнение в эксперимент.

Что именно становится точнее

Microsoft описывает CUPED как способ уменьшить разброс оценки среднего эффекта между возможными повторениями эксперимента. Речь идёт о более точном сравнении вариантов, а не об исчезновении различий между клиентами. Польза зависит от того, насколько выбранные исходные признаки объясняют последующий результат. [1]

Простая версия метода корректирует результат клиента на отклонение его показателя предпериода от общего среднего. Сила корректировки определяется коэффициентом связи между прошлым и будущим показателями.

Предпериод должен закончиться до воздействия. Покупки после первого тестового письма уже могут зависеть от варианта; использовать их как «исходную характеристику» нельзя.

Пример смысла корректировки

Условный пример. У теста средняя выручка в период эксперимента — 550 рублей, у контроля — 500. Но до запуска будущие участники теста в среднем покупали на 1 000 рублей, контроля — на 900. Разница предпериода составила 100 рублей.

Предположим, заранее выбранная процедура оценила коэффициент корректировки как 0,4. Тогда разница после простой общей корректировки составит 50 − 0,4 × 100 = 10 рублей. Часть исходных 50 рублей могла объясняться случайным различием состава групп.

Корректировка может и увеличить оценку, если до эксперимента группа теста была слабее. Метод не должен быть настроен на обязательное уменьшение или увеличение результата. Нельзя выбирать коэффициент по тому, какой ответ удобнее бизнесу.

Как задать процедуру

ПараметрЧто определить до анализа
Основной результатНапример, выручка на всех назначенных клиентов за 30 дней
Исходный признакВыручка за 30 дней до назначения
Центрирование — вычитание опорного среднегоОбщее среднее или заранее определённая опорная величина
Оценка коэффициентаСогласованный регрессионный метод и расчёт неопределённости
Отсутствующая историяОтдельное правило для новых клиентов и ошибок данных
ПроверкаA/A-тесты и сопоставление с обычной оценкой

В A/A-проверке обе случайные группы получают одинаковую практику. Она помогает проверить, не создаёт ли процедура слишком много ложных различий там, где отдельное воздействие не вводилось.

Если центрировать исходный признак отдельно внутри каждой группы и затем только сравнить средние скорректированных значений, желаемая поправка на различие групп пропадёт. Реализацию должен проверять аналитик, понимающий конкретную оценочную процедуру.

Сколько можно выиграть

В простейшей линейной постановке с одним подходящим признаком остаточная дисперсия связана с квадратом корреляции. При корреляции 0,6 ориентир уменьшения дисперсии — 36%, а стандартной ошибки — 20%. Стандартная ошибка выражает случайную неопределённость оценки в единицах исходной метрики: например, в рублях на клиента. Чем она меньше, тем обычно уже доверительный интервал при прочих равных. Эти значения относятся к условиям этой модели, а не являются обещанием для любой CRM-базы. [2]

Если история слабо связана с будущими покупками, выигрыш будет небольшим. Для денежной метрики дополнительно проверьте тяжёлый хвост выручки: корректировка по истории не отменяет влияние редких крупных заказов. Если данных мало, оценка самой связи нестабильна. Сложная модель с множеством признаков требует отдельной защиты от переобучения и корректного расчёта интервала.

Как обращаться с новыми клиентами

Отсутствие покупки в известном полном предпериоде — реальный ноль. Отсутствие истории из-за недавней регистрации или сбоя — другое состояние. Не подменяйте их друг другом без правила.

Можно заранее разделить новых и существующих клиентов, использовать индикатор доступности истории и оценивать общий результат согласованным способом. Исключать всех без истории после запуска опасно: изменится аудитория, к которой относится вывод.

Что должно остаться в отчёте

Покажите обычную и скорректированную оценки, их интервалы, долю клиентов с доступной историей и описание признаков. Значимое расхождение методов — повод проверить реализацию и данные.

CUPED полезен, когда повышает точность заранее определённого сравнения. Его не стоит добавлять в конце анализа только потому, что обычный тест не дал желаемой значимости.

Источники

1. Cosgrove L., Townsend J., Litz J. Deep Dive Into Variance Reduction. Microsoft Research. 15 ноября 2022.

2. Deng A., Xu Y., Kohavi R., Walker T. Improving the Sensitivity of Online Controlled Experiments by Utilizing Pre-Experiment Data. Proceedings of WSDM. 2013.