CRM-аналитика
Один клиент участвует в нескольких тестах: когда это портит вывод
Время чтения: 4 мин
Уровень материала: Для экспертов
Содержание
Пока одна команда тестирует welcome — серию сообщений для новых клиентов, другая меняет частоту промо, а третья запускает новые рекомендации. Один клиент оказывается в трёх экспериментах. Запретить все пересечения просто, но это резко уменьшит доступную аудиторию. Разрешить их без правил тоже опасно: воздействия могут усиливать или отменять друг друга.
Взаимодействие означает, что эффект одного изменения зависит от наличия другого. Например, дополнительное письмо работает иначе, когда частотный лимит уже заполнен. Вопрос состоит не только в совпадении участников, но и в том, какое сравнение создаёт совместное назначение.
Когда пересечение допустимо
Если назначения независимы, другая механика в среднем одинаково представлена в тесте и контроле. Это может сохранять корректность оценки эффекта при существующей смеси других воздействий. Но результат относится именно к этой смеси, а не обязательно к будущему запуску всех изменений на 100% базы.
Инфраструктура Google, описанная Tang и соавторами, использует слои для организации одновременно идущих экспериментов. Практический смысл такого подхода — управлять совместимостью и назначением, а не объявлять любые пересечения безвредными.
При этом независимые назначения не устраняют нехватку мощности для измерения взаимодействия. Если важен совместный эффект, его нужно включить в дизайн и расчёт объёма.
Составьте карту совместимости
| Пара экспериментов | Возможный конфликт | Разумный вариант |
|---|---|---|
| Две версии одного письма | Одновременное применение невозможно | Общий взаимоисключающий слой |
| Скидка и бесплатная доставка | Совместная экономика отличается | Факторный дизайн с четырьмя комбинациями |
| Welcome и новый лимит контактов | Лимит меняет фактическую серию | Явно измерять совместное действие |
| Несвязанные изменения разных задач | Слабое ожидаемое взаимодействие | Независимое назначение и общий журнал |
Решение принимают по гипотезе и клиентскому пути. Две механики разных каналов могут конфликтовать сильнее, чем два изменения одного интерфейса.
Пример четырёх комбинаций
Факторный дизайн одновременно варьирует несколько условий. Для двух механик с вариантами «включена» и «выключена» получаются четыре комбинации. Это позволяет оценить и отдельные изменения, и их совместное действие.
Условный пример. Клиентов случайно распределили по четырём вариантам. Средний вклад за период составил:
| Вариант | Вклад на клиента |
|---|---|
| Без новых механик | 100 ₽ |
| Только А | 120 ₽ |
| Только Б | 115 ₽ |
| А и Б вместе | 122 ₽ |
По отдельности приросты равны 20 и 15 рублям. Их сумма — 35, но совместный прирост составил 22. Разница взаимодействия равна 122 − 120 − 115 + 100 = −13 рублей.
Таблица показывает арифметику взаимодействия, а не его статистическую доказанность. Для вывода нужны объём, разброс и соответствующий интервал. Отсутствие значимого взаимодействия при слабом тесте не доказывает, что его нет.
Сохраните устойчивое назначение
Для каждого эксперимента нужны версия, единица рандомизации, признак группы и время назначения. Клиент не должен случайно менять вариант после повторного входа в сегмент или обновления профиля.
Если у двух тестов один и тот же способ разбиения без независимого ключа, их группы могут систематически совпадать. Проверьте фактическую таблицу сочетаний, а не только настройки 50/50 по отдельности.
Исключения из одной механики после реакции на другую требуют особого внимания. Например, покупка из А остановила Б. Тогда анализ только реально получивших Б уже отбирает людей по событию, на которое повлияла А.
Как трактовать результаты
Покажите, в каких других тестах участвовала аудитория, были ли назначения независимыми и какие сочетания анализировались. Если следующий запуск изменит фон воздействий, отдельный успешный тест может потребовать совместного подтверждения.
Для ежедневной работы полезен реестр экспериментов с владельцами, периодами, слоями и конфликтами. Он позволяет параллельно проверять совместимые идеи и заранее выделять ситуации, где нужен общий дизайн. Это экономит трафик без потери ясности относительно того, какой эффект команда измерила.
Источники
Tang D., Agarwal A., O’Brien D., Meyer M. Overlapping Experiment Infrastructure: More, Better, Faster Experimentation. Proceedings of KDD. 2010.