Каждое утро команда открывает A/B-отчёт. На пятый день p-value стал меньше 0,05, и эксперимент остановили. При следующем запуске победил уже другой вариант. Проблема может быть в правиле остановки: команда фактически давала случайному колебанию много возможностей стать решающим.

Фиксированный тест рассчитан на заранее определённый момент анализа или объём данных. Последовательный анализ специально учитывает, что результат будут оценивать по мере накопления наблюдений. Сам просмотр дашборда не портит данные; последствия возникают, когда от увиденного меняют срок, объём, метрику или решение о победе.

Что показывают методические работы

Johari, Pekelis и Walsh рассматривают статистический вывод, сохраняющий заявленные свойства при непрерывном наблюдении в рамках заданной последовательной процедуры. Их работа даёт основу для корректного мониторинга, но не делает любой обычный p-value пригодным для ежедневной остановки.

Для команды CRM практический выбор состоит в том, чтобы заранее решить, какая процедура доступна и реализована. Название «sequential» в интерфейсе нужно сопоставить с документацией метода, метрики и правила завершения.

Разделите технический мониторинг и оценку эффекта

Доставку, поломку ссылок, повторные списания, утечки данных и другие серьёзные сбои проверяют сразу. Для прекращения опасного воздействия не нужно ждать планового финала статистического теста.

Однако остановленный из-за инцидента эксперимент нельзя автоматически объявить доказательством пользы оставшегося варианта. Причину остановки сохраняют, вывод ограничивают и при необходимости проводят новый корректный запуск.

Для бизнес-эффекта заранее задают основную метрику, минимально полезное изменение, максимальную длительность и правила принятия решения. Отдельно фиксируют защитные показатели и реакцию на них.

Три рабочих варианта

ПодходКак принимается решениеЧто важно сохранить
Один финальный анализПо достижении плана и созревании окнаНе останавливать на первом удобном результате
Запланированные промежуточные проверкиПо согласованным границамУчёт всех предусмотренных просмотров
Последовательный методПо границам выбранной процедурыПодходящая метрика и корректная реализация

Для первого варианта можно ежедневно смотреть качество данных, не принимать решений о победе и дождаться установленного окончания. Это организационно проще, чем внедрять сложный метод ради каждого письма.

Пример консервативного плана

Условный пример. Команда заранее предусматривает пять проверок одного эффекта. Один простой способ контролировать общую вероятность ложного обнаружения на уровне не выше 5% — использовать для каждой проверки порог 1% по правилу Бонферрони.

Такой вариант может быть излишне консервативным и уступать специализированным последовательным методам по мощности — вероятности обнаружить заданный эффект. Он приведён для понимания цены повторных проверок. Пять порогов по 5% не дают тот же контроль ошибки, а дополнительные метрики и варианты создают ещё одну задачу множественных сравнений.

Если команда выбирает другой метод распределения ошибки между просмотрами, его параметры задают до анализа. Нельзя сначала пять раз посмотреть обычный результат, а потом назвать эту историю заранее спланированным последовательным тестом.

Дождитесь результата каждого участника

Для покупки за 30 дней участник, назначенный вчера, ещё не прошёл полное окно. При ежедневном анализе состав зрелой выборки меняется. Метод должен учитывать, когда результат становится доступным и какие участники входят в текущий расчёт.

Не сравнивайте 30-дневную выручку старых участников с двухдневной выручкой новых как одинаковые исходы. При фиксированном анализе обычно отдельно заканчивают набор и затем дожидаются последнего окна. При последовательной процедуре правило созревания также фиксируют заранее.

Что сохранить в протоколе

Запишите план просмотров, метод, границы, максимальный срок, окно метрики и все фактические решения. Как и в фиксированном тесте, проверяйте SRM и сохранность журнала воздействий. Если правила пришлось изменить из-за внешнего события, обозначьте изменение и его влияние на вывод.

Ежедневный дашборд полезен для управления экспериментом. Статистическое утверждение о победе требует процедуры, соответствующей тому, как команда действительно наблюдала и останавливала тест.

Источники

Johari R., Pekelis L., Walsh D. J. Always Valid Inference: Bringing Sequential Analysis to A/B Testing. arXiv:1512.04922. Препринт 2015; редакция 2019.