A/B тесты

Разные результаты двух рассылок ещё не означают качественный тест. Выбор аудитории, пересечение воздействий, срок наблюдения и правило остановки могут объяснить разницу лучше, чем содержание вариантов.

Начните с распределения и основной метрики. Затем изучите дизайн сложных тестов, малые выборки и ситуации, когда результат не позволяет уверенно выбрать победителя.

Вы сможете заранее проектировать сравнение, которое отвечает на бизнес-вопрос, и не менять правила вслед за цифрами.

26 статей

Понять задачу и основные различия

Для начинающих · 3 мин

A/B-тест: как проверить, какой вариант действительно лучше

Как провести A/B-тест письма, предложения или интерфейса. Разбираем гипотезу, случайное распределение, выбор метрики и ошибки при поиске победителя.

Даёт начальную конструкцию A/B-теста.

Разберём

  • Как проверить, какой вариант действительно лучше?
  • Что нужно определить до сравнения двух вариантов?

Для начинающих · 2 мин

Рандомизация: как распределить клиентов, чтобы сравнение имело смысл

Как случайное распределение помогает сравнивать тест и контроль. Разбираем пример, отличие от случайной выборки и причины сохранять состав групп.

Объясняет основу причинного теста.

Разберём

  • Как распределить клиентов, чтобы сравнение имело смысл?
  • Почему случайное распределение помогает сравнению?

Для начинающих · 2 мин

Тестовая группа: на ком проверяют новое предложение

Как сформировать тестовую группу и оценить результат воздействия. Объясняем, почему нельзя оставлять в анализе только открывших письмо или покупателей.

Вводит единицу участия в эксперименте.

Разберём

  • Что такое тестовая группа в эксперименте?
  • Кого включать в анализ после назначения варианта?

Для начинающих · 2 мин

Единица рандомизации: кого именно распределяют между вариантами

Как выбрать единицу рандомизации для CRM-эксперимента. Разбираем общие аккаунты, повторные заказы и отличие единицы распределения от строки данных.

Связывает назначение воздействия и анализ.

Разберём

  • Как выбрать единицу рандомизации?
  • Когда распределять человека, аккаунт или другую единицу?

Для начинающих · 2 мин

Основная метрика эксперимента: по какому показателю принимать решение

Как выбрать основную метрику A/B-теста и не искать победителя среди десятков показателей. Разбираем бизнес-цель, формулу и защитные метрики.

Фиксирует основание решения в эксперименте.

Разберём

  • Как выбрать основную метрику эксперимента?
  • Почему главный показатель выбирают до запуска?

Для начинающих · 3 мин

Минимальный обнаруживаемый эффект: какое изменение способен заметить тест

Что означает MDE и как он связан с размером выборки и мощностью. Объясняем, почему важный для бизнеса эффект может оказаться слишком мал для теста.

Соединяет план теста с его чувствительностью.

Разберём

  • Что такое минимальный обнаруживаемый эффект?
  • Как размер выборки связан с обнаруживаемым изменением?

Для начинающих · 2 мин

Кластерная рандомизация: когда в тест распределяют магазины или команды

Как тестировать изменения на уровне магазинов, компаний и команд. Объясняем, почему большое число покупателей не заменяет достаточное число кластеров.

Вводит тестирование группами.

Разберём

  • Когда в тест распределяют магазины или команды?
  • Почему участников внутри магазина нельзя считать полностью независимыми?

Для начинающих · 2 мин

Загрязнение контрольной группы: что делать, если контроль тоже получил предложение

Как контроль получает проверяемое воздействие через другие кампании, аккаунты и клиентов. Разбираем последствия для оценки и способы профилактики.

Показывает угрозу смыслу сравнения.

Разберём

  • Что делать, если контроль тоже получил предложение?
  • Как контроль получает проверяемое воздействие помимо теста?

Выбрать и спроектировать решение

Для экспертов · 4 мин

Как тестировать CRM при маленькой базе и не обещать недостижимую точность

Что можно проверить на небольшой клиентской базе. Расчёт доступной точности, выбор гипотезы и действия, когда участников недостаточно.

Согласовывает вопрос теста с доступной точностью.

Разберём

  • Какой эффект небольшая база действительно способна обнаружить?

Для экспертов · 4 мин

Когда можно смотреть на результаты теста каждый день

Как наблюдать A/B-тест и корректно выбирать момент остановки. Фиксированный анализ, промежуточные проверки и созревание результатов клиентов.

Определяет допустимый порядок просмотра результатов.

Разберём

  • Чем мониторинг ошибок отличается от досрочного выбора победителя?

Для экспертов · 4 мин

Один клиент участвует в нескольких тестах: когда это портит вывод

Когда параллельные эксперименты совместимы. Слои назначения, карта конфликтов и пример четырёх вариантов для оценки взаимодействия механик.

Согласовывает несколько экспериментов на одной аудитории.

Разберём

  • Как учитывать участие клиента в нескольких экспериментах?
  • Когда параллельные воздействия меняют смысл сравнения?

Для экспертов · 4 мин

Как организовать постоянную контрольную группу CRM и не потерять её смысл

Как организовать глобальный holdout CRM. Паспорт программы, правила входа, сервисные исключения, одинаковый горизонт и контроль загрязнения.

Определяет измеряемую программу CRM целиком.

Разберём

  • Какие воздействия исключать из постоянного контроля?

Для экспертов · 4 мин

Как рассчитать тест по магазинам, если покупателей много, а магазинов мало

Как спланировать тест, когда покупателей много, а магазинов мало. ICC, дизайн-эффект, веса точек и ограничения анализа небольшого числа кластеров.

Задаёт единицу и ограничения кластерного теста.

Разберём

  • Почему множество покупателей не заменяет достаточное число магазинов?

Для экспертов · 4 мин

Нужен ли интерактивный email: как оценить пользу до разработки

Оцените AMP-письма до сложной разработки. Совместимость, запасная версия, порог окупаемости и дизайн пилота с обычным письмом для сравнения.

Обосновывает усложнение email-шаблона.

Разберём

  • Как проверить пользу интерактива до большой разработки?

Для экспертов · 3 мин

Как считать результат, если сегмент изменился после запуска

Как сохранить исходную аудиторию и не потерять купивших клиентов в отчёте. Анализ по назначению, динамические сегменты, новые входы и проверка групп.

Сохраняет исходное назначение участников теста.

Разберём

  • Почему аудиторию анализа нужно зафиксировать до воздействия?

Проверить результат и исправить ошибки

Для экспертов · 5 мин

Как проверить пользу оптимизации времени отправки

Как сравнить ИИ с обычным расписанием. Сопоставимые группы, окно измерения, открытия Apple Mail и экономика модуля после дополнительных расходов.

Проверяет дополнительную ценность автоматического выбора момента.

Разберём

  • Какой вариант сравнения покажет пользу оптимизации времени?

Для экспертов · 5 мин

Выбор канала по предпочтению клиента: как проверить пользу настройки

Как оценить пользу выбора канала без ошибки самоотбора. Разделяем сбор и использование предпочтений, соблюдаем запреты и считаем эффект политики.

Проверяет влияние предпочтения на результат.

Разберём

  • Как проверить пользу настройки?
  • Как проверить пользу учёта выбранного клиентом канала?

Для экспертов · 4 мин

CUPED для CRM: когда история покупок повышает точность теста

Как использовать историю покупок в CUPED. Учебный расчёт, выбор предпериода, работа с новыми клиентами и проверки перед применением метода.

Объясняет повышение точности без утечки результата.

Разберём

  • Когда история покупок повышает точность теста?
  • Какие исторические признаки допустимы для корректировки?

Для экспертов · 4 мин

Как тестировать выручку, если несколько крупных заказов меняют весь результат

Как анализировать выручку с редкими крупными заказами. Ошибки очистки, выбор метрики, bootstrap по клиентам и проверка устойчивости вывода.

Учитывает сложное распределение денежного результата.

Разберём

  • Почему удаление крупных заказов может изменить сам вопрос теста?

Для экспертов · 4 мин

Как доказать, что сокращение рассылок не ухудшило результат сверх допустимого

Тест не меньшей эффективности для частоты рассылок. Как задать допустимую потерю, прочитать интервал и решить, можно ли сократить сообщения.

Проверяет снижение частоты через критерий неухудшения.

Разберём

  • Как заранее выбрать допустимую границу ухудшения?

Для экспертов · 4 мин

SRM: как разобраться с неожиданным расхождением размеров групп

Что делать, если размеры групп не соответствуют плану. Расчёт SRM, поиск потери данных и порядок восстановления достоверного сравнения.

Диагностирует нарушение назначения участников.

Разберём

  • Как разобраться с неожиданным расхождением размеров групп?
  • Почему нельзя просто уравнять размеры групп после запуска?

Для экспертов · 4 мин

Тест не дал ясного ответа: как принять решение и не объявить ничью победой

Как принять решение после неопределённого теста. Интервал эффекта, экономический порог, цена ошибки и выбор между новым исследованием и запуском.

Переводит неопределённый результат в управленческое решение.

Разберём

  • Как принять решение и не объявить ничью победой?
  • Как выбрать следующий шаг при широком интервале эффекта?

Для экспертов · 4 мин

Как тестировать тему письма, если Open Rate искажён

Выберите метрику теста с учётом Apple MPP и автоматических кликов. Дизайн эксперимента и числовой пример помогут не объявить случайного победителя.

Проверяет тему письма без зависимости от Open Rate.

Разберём

  • Какую метрику выбрать при ненадёжных открытиях?

Для экспертов · 3 мин

Как проверить реальную чувствительность клиентов к скидкам

Как отличить историю акционных покупок от эффекта скидки. Учёт доступных предложений, контрольная группа и расчёт прибыли при росте конверсии.

Проверяет причинность сегмента скидочной чувствительности.

Разберём

  • Как отделить склонность покупать со скидкой от реакции на неё?

Для экспертов · 3 мин

Как проверить пользу сегментации относительно общей рассылки

Как сравнить персональные подборки с общей рассылкой. Распределение клиентов, одинаковые условия, затраты на контент и оценка результата всей стратегии.

Доказывает пользу разделения аудитории.

Разберём

  • Как сравнить сегментированную и общую политику отправок?

Для экспертов · 4 мин

Как проверить модель сегментации: от красивых групп к дополнительному результату

Как оценить сегментацию до и после запуска: качество данных, устойчивость групп, полезность действий и экономика. Пример сравнения трёх подходов.

Завершает проектирование сегментации проверкой пользы.

Разберём

  • Как понять, даёт ли модель дополнительный результат?