A/B тесты
Разные результаты двух рассылок ещё не означают качественный тест. Выбор аудитории, пересечение воздействий, срок наблюдения и правило остановки могут объяснить разницу лучше, чем содержание вариантов.
Начните с распределения и основной метрики. Затем изучите дизайн сложных тестов, малые выборки и ситуации, когда результат не позволяет уверенно выбрать победителя.
Вы сможете заранее проектировать сравнение, которое отвечает на бизнес-вопрос, и не менять правила вслед за цифрами.
Статей этого уровня нет.
Понять задачу и основные различия
A/B-тест: как проверить, какой вариант действительно лучше
Как провести A/B-тест письма, предложения или интерфейса. Разбираем гипотезу, случайное распределение, выбор метрики и ошибки при поиске победителя.
Даёт начальную конструкцию A/B-теста.
Разберём
- Как проверить, какой вариант действительно лучше?
- Что нужно определить до сравнения двух вариантов?
Рандомизация: как распределить клиентов, чтобы сравнение имело смысл
Как случайное распределение помогает сравнивать тест и контроль. Разбираем пример, отличие от случайной выборки и причины сохранять состав групп.
Объясняет основу причинного теста.
Разберём
- Как распределить клиентов, чтобы сравнение имело смысл?
- Почему случайное распределение помогает сравнению?
Тестовая группа: на ком проверяют новое предложение
Как сформировать тестовую группу и оценить результат воздействия. Объясняем, почему нельзя оставлять в анализе только открывших письмо или покупателей.
Вводит единицу участия в эксперименте.
Разберём
- Что такое тестовая группа в эксперименте?
- Кого включать в анализ после назначения варианта?
Единица рандомизации: кого именно распределяют между вариантами
Как выбрать единицу рандомизации для CRM-эксперимента. Разбираем общие аккаунты, повторные заказы и отличие единицы распределения от строки данных.
Связывает назначение воздействия и анализ.
Разберём
- Как выбрать единицу рандомизации?
- Когда распределять человека, аккаунт или другую единицу?
Основная метрика эксперимента: по какому показателю принимать решение
Как выбрать основную метрику A/B-теста и не искать победителя среди десятков показателей. Разбираем бизнес-цель, формулу и защитные метрики.
Фиксирует основание решения в эксперименте.
Разберём
- Как выбрать основную метрику эксперимента?
- Почему главный показатель выбирают до запуска?
Минимальный обнаруживаемый эффект: какое изменение способен заметить тест
Что означает MDE и как он связан с размером выборки и мощностью. Объясняем, почему важный для бизнеса эффект может оказаться слишком мал для теста.
Соединяет план теста с его чувствительностью.
Разберём
- Что такое минимальный обнаруживаемый эффект?
- Как размер выборки связан с обнаруживаемым изменением?
Кластерная рандомизация: когда в тест распределяют магазины или команды
Как тестировать изменения на уровне магазинов, компаний и команд. Объясняем, почему большое число покупателей не заменяет достаточное число кластеров.
Вводит тестирование группами.
Разберём
- Когда в тест распределяют магазины или команды?
- Почему участников внутри магазина нельзя считать полностью независимыми?
Загрязнение контрольной группы: что делать, если контроль тоже получил предложение
Как контроль получает проверяемое воздействие через другие кампании, аккаунты и клиентов. Разбираем последствия для оценки и способы профилактики.
Показывает угрозу смыслу сравнения.
Разберём
- Что делать, если контроль тоже получил предложение?
- Как контроль получает проверяемое воздействие помимо теста?
Выбрать и спроектировать решение
Как тестировать CRM при маленькой базе и не обещать недостижимую точность
Что можно проверить на небольшой клиентской базе. Расчёт доступной точности, выбор гипотезы и действия, когда участников недостаточно.
Согласовывает вопрос теста с доступной точностью.
Разберём
- Какой эффект небольшая база действительно способна обнаружить?
Когда можно смотреть на результаты теста каждый день
Как наблюдать A/B-тест и корректно выбирать момент остановки. Фиксированный анализ, промежуточные проверки и созревание результатов клиентов.
Определяет допустимый порядок просмотра результатов.
Разберём
- Чем мониторинг ошибок отличается от досрочного выбора победителя?
Один клиент участвует в нескольких тестах: когда это портит вывод
Когда параллельные эксперименты совместимы. Слои назначения, карта конфликтов и пример четырёх вариантов для оценки взаимодействия механик.
Согласовывает несколько экспериментов на одной аудитории.
Разберём
- Как учитывать участие клиента в нескольких экспериментах?
- Когда параллельные воздействия меняют смысл сравнения?
Как организовать постоянную контрольную группу CRM и не потерять её смысл
Как организовать глобальный holdout CRM. Паспорт программы, правила входа, сервисные исключения, одинаковый горизонт и контроль загрязнения.
Определяет измеряемую программу CRM целиком.
Разберём
- Какие воздействия исключать из постоянного контроля?
Как рассчитать тест по магазинам, если покупателей много, а магазинов мало
Как спланировать тест, когда покупателей много, а магазинов мало. ICC, дизайн-эффект, веса точек и ограничения анализа небольшого числа кластеров.
Задаёт единицу и ограничения кластерного теста.
Разберём
- Почему множество покупателей не заменяет достаточное число магазинов?
Нужен ли интерактивный email: как оценить пользу до разработки
Оцените AMP-письма до сложной разработки. Совместимость, запасная версия, порог окупаемости и дизайн пилота с обычным письмом для сравнения.
Обосновывает усложнение email-шаблона.
Разберём
- Как проверить пользу интерактива до большой разработки?
Как считать результат, если сегмент изменился после запуска
Как сохранить исходную аудиторию и не потерять купивших клиентов в отчёте. Анализ по назначению, динамические сегменты, новые входы и проверка групп.
Сохраняет исходное назначение участников теста.
Разберём
- Почему аудиторию анализа нужно зафиксировать до воздействия?
Проверить результат и исправить ошибки
Как проверить пользу оптимизации времени отправки
Как сравнить ИИ с обычным расписанием. Сопоставимые группы, окно измерения, открытия Apple Mail и экономика модуля после дополнительных расходов.
Проверяет дополнительную ценность автоматического выбора момента.
Разберём
- Какой вариант сравнения покажет пользу оптимизации времени?
Выбор канала по предпочтению клиента: как проверить пользу настройки
Как оценить пользу выбора канала без ошибки самоотбора. Разделяем сбор и использование предпочтений, соблюдаем запреты и считаем эффект политики.
Проверяет влияние предпочтения на результат.
Разберём
- Как проверить пользу настройки?
- Как проверить пользу учёта выбранного клиентом канала?
CUPED для CRM: когда история покупок повышает точность теста
Как использовать историю покупок в CUPED. Учебный расчёт, выбор предпериода, работа с новыми клиентами и проверки перед применением метода.
Объясняет повышение точности без утечки результата.
Разберём
- Когда история покупок повышает точность теста?
- Какие исторические признаки допустимы для корректировки?
Как тестировать выручку, если несколько крупных заказов меняют весь результат
Как анализировать выручку с редкими крупными заказами. Ошибки очистки, выбор метрики, bootstrap по клиентам и проверка устойчивости вывода.
Учитывает сложное распределение денежного результата.
Разберём
- Почему удаление крупных заказов может изменить сам вопрос теста?
Как доказать, что сокращение рассылок не ухудшило результат сверх допустимого
Тест не меньшей эффективности для частоты рассылок. Как задать допустимую потерю, прочитать интервал и решить, можно ли сократить сообщения.
Проверяет снижение частоты через критерий неухудшения.
Разберём
- Как заранее выбрать допустимую границу ухудшения?
SRM: как разобраться с неожиданным расхождением размеров групп
Что делать, если размеры групп не соответствуют плану. Расчёт SRM, поиск потери данных и порядок восстановления достоверного сравнения.
Диагностирует нарушение назначения участников.
Разберём
- Как разобраться с неожиданным расхождением размеров групп?
- Почему нельзя просто уравнять размеры групп после запуска?
Тест не дал ясного ответа: как принять решение и не объявить ничью победой
Как принять решение после неопределённого теста. Интервал эффекта, экономический порог, цена ошибки и выбор между новым исследованием и запуском.
Переводит неопределённый результат в управленческое решение.
Разберём
- Как принять решение и не объявить ничью победой?
- Как выбрать следующий шаг при широком интервале эффекта?
Как тестировать тему письма, если Open Rate искажён
Выберите метрику теста с учётом Apple MPP и автоматических кликов. Дизайн эксперимента и числовой пример помогут не объявить случайного победителя.
Проверяет тему письма без зависимости от Open Rate.
Разберём
- Какую метрику выбрать при ненадёжных открытиях?
Как проверить реальную чувствительность клиентов к скидкам
Как отличить историю акционных покупок от эффекта скидки. Учёт доступных предложений, контрольная группа и расчёт прибыли при росте конверсии.
Проверяет причинность сегмента скидочной чувствительности.
Разберём
- Как отделить склонность покупать со скидкой от реакции на неё?
Как проверить пользу сегментации относительно общей рассылки
Как сравнить персональные подборки с общей рассылкой. Распределение клиентов, одинаковые условия, затраты на контент и оценка результата всей стратегии.
Доказывает пользу разделения аудитории.
Разберём
- Как сравнить сегментированную и общую политику отправок?
Как проверить модель сегментации: от красивых групп к дополнительному результату
Как оценить сегментацию до и после запуска: качество данных, устойчивость групп, полезность действий и экономика. Пример сравнения трёх подходов.
Завершает проектирование сегментации проверкой пользы.
Разберём
- Как понять, даёт ли модель дополнительный результат?