Статистический вывод

Значимый результат не обещает крупной прибыли, а незначимый не доказывает отсутствие эффекта. Точность зависит от размера выборки, разброса результата и устройства эксперимента.

Последовательно разберите окно наблюдения, случайное распределение, интервалы и обнаруживаемый эффект. Затем переходите к повторным просмотрам, кластерным тестам и решениям при неясном результате.

Вы сможете читать неопределённость оценки и принимать решения без ложной уверенности и формального поиска значимости.

30 статей

Понять задачу и основные различия

Для начинающих · 5 мин

Как отличить эффект рассылки от покупок после неё

Покупки после письма ещё не доказывают его пользу. На простом примере разберите атрибуцию, контрольную группу и расчёт дополнительных покупателей.

Вводит различие наблюдаемой продажи и причины.

Разберём

  • Почему покупки получателей нельзя целиком считать эффектом рассылки?

Для начинающих · 3 мин

A/B-тест: как проверить, какой вариант действительно лучше

Как провести A/B-тест письма, предложения или интерфейса. Разбираем гипотезу, случайное распределение, выбор метрики и ошибки при поиске победителя.

Даёт начальную конструкцию A/B-теста.

Разберём

  • Как проверить, какой вариант действительно лучше?
  • Что нужно определить до сравнения двух вариантов?

Для начинающих · 2 мин

Корреляция: почему связанные показатели не обязательно влияют друг на друга

Как понимать связь между показателями в CRM. Разбираем общие причины, обратную причинность и ошибки в выводах о влиянии рассылок на покупки.

Отделяет совместное изменение от причинности.

Разберём

  • Почему связанные показатели не обязательно влияют друг на друга?
  • Какие другие причины могут объяснить связь показателей?

Для начинающих · 2 мин

Рандомизация: как распределить клиентов, чтобы сравнение имело смысл

Как случайное распределение помогает сравнивать тест и контроль. Разбираем пример, отличие от случайной выборки и причины сохранять состав групп.

Объясняет основу причинного теста.

Разберём

  • Как распределить клиентов, чтобы сравнение имело смысл?
  • Почему случайное распределение помогает сравнению?

Для начинающих · 2 мин

Тестовая группа: на ком проверяют новое предложение

Как сформировать тестовую группу и оценить результат воздействия. Объясняем, почему нельзя оставлять в анализе только открывших письмо или покупателей.

Вводит единицу участия в эксперименте.

Разберём

  • Что такое тестовая группа в эксперименте?
  • Кого включать в анализ после назначения варианта?

Для начинающих · 2 мин

Единица рандомизации: кого именно распределяют между вариантами

Как выбрать единицу рандомизации для CRM-эксперимента. Разбираем общие аккаунты, повторные заказы и отличие единицы распределения от строки данных.

Связывает назначение воздействия и анализ.

Разберём

  • Как выбрать единицу рандомизации?
  • Когда распределять человека, аккаунт или другую единицу?

Для начинающих · 2 мин

Окно наблюдения: сколько времени дать клиенту на действие

Как задать начало и конец окна наблюдения для кампании. Разбираем одинаковый срок для групп, поздние покупки и отличие от окна атрибуции.

Задаёт границы наблюдения для метрик и тестов.

Разберём

  • Сколько времени дать клиенту на действие?
  • Как не сравнивать клиентов с разным временем на результат?

Для начинающих · 2 мин

Основная метрика эксперимента: по какому показателю принимать решение

Как выбрать основную метрику A/B-теста и не искать победителя среди десятков показателей. Разбираем бизнес-цель, формулу и защитные метрики.

Фиксирует основание решения в эксперименте.

Разберём

  • Как выбрать основную метрику эксперимента?
  • Почему главный показатель выбирают до запуска?

Для начинающих · 3 мин

Статистическая значимость: что означает результат теста и чего он не обещает

Что означает статистически значимый результат и почему p-value не показывает вероятность успеха. Разбираем порог проверки и практическую пользу эффекта.

Разделяет статистический вывод и бизнес-решение.

Разберём

  • Что означает результат теста и чего он не обещает?
  • Почему значимость не определяет размер и пользу эффекта?

Для начинающих · 3 мин

Доверительный интервал: насколько точно мы оценили эффект

Что означает 95%-й доверительный интервал и как использовать его для решения. Разбираем диапазон эффекта, попадание нуля и типичные ошибки интерпретации.

Помогает читать неопределённость эффекта.

Разберём

  • Что означает доверительный интервал?
  • Как ширина интервала отражает точность оценки?

Для начинающих · 2 мин

Стандартная ошибка: почему одна оценка точнее другой

Чем стандартная ошибка отличается от разброса клиентских результатов. Разбираем расчёт для среднего и влияние размера выборки на точность оценки.

Объясняет стандартную ошибку.

Разберём

  • Почему одна оценка точнее другой?
  • От чего зависит точность оценённого показателя?

Для начинающих · 3 мин

Минимальный обнаруживаемый эффект: какое изменение способен заметить тест

Что означает MDE и как он связан с размером выборки и мощностью. Объясняем, почему важный для бизнеса эффект может оказаться слишком мал для теста.

Соединяет план теста с его чувствительностью.

Разберём

  • Что такое минимальный обнаруживаемый эффект?
  • Как размер выборки связан с обнаруживаемым изменением?

Для начинающих · 2 мин

Кластерная рандомизация: когда в тест распределяют магазины или команды

Как тестировать изменения на уровне магазинов, компаний и команд. Объясняем, почему большое число покупателей не заменяет достаточное число кластеров.

Вводит тестирование группами.

Разберём

  • Когда в тест распределяют магазины или команды?
  • Почему участников внутри магазина нельзя считать полностью независимыми?

Для начинающих · 2 мин

Загрязнение контрольной группы: что делать, если контроль тоже получил предложение

Как контроль получает проверяемое воздействие через другие кампании, аккаунты и клиентов. Разбираем последствия для оценки и способы профилактики.

Показывает угрозу смыслу сравнения.

Разберём

  • Что делать, если контроль тоже получил предложение?
  • Как контроль получает проверяемое воздействие помимо теста?

Для начинающих · 3 мин

Цензурированное наблюдение: когда мы ещё не знаем, вернётся ли клиент

Что делать, если клиент ещё не совершил повторную покупку к дате анализа. Объясняем правое цензурирование и ошибки при сравнении новых покупателей.

Уточняет работу с незавершённой историей.

Разберём

  • Когда мы ещё не знаем, вернётся ли клиент?
  • Почему отсутствие события к концу наблюдения не означает, что его не будет?

Для начинающих · 2 мин

Квазиэксперимент: как оценить эффект, если случайного распределения не было

Как исследовать эффект изменений без обычного A/B-теста. Разбираем группы сравнения, необходимые предпосылки и ограничения анализа «до и после».

Вводит альтернативу контролируемому эксперименту.

Разберём

  • Как оценить эффект, если случайного распределения не было?
  • Какие допущения нужны без случайного распределения?

Для начинающих · 3 мин

Разность разностей: как отделить изменение в группе от общего тренда

Как работает difference-in-differences: сравнение изменений в двух группах. Разбираем расчёт, параллельные тренды и ограничения причинного вывода.

Объясняет идею разности разностей.

Разберём

  • Как отделить изменение в группе от общего тренда?
  • Как проверить пригодность сравнения с общим трендом?

Для начинающих · 3 мин

Синтетический контроль: как собрать сравнение для одного города или магазина

Как оценить запуск программы в одном регионе с помощью синтетического контроля. Разбираем веса, данные до запуска и ограничения метода.

Вводит конструкцию синтетического контроля.

Разберём

  • Как собрать сравнение для одного города или магазина?
  • Как собрать сравнение для одного объекта воздействия?

Для начинающих · 3 мин

Инструментальная переменная: как оценить эффект участия, если люди выбирают его сами

Как инструментальная переменная помогает оценить эффект при самоотборе. Разбираем условный пример, необходимые предпосылки и границы полученного вывода.

Объясняет подход при самостоятельном выборе участия.

Разберём

  • Как оценить эффект участия, если люди выбирают его сами?
  • При каких условиях инструмент помогает оценивать причинный эффект?

Выбрать и спроектировать решение

Для экспертов · 4 мин

Как тестировать CRM при маленькой базе и не обещать недостижимую точность

Что можно проверить на небольшой клиентской базе. Расчёт доступной точности, выбор гипотезы и действия, когда участников недостаточно.

Согласовывает вопрос теста с доступной точностью.

Разберём

  • Какой эффект небольшая база действительно способна обнаружить?

Для экспертов · 4 мин

Когда можно смотреть на результаты теста каждый день

Как наблюдать A/B-тест и корректно выбирать момент остановки. Фиксированный анализ, промежуточные проверки и созревание результатов клиентов.

Определяет допустимый порядок просмотра результатов.

Разберём

  • Чем мониторинг ошибок отличается от досрочного выбора победителя?

Для экспертов · 4 мин

Один клиент участвует в нескольких тестах: когда это портит вывод

Когда параллельные эксперименты совместимы. Слои назначения, карта конфликтов и пример четырёх вариантов для оценки взаимодействия механик.

Согласовывает несколько экспериментов на одной аудитории.

Разберём

  • Как учитывать участие клиента в нескольких экспериментах?
  • Когда параллельные воздействия меняют смысл сравнения?

Для экспертов · 4 мин

Как организовать постоянную контрольную группу CRM и не потерять её смысл

Как организовать глобальный holdout CRM. Паспорт программы, правила входа, сервисные исключения, одинаковый горизонт и контроль загрязнения.

Определяет измеряемую программу CRM целиком.

Разберём

  • Какие воздействия исключать из постоянного контроля?

Для экспертов · 4 мин

Как рассчитать тест по магазинам, если покупателей много, а магазинов мало

Как спланировать тест, когда покупателей много, а магазинов мало. ICC, дизайн-эффект, веса точек и ограничения анализа небольшого числа кластеров.

Задаёт единицу и ограничения кластерного теста.

Разберём

  • Почему множество покупателей не заменяет достаточное число магазинов?

Проверить результат и исправить ошибки

Для экспертов · 4 мин

CUPED для CRM: когда история покупок повышает точность теста

Как использовать историю покупок в CUPED. Учебный расчёт, выбор предпериода, работа с новыми клиентами и проверки перед применением метода.

Объясняет повышение точности без утечки результата.

Разберём

  • Когда история покупок повышает точность теста?
  • Какие исторические признаки допустимы для корректировки?

Для экспертов · 4 мин

Как тестировать выручку, если несколько крупных заказов меняют весь результат

Как анализировать выручку с редкими крупными заказами. Ошибки очистки, выбор метрики, bootstrap по клиентам и проверка устойчивости вывода.

Учитывает сложное распределение денежного результата.

Разберём

  • Почему удаление крупных заказов может изменить сам вопрос теста?

Для экспертов · 4 мин

Как доказать, что сокращение рассылок не ухудшило результат сверх допустимого

Тест не меньшей эффективности для частоты рассылок. Как задать допустимую потерю, прочитать интервал и решить, можно ли сократить сообщения.

Проверяет снижение частоты через критерий неухудшения.

Разберём

  • Как заранее выбрать допустимую границу ухудшения?

Для экспертов · 4 мин

SRM: как разобраться с неожиданным расхождением размеров групп

Что делать, если размеры групп не соответствуют плану. Расчёт SRM, поиск потери данных и порядок восстановления достоверного сравнения.

Диагностирует нарушение назначения участников.

Разберём

  • Как разобраться с неожиданным расхождением размеров групп?
  • Почему нельзя просто уравнять размеры групп после запуска?

Для экспертов · 4 мин

Тест не дал ясного ответа: как принять решение и не объявить ничью победой

Как принять решение после неопределённого теста. Интервал эффекта, экономический порог, цена ошибки и выбор между новым исследованием и запуском.

Переводит неопределённый результат в управленческое решение.

Разберём

  • Как принять решение и не объявить ничью победой?
  • Как выбрать следующий шаг при широком интервале эффекта?

Для экспертов · 11 мин

Как оценить причинный эффект рекламы без полноценного эксперимента

Как оценивать рекламу, если контрольной группы нет? Разбираем Near Impressions, требования к данным, проверки сопоставимости и ограничения причинных выводов.

Расширяет измерение эффекта за пределы обычного теста.

Разберём

  • Какие ограничения остаются без случайного распределения?