Статистический вывод
Значимый результат не обещает крупной прибыли, а незначимый не доказывает отсутствие эффекта. Точность зависит от размера выборки, разброса результата и устройства эксперимента.
Последовательно разберите окно наблюдения, случайное распределение, интервалы и обнаруживаемый эффект. Затем переходите к повторным просмотрам, кластерным тестам и решениям при неясном результате.
Вы сможете читать неопределённость оценки и принимать решения без ложной уверенности и формального поиска значимости.
Статей этого уровня нет.
Понять задачу и основные различия
Как отличить эффект рассылки от покупок после неё
Покупки после письма ещё не доказывают его пользу. На простом примере разберите атрибуцию, контрольную группу и расчёт дополнительных покупателей.
Вводит различие наблюдаемой продажи и причины.
Разберём
- Почему покупки получателей нельзя целиком считать эффектом рассылки?
A/B-тест: как проверить, какой вариант действительно лучше
Как провести A/B-тест письма, предложения или интерфейса. Разбираем гипотезу, случайное распределение, выбор метрики и ошибки при поиске победителя.
Даёт начальную конструкцию A/B-теста.
Разберём
- Как проверить, какой вариант действительно лучше?
- Что нужно определить до сравнения двух вариантов?
Корреляция: почему связанные показатели не обязательно влияют друг на друга
Как понимать связь между показателями в CRM. Разбираем общие причины, обратную причинность и ошибки в выводах о влиянии рассылок на покупки.
Отделяет совместное изменение от причинности.
Разберём
- Почему связанные показатели не обязательно влияют друг на друга?
- Какие другие причины могут объяснить связь показателей?
Рандомизация: как распределить клиентов, чтобы сравнение имело смысл
Как случайное распределение помогает сравнивать тест и контроль. Разбираем пример, отличие от случайной выборки и причины сохранять состав групп.
Объясняет основу причинного теста.
Разберём
- Как распределить клиентов, чтобы сравнение имело смысл?
- Почему случайное распределение помогает сравнению?
Тестовая группа: на ком проверяют новое предложение
Как сформировать тестовую группу и оценить результат воздействия. Объясняем, почему нельзя оставлять в анализе только открывших письмо или покупателей.
Вводит единицу участия в эксперименте.
Разберём
- Что такое тестовая группа в эксперименте?
- Кого включать в анализ после назначения варианта?
Единица рандомизации: кого именно распределяют между вариантами
Как выбрать единицу рандомизации для CRM-эксперимента. Разбираем общие аккаунты, повторные заказы и отличие единицы распределения от строки данных.
Связывает назначение воздействия и анализ.
Разберём
- Как выбрать единицу рандомизации?
- Когда распределять человека, аккаунт или другую единицу?
Окно наблюдения: сколько времени дать клиенту на действие
Как задать начало и конец окна наблюдения для кампании. Разбираем одинаковый срок для групп, поздние покупки и отличие от окна атрибуции.
Задаёт границы наблюдения для метрик и тестов.
Разберём
- Сколько времени дать клиенту на действие?
- Как не сравнивать клиентов с разным временем на результат?
Основная метрика эксперимента: по какому показателю принимать решение
Как выбрать основную метрику A/B-теста и не искать победителя среди десятков показателей. Разбираем бизнес-цель, формулу и защитные метрики.
Фиксирует основание решения в эксперименте.
Разберём
- Как выбрать основную метрику эксперимента?
- Почему главный показатель выбирают до запуска?
Статистическая значимость: что означает результат теста и чего он не обещает
Что означает статистически значимый результат и почему p-value не показывает вероятность успеха. Разбираем порог проверки и практическую пользу эффекта.
Разделяет статистический вывод и бизнес-решение.
Разберём
- Что означает результат теста и чего он не обещает?
- Почему значимость не определяет размер и пользу эффекта?
Доверительный интервал: насколько точно мы оценили эффект
Что означает 95%-й доверительный интервал и как использовать его для решения. Разбираем диапазон эффекта, попадание нуля и типичные ошибки интерпретации.
Помогает читать неопределённость эффекта.
Разберём
- Что означает доверительный интервал?
- Как ширина интервала отражает точность оценки?
Стандартная ошибка: почему одна оценка точнее другой
Чем стандартная ошибка отличается от разброса клиентских результатов. Разбираем расчёт для среднего и влияние размера выборки на точность оценки.
Объясняет стандартную ошибку.
Разберём
- Почему одна оценка точнее другой?
- От чего зависит точность оценённого показателя?
Минимальный обнаруживаемый эффект: какое изменение способен заметить тест
Что означает MDE и как он связан с размером выборки и мощностью. Объясняем, почему важный для бизнеса эффект может оказаться слишком мал для теста.
Соединяет план теста с его чувствительностью.
Разберём
- Что такое минимальный обнаруживаемый эффект?
- Как размер выборки связан с обнаруживаемым изменением?
Кластерная рандомизация: когда в тест распределяют магазины или команды
Как тестировать изменения на уровне магазинов, компаний и команд. Объясняем, почему большое число покупателей не заменяет достаточное число кластеров.
Вводит тестирование группами.
Разберём
- Когда в тест распределяют магазины или команды?
- Почему участников внутри магазина нельзя считать полностью независимыми?
Загрязнение контрольной группы: что делать, если контроль тоже получил предложение
Как контроль получает проверяемое воздействие через другие кампании, аккаунты и клиентов. Разбираем последствия для оценки и способы профилактики.
Показывает угрозу смыслу сравнения.
Разберём
- Что делать, если контроль тоже получил предложение?
- Как контроль получает проверяемое воздействие помимо теста?
Цензурированное наблюдение: когда мы ещё не знаем, вернётся ли клиент
Что делать, если клиент ещё не совершил повторную покупку к дате анализа. Объясняем правое цензурирование и ошибки при сравнении новых покупателей.
Уточняет работу с незавершённой историей.
Разберём
- Когда мы ещё не знаем, вернётся ли клиент?
- Почему отсутствие события к концу наблюдения не означает, что его не будет?
Квазиэксперимент: как оценить эффект, если случайного распределения не было
Как исследовать эффект изменений без обычного A/B-теста. Разбираем группы сравнения, необходимые предпосылки и ограничения анализа «до и после».
Вводит альтернативу контролируемому эксперименту.
Разберём
- Как оценить эффект, если случайного распределения не было?
- Какие допущения нужны без случайного распределения?
Разность разностей: как отделить изменение в группе от общего тренда
Как работает difference-in-differences: сравнение изменений в двух группах. Разбираем расчёт, параллельные тренды и ограничения причинного вывода.
Объясняет идею разности разностей.
Разберём
- Как отделить изменение в группе от общего тренда?
- Как проверить пригодность сравнения с общим трендом?
Синтетический контроль: как собрать сравнение для одного города или магазина
Как оценить запуск программы в одном регионе с помощью синтетического контроля. Разбираем веса, данные до запуска и ограничения метода.
Вводит конструкцию синтетического контроля.
Разберём
- Как собрать сравнение для одного города или магазина?
- Как собрать сравнение для одного объекта воздействия?
Инструментальная переменная: как оценить эффект участия, если люди выбирают его сами
Как инструментальная переменная помогает оценить эффект при самоотборе. Разбираем условный пример, необходимые предпосылки и границы полученного вывода.
Объясняет подход при самостоятельном выборе участия.
Разберём
- Как оценить эффект участия, если люди выбирают его сами?
- При каких условиях инструмент помогает оценивать причинный эффект?
Выбрать и спроектировать решение
Как тестировать CRM при маленькой базе и не обещать недостижимую точность
Что можно проверить на небольшой клиентской базе. Расчёт доступной точности, выбор гипотезы и действия, когда участников недостаточно.
Согласовывает вопрос теста с доступной точностью.
Разберём
- Какой эффект небольшая база действительно способна обнаружить?
Когда можно смотреть на результаты теста каждый день
Как наблюдать A/B-тест и корректно выбирать момент остановки. Фиксированный анализ, промежуточные проверки и созревание результатов клиентов.
Определяет допустимый порядок просмотра результатов.
Разберём
- Чем мониторинг ошибок отличается от досрочного выбора победителя?
Один клиент участвует в нескольких тестах: когда это портит вывод
Когда параллельные эксперименты совместимы. Слои назначения, карта конфликтов и пример четырёх вариантов для оценки взаимодействия механик.
Согласовывает несколько экспериментов на одной аудитории.
Разберём
- Как учитывать участие клиента в нескольких экспериментах?
- Когда параллельные воздействия меняют смысл сравнения?
Как организовать постоянную контрольную группу CRM и не потерять её смысл
Как организовать глобальный holdout CRM. Паспорт программы, правила входа, сервисные исключения, одинаковый горизонт и контроль загрязнения.
Определяет измеряемую программу CRM целиком.
Разберём
- Какие воздействия исключать из постоянного контроля?
Как рассчитать тест по магазинам, если покупателей много, а магазинов мало
Как спланировать тест, когда покупателей много, а магазинов мало. ICC, дизайн-эффект, веса точек и ограничения анализа небольшого числа кластеров.
Задаёт единицу и ограничения кластерного теста.
Разберём
- Почему множество покупателей не заменяет достаточное число магазинов?
Проверить результат и исправить ошибки
CUPED для CRM: когда история покупок повышает точность теста
Как использовать историю покупок в CUPED. Учебный расчёт, выбор предпериода, работа с новыми клиентами и проверки перед применением метода.
Объясняет повышение точности без утечки результата.
Разберём
- Когда история покупок повышает точность теста?
- Какие исторические признаки допустимы для корректировки?
Как тестировать выручку, если несколько крупных заказов меняют весь результат
Как анализировать выручку с редкими крупными заказами. Ошибки очистки, выбор метрики, bootstrap по клиентам и проверка устойчивости вывода.
Учитывает сложное распределение денежного результата.
Разберём
- Почему удаление крупных заказов может изменить сам вопрос теста?
Как доказать, что сокращение рассылок не ухудшило результат сверх допустимого
Тест не меньшей эффективности для частоты рассылок. Как задать допустимую потерю, прочитать интервал и решить, можно ли сократить сообщения.
Проверяет снижение частоты через критерий неухудшения.
Разберём
- Как заранее выбрать допустимую границу ухудшения?
SRM: как разобраться с неожиданным расхождением размеров групп
Что делать, если размеры групп не соответствуют плану. Расчёт SRM, поиск потери данных и порядок восстановления достоверного сравнения.
Диагностирует нарушение назначения участников.
Разберём
- Как разобраться с неожиданным расхождением размеров групп?
- Почему нельзя просто уравнять размеры групп после запуска?
Тест не дал ясного ответа: как принять решение и не объявить ничью победой
Как принять решение после неопределённого теста. Интервал эффекта, экономический порог, цена ошибки и выбор между новым исследованием и запуском.
Переводит неопределённый результат в управленческое решение.
Разберём
- Как принять решение и не объявить ничью победой?
- Как выбрать следующий шаг при широком интервале эффекта?
Как оценить причинный эффект рекламы без полноценного эксперимента
Как оценивать рекламу, если контрольной группы нет? Разбираем Near Impressions, требования к данным, проверки сопоставимости и ограничения причинных выводов.
Расширяет измерение эффекта за пределы обычного теста.
Разберём
- Какие ограничения остаются без случайного распределения?