Калькулятор статистической значимости
Проверьте, можно ли считать разницу между вариантами реальным эффектом или данных пока недостаточно.
Проверка данных
Почему такой вывод?
Насколько точно оценён эффект? Диапазон значений эффекта, совместимых с данными в рамках выбранного статистического метода.
Практический смысл
Показать статистику
Как пользоваться калькулятором
Если тест ещё не запущен, откройте «Планирую тест»: укажите текущую конверсию и самый маленький рост, ради которого стоит менять рабочий вариант. Калькулятор оценит, сколько людей нужно в каждую группу.
Если результат уже есть, оставьте «Проверяю результат» и введите участников и целевые действия по вариантам A и B. Сначала вы увидите вывод обычным языком, и только потом — технические величины.
Что такое статистическая значимость
Это проверка, насколько необычна наблюдаемая разница, если предположить, что варианты на самом деле не отличаются. Порог по умолчанию — 95% уверенности, то есть α = 0,05. Прохождение порога не означает, что изменение важно для выручки.
Почему «не значимо» не означает «эффекта нет»
Если порог не пройден, данные совместимы и со случайным колебанием, и с реальным эффектом, который тест пока не может устойчиво разглядеть. Это не доказательство, что варианты одинаковы. Часто просто не хватает наблюдений.
Статистическая и практическая значимость
Статистический порог отвечает на вопрос «похоже ли это на случайность». Бизнес-порог — на вопрос «достаточно ли велико изменение, чтобы менять процесс». Маленькая разница на огромной выборке может пройти статистический порог и при этом не окупить внедрение. В калькуляторе эти выводы разделены.
Как определить размер выборки
До запуска зафиксируйте текущую конверсию, минимальный рост, который имеет смысл, уровень уверенности и мощность. Чем меньше изменение вы хотите надёжно заметить, тем больше людей потребуется. Считать выборку после того, как подсмотрели результат, уже поздно: порог был выбран под заранее заданный эффект.
Почему нельзя останавливать тест слишком рано
Почему нельзя останавливать тест при первом p < 0,05
Если постоянно смотреть на результат обычного fixed-horizon теста и завершать его в первый момент, когда появилась статистическая значимость, фактический риск ошибочного вывода увеличивается.
Для такого подхода нужны специальные sequential-методы. В этой версии калькулятора используется fixed-horizon анализ.
Что такое SRM
Sample Ratio Mismatch — проверка, что в группы попало столько людей, сколько вы планировали. Для деления 50/50 калькулятор сравнивает фактические размеры A и B с ожидаемыми. Если расхождение слишком сильное, сначала ищите сбой в настройке эксперимента, а не победителя.
Вопросы
p-value показывает, насколько необычны полученные данные, если реального различия между вариантами нет. Малое значение — повод не списывать разницу на случайность при выбранном пороге. Это не доля уверенности, что B лучше A.
95% — обычный рабочий компромисс: он не такой строгий, как 99%, и не такой свободный, как 90%. Более высокий уровень требует больше данных, чтобы подтвердить ту же разницу. В расширенных настройках можно выбрать 90% или 99%.
Наблюдаемая разница не проходит выбранный порог. Она может быть и настоящим эффектом, и случайным колебанием. Калькулятор в этом случае не назначает победителя.
Нет. Непройденный порог не доказывает отсутствие эффекта. Он говорит только, что текущих данных недостаточно, чтобы отделить эффект от шума.
Мощность — шанс, что тест заранее выбранного размера заметит эффект не меньше заданного, если такой эффект правда есть. При 80% это примерно 8 из 10 таких ситуаций. Мощность используется при планировании выборки, а не как оценка уже полученного результата.
Без неё непонятно, какой размер эффекта вообще стоит ловить. Очень маленькое изменение требует очень большой аудитории. Порог лучше задавать из экономики: какая разница окупает замену текущего варианта.
Смотреть можно, останавливать fixed-horizon тест в первый день, когда p опустился ниже 0,05, — нет. Так растёт риск принять шум за эффект. Для ранней остановки нужны последовательные методы. Здесь их нет.
Небольшое отличие при делении 50/50 обычно случайно, и калькулятор его учитывает. Если отличие слишком сильное, появится предупреждение SRM: решение по конверсии лучше отложить и проверить, как назначались варианты.
Рост с 5% до 5,5% — это +0,5 процентного пункта и одновременно +10% относительно исходных 5%. Оба числа нужны: первое показывает абсолютный сдвиг, второе — насколько он велик на фоне текущей конверсии.
Когда в таблице 2×2 хотя бы одна ожидаемая ячейка при отсутствии различия меньше 5. Обычное нормальное приближение там ненадёжно, поэтому калькулятор сам переключается на точный тест. Выбирать метод вручную не нужно.
Следующий шаг
Разберём, какой тест вам действительно нужен
Если выборка получается неподъёмной или результат не сходится с тем, как устроен эксперимент, лучше смотреть на дизайн теста, а не на одну цифру.
Обсудить дизайн теста