Эксперимент закончился, средний результат тестовой группы выше, но статистической значимости нет. Бизнесу всё равно нужно решить, запускать ли механику. Фразы «эффекта нет» и «видим положительный тренд, масштабируем» одинаково легко скрывают неопределённость.

Неопределённый результат означает, что данные пока не позволяют достаточно уверенно различить важные для решения варианты. Причиной может быть слабый эффект, маленькая выборка, шумная метрика или повреждение данных. У этих ситуаций разные следующие шаги.

Американская статистическая ассоциация подчёркивает: p-value не измеряет размер эффекта, а научный или деловой вывод не должен опираться только на прохождение порога значимости. В CRM полезнее рассматривать оценку вместе с интервалом, экономическим порогом и стоимостью ошибки.

Начните с пригодности данных

Прежде чем обсуждать результат, проверьте назначение групп, полноту заказов, одинаковое окно наблюдения и соблюдение политики контактов. Если была техническая потеря данных, проблема не решается увеличением выборки из того же неисправного потока.

Затем сверьте фактическое воздействие. Например, тестировали новый лимит, но старая очередь отправок продолжила работать. В таком случае эксперимент оценил реально получившуюся политику, а не запланированное сокращение.

Переведите вопрос в деньги

Определите минимальный эффект, ради которого стоит внедрять механику. Если запуск требует поддержки, скидок и IT-работ, разница в один рубль может быть статистически заметной и практически бесполезной.

Условный пример. Компания считает привлекательным дополнительный вклад от 20 рублей на клиента за квартал. Оценка строится по всем назначенным участникам; будущие расходы внедрения, не входящие в метрику, рассматриваются отдельно.

Интервал эффекта на клиентаЧто можно сказатьВозможное решение
От −40 до +80 ₽Совместимы и существенный вред, и полезный ростНе обещать результат; оценить цену дополнительного измерения
От −5 до +8 ₽Порог +20 ₽ исключён на принятом уровне процедурыНе масштабировать ради заявленной денежной цели
От +25 до +60 ₽Интервал лежит выше бизнес-порогаРассмотреть запуск после проверки затрат и защитных метрик

Это примеры интерпретации заранее выбранных корректных интервалов. Во втором случае нельзя утверждать, что эффект равен нулю. В третьем результат остаётся относящимся к конкретной аудитории и горизонту.

Что означает доверительный интервал

Интервал показывает точность оценки с учётом принятого статистического метода. Его не следует читать как «с вероятностью 95% прибыль окажется между этими числами». Стандартная частотная процедура устроена так, что при многократном повторении исследования около 95% построенных интервалов накрывали бы истинный эффект, если её предпосылки выполняются.

Для управленческого решения достаточно более прикладного вопроса: какие значимые для бизнеса потери и выгоды ещё не исключены данными? Но нельзя считать все значения внутри интервала равновероятными или приписывать его границам точность прогноза будущей кампании.

Выберите следующий шаг

Если продолжение дорого, а даже оптимистичный эффект мал, остановка может быть рациональной. Если возможная польза велика, полезно оценить стоимость следующего исследования: сколько новых участников нужно и успеет ли вывод повлиять на решение.

Улучшать точность можно через более сильное воздействие, лучшую метрику или данные до эксперимента. Метод CUPED использует подходящую историю участников для уменьшения случайного шума. Он не превращает отсутствующую историю или неисправное назначение в качественный эксперимент.

Продление нельзя оформлять как «посмотрим ещё неделю, пока не станет значимо». Либо используется заранее предусмотренный последовательный анализ, либо проектируется новый этап с корректным учётом уже просмотренных данных. Простое добавление строк не отменяет предыдущих попыток остановиться на удобном результате.

Если бизнес всё равно должен действовать

Допустим ограниченный обратимый запуск с пределом бюджета и заранее установленными сигналами остановки. Это управленческое решение под неопределённостью. Оно не превращает неубедительный эксперимент в доказательство роста.

Запишите три вещи: что удалось исключить, что осталось неизвестным и какое решение принято по экономическим причинам. Если выбирается новый тест, уточните, какое именно оставшееся сомнение он должен разрешить. Тогда следующий запуск добавит знания, а не станет повторением поиска удобного p-value.

Источники

American Statistical Association. American Statistical Association Releases Statement on Statistical Significance and P-Values. Официальное заявление для прессы. 7 марта 2016.