Что такое стандартная ошибка

Стандартная ошибка — это оценка того, насколько статистический показатель менялся бы от выборки к выборке при повторении исследования в сопоставимых условиях.

Например, средний доход по одной группе клиентов немного отличается от среднего по другой случайной группе. Стандартная ошибка описывает масштаб такой изменчивости оценки.

Она не означает, что аналитик ошибся в формуле.

Чем отличается от стандартного отклонения

Стандартное отклонение характеризует разброс самих наблюдений: например, насколько различается доход от отдельных клиентов.

Стандартная ошибка характеризует неопределённость рассчитанного показателя — например, среднего дохода.

Клиенты могут сильно отличаться друг от друга, но при большой выборке их среднее можно оценить достаточно точно.

Пример расчёта

Для обычного среднего по независимым наблюдениям:

Стандартная ошибка = стандартное отклонение ÷ √число наблюдений.

Условный пример. В выборке 400 независимых клиентов. Стандартное отклонение дохода на клиента составляет 600 рублей.

SE = 600 ÷ √400 = 30 рублей.

Если при похожем разбросе увеличить выборку до 1 600 клиентов:

SE = 600 ÷ √1 600 = 15 рублей.

Выборка выросла в четыре раза, а стандартная ошибка уменьшилась вдвое.

Это помогает понять, почему существенное повышение точности может требовать заметного увеличения аудитории.

Для чего она нужна

Стандартную ошибку используют при построении доверительных интервалов и проверке статистических гипотез.

При подходящих условиях приблизительный 95%-й интервал строят как оценку плюс-минус примерно две стандартные ошибки. Но это не универсальная формула для любой метрики и любого размера выборки.

Для долей, отношений и сложных показателей применяют соответствующие методы.

Где легко ошибиться

Если один клиент сделал десять заказов, эти заказы не становятся десятью независимыми клиентами.

Игнорирование зависимости внутри клиентов, магазинов или компаний может занизить стандартную ошибку и создать ложное ощущение точности.

Также маленькая стандартная ошибка не гарантирует отсутствия смещения. Большой объём неправильно собранных данных способен дать очень точный, но неверный ответ.