belun.app Блог
EN

Среднее, медиана, мода и стандартное отклонение

Что на самом деле показывает каждая величина, когда среднее врёт, откуда берётся n − 1 в знаменателе и как читать квартили и выбросы.

Студент считает среднее, медиану и стандартное отклонение в тетради рядом с ноутбуком

Пяти чисел хватает, чтобы описать набор данных и заметить в нём странность. Этих же пяти чисел хватает, чтобы странность полностью скрыть. Всё зависит от того, какие пять вы взяли.

У среднего есть очевидное слабое место

Посадите в комнату девять человек с зарплатой 80 000 ₽ и одного с зарплатой 10 миллионов. Средняя зарплата — 1 072 000 ₽. Столько не получает никто из присутствующих, и если назвать это «типичной зарплатой», получится враньё, посчитанное совершенно правильно.

Медиана с этим справляется. Сортируем десять значений, берём середину — 80 000 ₽. Вот число, которое описывает комнату.

Отсюда простое правило: если у данных длинный хвост — доходы, цены на квартиры, время отклика сервера, время ожидания в очереди — честнее показывать медиану. Если распределение более-менее симметричное, среднее удобнее и полезнее: почти вся статистическая машинерия построена именно на нём.

Моду зря недооценивают

Среднее и медиана работают только с числами. Мода работает с чем угодно, что можно посчитать: самый ходовой размер обуви, самый частый вариант ответа, браузер, который чаще других мелькает в логах. И только мода обязана быть значением, которое реально встречается в данных.

У набора может быть две моды, пять или ни одной. «Моды нет» — это нормальный ответ, а не ошибка: просто ничего не повторяется.

Стандартное отклонение и надоевшее n − 1

Два класса написали контрольную одинаково: средний балл 70. Только в первом все оценки лежат между 66 и 74, а во втором половина класса получила 45, половина — 95. Среднее совпало, ситуация совершенно разная. Стандартное отклонение — то самое число, которое их различает.

Дальше момент, на котором все спотыкаются. В выборочной формуле делят на n − 1, а не на n, и выглядит это произволом, пока не поймёшь причину. У выборки есть собственное среднее, и оно по построению лежит ближе к её значениям, чем настоящее среднее генеральной совокупности. Сумма квадратов отклонений каждый раз выходит чуть заниженной. Деление на n − 1 подтягивает оценку обратно. Это поправка Бесселя, и если ваши числа — выборка из чего-то большего, нужна именно она.

Почему рядом со сводкой нужен график

В 1973 году статистик Фрэнсис Энскомб опубликовал четыре набора данных с одинаковым средним по x, одинаковым средним по y, одинаковой дисперсией, одинаковой корреляцией до второго знака и одинаковой линией регрессии.

Нарисуйте их — и они окажутся совершенно разными. Первый — аккуратная линейная зависимость. Второй — гладкая парабола. Третий — идеальная прямая, которую сдёргивает в сторону одна-единственная точка. Четвёртый — вертикальный столбик точек при одном значении x и одна далёкая точка справа, которая и делает всю «корреляцию».

Все сводные числа совпали. Картинки — нет. Квартет Энскомба до сих пор остаётся самым быстрым аргументом в пользу того, чтобы посмотреть на данные глазами, а не только на их среднее.

Квартили и правило полутора

Q1 — значение на четверти пути по отсортированному ряду, Q3 — на трёх четвертях, а промежуток между ними, межквартильный размах, накрывает среднюю половину данных. Это мера разброса, которой хвосты безразличны, — как раз то, что нужно, когда пара экстремальных значений перекрикивает остальные.

Привычка помечать всё, что дальше 1,5 × IQR от квартиля, пришла из книги Джона Тьюки «Exploratory Data Analysis» 1977 года. Это эвристика, а не приговор. Помеченная точка может оказаться опечаткой, сбоем датчика или самым интересным наблюдением из всех. Калькулятор её подсветит, а что она значит — решать вам.

Вставьте свои числа в статистический калькулятор — среднее, медиана, мода, квартили и оба стандартных отклонения посчитаются сразу, без единой формулы в таблице.

Попробуйте инструмент

Статистический калькулятор →