Как нормальное распределение формирует данные и почему это важно для вашего курса статистики

12

Вы, вероятно, уже видели это. Гладкую, симметричную колоколообразную кривую, которая возникает во всем — от результатов стандартизированных тестов до отчетов о контроле качества. Это нормальное распределение. Также известное как распределение Гаусса. Это наиболее распространенный способ поведения независимых случайных величин.

Кривая определяется двумя основными числами. Среднее значение находится в верхней точке. Это среднее арифметическое. График идеально зеркально отражается относительно этой центральной точки. Затем есть стандартное отклонение. Это число определяет, насколько широкой или узкой становится кривая. Малое стандартное отклонение создает крутой, высокий график. Большое стандартное отклонение делает его плоским и широким.

Математическая основа опирается на экспоненциальную функцию. Формула использует e, которое примерно равно 2,718. Она также использует ваше среднее значение (μ ) и стандартное отклонение (σ ). Общая площадь под этой кривой всегда равна единице. Это не совпадение. Это сделано намеренно. Поскольку площадь нормирована на единицу, вы можете напрямую считывать вероятности из пространства под линией. Площадь 0,5 означает вероятность 50%.

Исторически вычисление этих площадей требовало сложного математического анализа. У большинства людей не было времени на это. Поэтому в XIX веке статистики создали таблицы. Они были предназначены для стандартного нормального распределения. Это такое распределение, где среднее значение равно нулю, а стандартное отклонение равно единице. Если ваши данные не соответствовали этим числам, их необходимо было перескалировать. Вы вычитаете среднее значение. Затем делите на стандартное отклонение. Формула выглядит так: (xμ ) / σ.

Калькуляторы в значительной степени вытеснили бумажные таблицы. Вы вводите свои числа и мгновенно получаете ответ. Но концепция остается жизненно важной для понимания теории вероятностей.

Название «гауссово» происходит от Карла Фридриха Гаусса. Он был немецким математиком. В 1809 году он разработал экспоненциальную функцию с двумя параметрами. Он пытался понять ошибки астрономических наблюдений. Эта работа помогла ему создать закон ошибок наблюдений. Она также продвинула метод аппроксимации наименьших квадратов.

Еще одним ранним пользователем был Джеймс Клерк Максвелл. Он был британским физиком. В 1859 году он использовал это распределение для описания скоростей молекул. Его работа позже стала законом распределения Максвелла — Больцмана.

Долго до Гаусса Абрахам де Муавр положил начало этому процессу. В своей книге 1718 года «Учение о шансах» он заметил кое-что интересное. Вероятности для дискретных событий — например, подбрасывания монет или бросания кубиков — могут быть аппроксимированы экспоненциальной кривой. Пьер-Симон Лаплас развил эту идею дальше. В своей работе 1812 года «Аналитическая теория вероятностей» он обобщил идею де Муавра. Он создал то, что мы теперь называем центральной предельной теоремой.

Эта теорема мощна. Она доказала, что почти все независимые случайные величины сходятся к нормальному распределению по мере увеличения размера выборки. Сходство происходит быстро. Это открытие позволило математикам решать задачи с помощью математического анализа, которые ранее были невозможны. Оно превратило дискретные задачи в непрерывные. Оно сделало неразрешимые проблемы управляемыми.

Так почему это важно для вас? Если вы посещаете курс по статистике, вы будете использовать это каждый день. Если вы исследователь, ваши данные, скорее всего, следуют этому паттерну, если только не следуют. Это повсюду. Это предположение по умолчанию для многих статистических тестов.

Красота нормального распределения заключается в его универсальности. Ему все равно, что вы измеряете. Ему важно только то, что вы измеряете независимые переменные. Центральная предельная теорема гарантирует, что даже если ваши исходные данные хаотичны, средние значения сгладятся в колоколообразную кривую. Вот почему мы можем делать прогнозы о больших группах на основе меньших выборок.

Есть причина, по которой эта кривая так знакома. Это не просто математическая диковинка. Это фундаментальное свойство случайности. Когда достаточно много независимых факторов объединяются, результат стремится к этой форме. Это немного похоже на энтропию. Хаос приводит к предсказуемой закономерности.

Соответствуют ли ваши данные кривой? Это первый вопрос, который вы должны задать. Если да, у вас есть инструменты для легкого анализа. Если нет, вам нужны другие методы. Нормальное распределение не является законом природы. Это модель. Очень полезная модель. Но иногда реальность отказывается вписываться в колокол.

Мы полагаемся на эти модели, чтобы понять хаос. Центральная предельная теорема дала нам эту силу. Она превратила неопределенность во что-то вычисляемое. Гаусс и Максвелл не ставили целью создать универсальный статистический инструмент. Они просто хотели понять звезды и молекулы газа. Но их работа раскрыла более глубокую истину о том, как мир агрегирует случайные события.

В следующий раз, когда вы увидите колоколообразную кривую, вспомните историю. Вспомните монеты де Муавра и теоремы Лапласа. Это не просто форма. Это результат вековых попыток найти порядок в случайности. Кривая упрощает сложное. Она позволяет нам предсказывать непредсказуемое.

Но имейте в виду. Реальные данные редко бывают идеально нормальными. Существуют асимметрия и эксцесс. Хвосты часто тяжелее, чем предсказывает модель. Нормальное распределение — это аппроксимация. Мощная аппроксимация. Но все же аппроксимация. Понимание ее ограничений так же важно, как и понимание ее применения. Именно здесь кроется реальное понимание.

попередня статтяКак университет Аль-Азхар стал ведущим мировым центром исламского образования
наступна статтяПонимание аффиксов: как префиксы и суффиксы изменяют значение слов