Hoe normale verdeling gegevens vormgeeft en waarom dit belangrijk is voor uw statistiekenklasse

9

Je hebt het waarschijnlijk al eerder gezien. Die vloeiende, symmetrische belvorm die overal terugkomt, van gestandaardiseerde testscores tot kwaliteitscontrolerapporten. Het is de normale verdeling. Ook bekend als de Gaussische verdeling. Het is de meest gebruikelijke manier waarop onafhankelijke willekeurige variabelen zich gedragen.

De curve wordt gedefinieerd door twee hoofdgetallen. Het gemiddelde zit bovenaan. Het is het gemiddelde. De grafiek spiegelt zichzelf perfect rond dit middelpunt. Dan heb je de standaarddeviatie. Dit getal bepaalt hoe breed of smal de curve wordt. Een kleine standaarddeviatie zorgt voor een steile, hoge grafiek. Een grote maakt hem plat en breed.

De wiskunde erachter is gebaseerd op een exponentiële functie. De formule gebruikt e, wat ongeveer 2,718 is. Er wordt ook gebruik gemaakt van uw gemiddelde (μ ) en de standaarddeviatie (σ ). De totale oppervlakte onder deze curve is altijd gelijk aan één. Dit is geen toeval. Het is door ontwerp. Omdat het gebied is genormaliseerd naar eenheid, kunt u de kansen rechtstreeks aflezen vanuit de ruimte onder de lijn. Een oppervlakte van 0,5 betekent een kans van 50%.

Historisch gezien vereiste het berekenen van deze gebieden zware berekeningen. Daar hadden de meeste mensen geen tijd voor. Dus in de 19e eeuw maakten statistici tabellen. Deze waren voor de standaardnormale verdeling. Dat is waar het gemiddelde nul is en de standaarddeviatie één. Als uw gegevens niet met deze cijfers overeenkwamen, moest u deze opnieuw schalen. Je trekt het gemiddelde ervan af. Deel vervolgens door de standaarddeviatie. De formule ziet er als volgt uit: (xμ ) / σ.

Rekenmachines hebben die papieren tabellen grotendeels gedood. U toetst uw cijfers in en krijgt direct het antwoord. Maar het concept blijft essentieel voor het begrijpen van de waarschijnlijkheidstheorie.

De naam “Gaussisch” komt van Carl Friedrich Gauss. Hij was een Duitse wiskundige. In 1809 ontwikkelde hij de exponentiële functie met twee parameters. Hij probeerde fouten in astronomische waarnemingen te begrijpen. Dit werk hielp hem de wet van observatiefouten te creëren. Het bevorderde ook de methode van de kleinste kwadratenbenadering.

Een andere vroege gebruiker was James Clerk Maxwell. Hij was een Britse natuurkundige. In 1859 gebruikte hij deze verdeling om moleculaire snelheden te beschrijven. Zijn werk werd later de distributiewet van Maxwell-Boltmann.

Lang vóór Gauss kreeg Abraham de Moivre de bal aan het rollen. In zijn boek Doctrine of Chances uit 1718 merkte hij iets interessants op. Waarschijnlijkheden voor afzonderlijke gebeurtenissen, zoals het opgooien van munten of het gooien van dobbelstenen, kunnen worden benaderd door een exponentiële curve. Pierre-Simon Laplace ging hier verder mee. In zijn werk Théorie analytique des probabilités uit 1812 generaliseerde hij het idee van De Moivre. Hij creëerde wat we nu de centrale limietstelling noemen.

Deze stelling is krachtig. Het bewees dat bijna alle onafhankelijke willekeurige variabelen convergeren naar een normale verdeling naarmate uw steekproefomvang groeit. De convergentie gebeurt snel. Dankzij deze ontdekking konden wiskundigen problemen met calculus oplossen die voorheen onmogelijk waren. Het veranderde discrete problemen in continue problemen. Het maakte hardnekkige problemen beheersbaar.

Dus waarom is dit voor jou belangrijk? Als je een statistiekles volgt, zul je deze elke dag gebruiken. Als u een onderzoeker bent, volgen uw gegevens waarschijnlijk dit patroon, tenzij dit niet het geval is. Het is overal. Het is de standaardaanname voor veel statistische tests.

Het mooie van de normale verdeling is haar universaliteit. Het maakt niet uit wat u meet. Het maakt alleen uit dat u onafhankelijke variabelen meet. De centrale limietstelling zorgt ervoor dat zelfs als uw ruwe gegevens rommelig zijn, de gemiddelden in een belcurve zullen egaliseren. Daarom kunnen we op basis van kleinere steekproeven voorspellingen doen over grote groepen.

Er is een reden waarom deze curve zo bekend is. Het is niet alleen een wiskundige nieuwsgierigheid. Het is een fundamentele eigenschap van willekeur. Wanneer voldoende onafhankelijke factoren samenkomen, neigt het resultaat naar deze vorm. Het lijkt een beetje op entropie. Wanorde leidt tot een voorspelbaar patroon.

Passen uw gegevens in de curve? Dat is de eerste vraag die u moet stellen. Als dat zo is, beschikt u over hulpmiddelen om het gemakkelijk te analyseren. Als dit niet het geval is, hebt u andere methoden nodig. De normale verdeling is geen natuurwet. Het is een model. Een hele nuttige. Maar soms weigert de werkelijkheid te kloppen.

We vertrouwen op deze modellen om chaos te begrijpen. De centrale limietstelling gaf ons die macht. Het maakte van onzekerheid iets berekenbaars. Gauss en Maxwell waren niet van plan een universeel statistisch instrument te creëren. Ze wilden alleen maar sterren en gasmoleculen begrijpen. Maar hun werk onthulde een diepere waarheid over hoe de wereld willekeurige gebeurtenissen samenvoegt.

De volgende keer dat u een belcurve ziet, onthoud dan de geschiedenis. Denk aan de munten van De Moivre en de stellingen van Laplace. Het is niet alleen een vorm. Het is het resultaat van eeuwenlang proberen orde te vinden in willekeur. De curve vereenvoudigt het complex. Het stelt ons in staat het onvoorspelbare te voorspellen.

Maar houd er rekening mee. Echte gegevens zijn zelden volkomen normaal. Scheefheid en kurtosis bestaan. De staarten zijn vaak zwaarder dan het model voorspelt. De normale verdeling is een benadering. Een krachtige. Maar toch een benadering. Het begrijpen van de grenzen ervan is net zo belangrijk als het begrijpen van de toepassing ervan. Dat is waar het echte inzicht ligt.

попередня статтяHoe de Al-Azhar Universiteit het voornaamste centrum voor islamitisch onderwijs ter wereld werd
наступна статтяAffixen begrijpen: hoe voor- en achtervoegsels de betekenis van woorden veranderen