Mathematik

Signifikanzniveau: α und p-Wert verstehen

Signifikanzniveau: α und p-Wert verstehen
Signifikanzniveau: α und p-Wert verstehen
Für Quiz, Lückentext, Lernkarten und Fortschritt ist JavaScript nötig. Alle Inhalte und Lösungen bleiben direkt lesbar.

Das Signifikanzniveau $\alpha$ ist eine vor dem Hypothesentest festgelegte Grenze. Sie beschränkt das Risiko, eine wahre Nullhypothese fälschlich abzulehnen. Nach dem Test vergleichst du den $p$-Wert mit $\alpha$: Gilt $p<\alpha$, ist das Ergebnis statistisch signifikant.

Auf dieser Seite lernst du, diese Entscheidung zu treffen und vorsichtig zu interpretieren.

Deine Lernziele

Hake ab, was du schon kannst — und komm am Ende hierher zurück!

Was begrenzt das Signifikanzniveau?

Bei einem Hypothesentest formulierst du zunächst eine Nullhypothese $H_0$. Sie beschreibt meist, dass kein Unterschied, kein Effekt oder keine Veränderung vorliegt. Die Gegenhypothese $H_1$ beschreibt die untersuchte Abweichung.

Noch bevor du die Daten auswertest, legst du das Signifikanzniveau $\alpha$ fest. Häufig wird $\alpha=0{,}05$ gewählt. Das entspricht 5 %.

Definition

Signifikanzniveau

Das Signifikanzniveau $\alpha$ ist die vorab festgelegte Obergrenze für die Wahrscheinlichkeit, eine wahre Nullhypothese fälschlich abzulehnen. Dieser Irrtum heißt Fehler 1. Art oder Alpha-Fehler.

Für $\alpha=0{,}05$ bedeutet das langfristig: Werden viele gleichartige Tests durchgeführt, bei denen $H_0$ tatsächlich gilt, soll der Anteil falscher Ablehnungen höchstens ungefähr 5 % betragen.

Die passende Wahrscheinlichkeitsaussage lautet:

$$P(H_0\text{ ablehnen}\mid H_0\text{ wahr})\leq 0{,}05$$

Entsprechend wird eine wahre Nullhypothese mit einer Wahrscheinlichkeit von mindestens $1-\alpha=0{,}95$ nicht abgelehnt.

Merke

$\alpha=0{,}05$ bedeutet nicht, dass ein einzelnes signifikantes Ergebnis mit 95 % Wahrscheinlichkeit richtig ist. Das Niveau beschreibt das langfristig kontrollierte Fehlerrisiko des Testverfahrens unter einer wahren Nullhypothese.

Teste dich
Frage 1 von 1LeichtWelche Aussage beschreibt $\alpha$ korrekt?
Lösung: Es begrenzt das Risiko, eine wahre Nullhypothese fälschlich abzulehnen. — Das Signifikanzniveau gehört zur Entscheidungsregel des Tests. Es beschreibt weder die Wahrheit einer Hypothese noch die Effektgröße.
Wie entscheidest du mit dem p-Wert?

Der $p$-Wert wird aus den Daten und dem gewählten Test bestimmt. Er gibt unter der Annahme von $H_0$ an, wie wahrscheinlich das beobachtete oder ein noch extremeres Ergebnis wäre.

Definition

p-Wert

Der $p$-Wert beschreibt die Vereinbarkeit der Daten mit $H_0$. Ein kleiner $p$-Wert bedeutet: Solche oder extremere Daten wären unter $H_0$ selten. Er gibt nicht an, wie wahrscheinlich $H_0$ wahr ist.

Vergleiche den $p$-Wert mit der vorher festgelegten Grenze:

  • $p<\alpha$: Lehne $H_0$ ab. Das Ergebnis ist statistisch signifikant.
  • $p\geq\alpha$: Lehne $H_0$ nicht ab. Das Ergebnis ist nicht statistisch signifikant.
Beispiel

Ein Test wird mit $\alpha=0{,}05$ durchgeführt und liefert $p=0{,}03$.

  1. Vergleiche die Werte: $0{,}03<0{,}05$.
  2. Der $p$-Wert liegt unter der festgelegten Grenze.
  3. Deshalb wird $H_0$ abgelehnt.
  4. Das Ergebnis ist auf dem 5-%-Niveau statistisch signifikant.

Die Entscheidung beweist jedoch weder $H_1$ noch einen großen oder wichtigen Effekt.

Teste dich
Frage 1 von 1MittelEin Test mit $\alpha=0{,}05$ ergibt $p=0{,}06$. Welche Entscheidung ist richtig?
Lösung: $H_0$ wird nicht abgelehnt; das Ergebnis ist nicht signifikant. — Es gilt $0{,}06\geq0{,}05$. Daher wird $H_0$ nicht abgelehnt. Die Nähe zur Schwelle ändert die vorher festgelegte Regel nicht.
Warum ist ein kleineres α nicht immer besser?

Ein kleineres $\alpha$ macht die Ablehnung von $H_0$ schwieriger. Du verlangst stärkere Evidenz und verringerst damit das zugelassene Risiko eines Fehlers 1. Art.

Das hat einen Zielkonflikt zur Folge: Bleiben Stichprobengröße, tatsächlicher Effekt und übrige Bedingungen gleich, kann ein kleineres $\alpha$ die Wahrscheinlichkeit erhöhen, eine falsche Nullhypothese nicht abzulehnen.

Definition

Fehler 2. Art

Ein Fehler 2. Art liegt vor, wenn $H_0$ nicht abgelehnt wird, obwohl sie falsch ist. Seine Wahrscheinlichkeit wird mit $\beta$ bezeichnet.

Ein kleineres Signifikanzniveau kann deshalb eine größere Stichprobe oder einen größeren beobachteten Unterschied erfordern. Die Wahl hängt davon ab, welche Folgen die beiden Fehler hätten. Bei schwerwiegenden Folgen einer falschen positiven Entscheidung kann etwa ein strengeres Niveau von 1 % angemessen sein.

Gut zu wissen

Das Signifikanzniveau wird vor der Auswertung festgelegt. Würdest du es erst nach Sichtung des $p$-Werts ändern, könntest du dieselben Daten nach Wunsch als signifikant oder nicht signifikant einstufen.

Teste dich
Frage 1 von 1MittelWas kann bei sonst gleichen Bedingungen durch ein kleineres $\alpha$ geschehen?
Lösung: Falsche Ablehnungen werden strenger begrenzt, aber Fehler 2. Art können wahrscheinlicher werden. — Ein kleineres $\alpha$ verlangt stärkere Evidenz. Dadurch sinkt das zugelassene Risiko eines Fehlers 1. Art, während eine tatsächlich falsche Nullhypothese eher unentdeckt bleiben kann.
Was bedeutet signifikant gerade nicht?

Das Wort „signifikant“ klingt im Alltag nach „wichtig“ oder „deutlich“. In der Statistik bezeichnet es zunächst nur eine Entscheidung nach der vorher festgelegten Testregel.

Ein signifikantes Ergebnis zeigt nicht automatisch:

  • dass $H_0$ mit hoher Wahrscheinlichkeit falsch ist;
  • dass $H_1$ bewiesen ist;
  • dass der Effekt groß oder praktisch wichtig ist;
  • dass ein beobachteter Zusammenhang ursächlich ist;
  • dass das Ergebnis auf andere Situationen übertragbar ist.

Ein nicht signifikantes Ergebnis beweist umgekehrt nicht, dass $H_0$ wahr ist. Vielleicht ist der Effekt klein, die Stichprobe zu klein oder die Streuung zu groß, um ihn mit dem Test zuverlässig zu erkennen.

Beispiel

Eine sehr große Stichprobe kann einen winzigen Unterschied als statistisch signifikant erkennen. Für eine sachliche Bewertung musst du zusätzlich fragen: Wie groß ist der Unterschied? Welche Folgen hat er? Wie zuverlässig sind Stichprobe, Modell und Studiendesign?

Teste dich
Frage 1 von 1SchwerIn einer Beobachtungsstudie tritt eine Krankheit in der Nähe einer Fabrik signifikant häufiger auf. Was darfst du folgern?
Lösung: Die Daten sprechen gegen die geprüfte Nullhypothese, beweisen aber nicht, dass die Fabrik die Krankheit verursacht. — Statistische Signifikanz bewertet die Daten unter einem Modell. Für eine Kausalaussage müssen Studiendesign und mögliche Alternativerklärungen zusätzlich geprüft werden.
So begründest du eine Testentscheidung vollständig

Eine gute Auswertung nennt nicht nur „signifikant“ oder „nicht signifikant“. Sie verbindet Voraussetzung, Vergleich, Entscheidung und Einschränkung.

Beispiel

Eine Werbeaussage wird mit einem Hypothesentest geprüft.

  • $H_0$: Die behauptete Verbesserung liegt nicht vor.
  • Vorab gewähltes Niveau: $\alpha=0{,}05$.
  • Testergebnis: $p=0{,}02$.

Da $0{,}02<0{,}05$ gilt, wird $H_0$ abgelehnt. Das Ergebnis ist statistisch signifikant. Die Daten liefern damit Evidenz gegen $H_0$. Sie beweisen aber weder die Werbeaussage noch deren praktische Bedeutung. Dafür müssten unter anderem Effektgröße und Untersuchungsaufbau beurteilt werden.

Nutze beim Formulieren diese vier Schritte:

  1. Nenne das vorab gewählte Signifikanzniveau.
  2. Vergleiche $p$ und $\alpha$.
  3. Formuliere „$H_0$ ablehnen“ oder „$H_0$ nicht ablehnen“.
  4. Begrenze die Aussage: kein Beweis für Wahrheit, Größe oder Kausalität.
Teste dich
Frage 1 von 1SchwerEin Test mit $\alpha=0{,}01$ liefert $p=0{,}03$. Welche Begründung ist vollständig?
Lösung: Weil $0{,}03\geq0{,}01$ gilt, wird $H_0$ nicht abgelehnt; ihre Wahrheit ist damit nicht bewiesen. — Verglichen wird immer mit dem vorher festgelegten $\alpha$. Nichtsignifikanz bedeutet nur, dass die Daten nach dieser Regel nicht zur Ablehnung von $H_0$ reichen.
Karteikasten
Karteikasten

Überlege zuerst selbst und drehe die Karte anschließend zum Prüfen um.

Alles auf einen Blick
Mindmap
  • Signifikanzniveau
    • wird vor dem Test festgelegt
    • begrenzt Fehler 1. Art
    • wird mit dem p-Wert verglichen
    • kleineres Alpha verlangt stärkere Evidenz
    • beweist weder Effektgröße noch Kausalität
  • Testentscheidung
    • p kleiner als Alpha: H0 ablehnen
    • p mindestens Alpha: H0 nicht ablehnen
  • Unsicherheit
    • Fehler 1. Art bleibt möglich
    • Fehler 2. Art bleibt möglich
    • Studiendesign und praktische Bedeutung zusätzlich prüfen
Abschluss-Check
Teste dich
Frage 1 von 3LeichtWelcher Wert wird vor der Datenauswertung festgelegt?
Lösung: Das Signifikanzniveau $\alpha$ — Das Signifikanzniveau gehört zur vorab bestimmten Entscheidungsregel.
Frage 2 von 3MittelBei $\alpha=0{,}05$ ergibt sich $p=0{,}04$. Was folgt nach der Regel der Seite?
Lösung: $H_0$ wird abgelehnt; das Ergebnis ist statistisch signifikant. — Da $0{,}04<0{,}05$ gilt, wird $H_0$ abgelehnt. Weitere Aussagen über Größe, Bedeutung oder Ursache benötigen zusätzliche Begründungen.
Frage 3 von 3SchwerZwei Studien untersuchen denselben Effekt. Nur die größere Studie findet ein signifikantes Ergebnis. Welche Erklärung ist fachlich möglich?
Lösung: Die größere Stichprobe kann auch einen kleinen Effekt zuverlässiger erkennen; seine praktische Bedeutung muss getrennt bewertet werden. — Die Stichprobengröße beeinflusst die Teststärke. Deshalb können statistische Signifikanz und praktische Bedeutung nicht gleichgesetzt werden.

Prüfe zum Schluss deine Sprache: Nenne die Vergleichsregel, formuliere die Entscheidung über $H_0$ und sage ausdrücklich, was daraus nicht bewiesen ist.

Passend dazu