Informatik

Unüberwachtes Lernen: Muster ohne Labels entdecken

Unüberwachtes Lernen: Muster ohne Labels entdecken
Unüberwachtes Lernen: Muster ohne Labels entdecken
Für Quiz, Lückentext, Lernkarten und Fortschritt ist JavaScript nötig. Alle Inhalte und Lösungen bleiben direkt lesbar.

Beim unüberwachten Lernen erhält ein Lernverfahren Daten ohne vorgegebene Beschriftungen oder richtige Zielantworten. Es sucht selbst nach Ähnlichkeiten, Gruppen, Zusammenhängen oder ungewöhnlichen Fällen. Menschen müssen anschließend prüfen, ob die gefundene Struktur fachlich sinnvoll ist.

Auf dieser Seite lernst du die wichtigsten Aufgaben kennen, vollziehst k-Means an einem Zahlenbeispiel nach und beurteilst Ergebnisse kritisch.

Deine Lernziele

Hake ab, was du schon kannst — und komm am Ende hierher zurück!

Was bedeutet Lernen ohne Labels?

Ein Label ist eine vorgegebene Beschriftung oder Zielantwort. Ein Tierfoto könnte beim überwachten Lernen zum Beispiel das Label „Katze“ oder „Hund“ tragen. Beim unüberwachten Lernen fehlen solche Vorgaben.

Definition

Unüberwachtes Lernen

Unüberwachtes Lernen ist maschinelles Lernen mit ungelabelten Eingabedaten. Das Lernverfahren sucht darin selbstständig nach Strukturen wie Gruppen, Beziehungen oder Ausreißern.

Stell dir einen Haufen Legosteine ohne Sortieranweisung vor. Du könntest die Steine nach Farbe, Größe oder Form ordnen. Keine dieser Einteilungen ist vorher als richtige Lösung vorgegeben. Ebenso hängt die von einem Lernverfahren entdeckte Struktur von den verwendeten Merkmalen und dem gewählten Verfahren ab.

Überwachtes Lernen verfolgt dagegen ein bekanntes Ziel. Es lernt aus Eingaben mit richtigen Zielantworten, um später beispielsweise eine Klasse oder einen Zahlenwert vorherzusagen.

FrageÜberwachtes LernenUnüberwachtes Lernen
Welche Daten liegen vor?Daten mit LabelsDaten ohne Labels
Was ist das typische Ziel?bekannte Klassen oder Werte vorhersagenunbekannte Strukturen entdecken
Wie wird bewertet?Vergleich mit richtigen Zielantwortenindirekte Prüfung und fachliche Interpretation
Wann ist es hilfreich?Ziel und zuverlässige Labels sind vorhandenLabels fehlen oder wären aufwendig zu erstellen
Merke

Keine Labels bedeutet nicht: keine Menschen. Menschen wählen Daten, Merkmale und Verfahren aus und müssen die Ergebnisse interpretieren und prüfen.

Teste dich
Frage 1 von 2LeichtWelches Merkmal kennzeichnet unüberwachtes Lernen?
Lösung: Die Eingabedaten besitzen keine vorgegebenen Ziel-Labels. — Unüberwachtes Lernen sucht Strukturen in ungelabelten Daten. Lernen durch Belohnungen gehört zum bestärkenden Lernen.
Frage 2 von 2MittelEin Unternehmen besitzt Kundendaten, aber noch keine festgelegten Kundentypen. Welcher erste Ansatz passt?
Lösung: Ähnliche Kundinnen und Kunden durch Clustering gruppieren. — Wenn Kategorien noch unbekannt sind, kann Clustering zunächst mögliche Gruppen sichtbar machen. Ihre Bedeutung muss danach geprüft werden.
Welche Strukturen kann das Verfahren finden?

Unüberwachtes Lernen umfasst mehrere Aufgabentypen. Sie beantworten unterschiedliche Fragen.

Clustering: Welche Daten ähneln sich?

Clustering teilt Datenobjekte anhand ausgewählter Merkmale in Gruppen, die Cluster. Bei Kundendaten könnten Kaufverhalten, Alter oder Einkommen als Merkmale dienen. Die Cluster besitzen zunächst keine inhaltlichen Namen wie „technikinteressiert“; solche Deutungen entstehen erst danach.

Beim harten Clustering gehört jedes Objekt genau zu einem Cluster. Beim weichen Clustering kann ein Objekt mit verschiedenen Zugehörigkeitsgraden mehreren Clustern zugeordnet sein. Hierarchisches Clustering stellt schrittweise Zusammenführungen oder Teilungen als Baumdiagramm dar.

Assoziationsanalyse: Was tritt gemeinsam auf?

Die Assoziationsanalyse sucht häufige Beziehungen zwischen Merkmalen oder Ereignissen. Eine Warenkorbanalyse kann beispielsweise zeigen, welche Produkte oft gemeinsam gekauft werden. Das ist eine gefundene Regelmäßigkeit, aber noch kein Beweis dafür, dass ein Produkt den Kauf des anderen verursacht.

Dimensionsreduktion: Wie werden viele Merkmale verdichtet?

Bei der Dimensionsreduktion wird eine große Zahl von Merkmalen auf eine kleinere Darstellung verdichtet. Dabei soll möglichst viel relevante Information erhalten bleiben. Das kann Daten übersichtlicher machen, Visualisierungen ermöglichen und nachfolgende Verfahren entlasten.

Die Hauptkomponentenanalyse, kurz PCA, erzeugt neue Komponenten. Die erste beschreibt die Richtung mit der größten Streuung der Daten. Jede weitere erfasst möglichst viel der verbleibenden Streuung und steht senkrecht auf den vorherigen Komponenten.

Anomalieerkennung: Was fällt aus dem Muster?

Eine Anomalie ist ein Datenpunkt, der deutlich vom üblichen Muster abweicht. Solche Ausreißer können auf einen Gerätefehler, ungewöhnlichen Netzwerkverkehr oder einen möglichen Betrugsfall hinweisen. Eine Anomalie ist jedoch nicht automatisch ein Fehler oder Betrug; sie ist zunächst ein Anlass zur Prüfung.

Teste dich
Frage 1 von 3LeichtWelche Aufgabe sucht nach häufig gemeinsam auftretenden Produkten?
Lösung: Assoziationsanalyse — Assoziationsanalyse untersucht Beziehungen wie „Produkt A und Produkt B treten häufig gemeinsam auf“.
Frage 2 von 3MittelEin Datensatz enthält 100 Merkmale und soll für eine übersichtliche Darstellung verdichtet werden. Welche Aufgabe passt?
Lösung: Dimensionsreduktion — Dimensionsreduktion überführt viele Merkmale in eine kleinere Darstellung und versucht dabei, möglichst viel relevante Information zu bewahren.
Frage 3 von 3MittelEin einzelner Messwert liegt weit außerhalb des sonst üblichen Bereichs. Welche Aufgabe passt am besten?
Lösung: Anomalieerkennung — Die Anomalieerkennung hebt ungewöhnliche Datenpunkte hervor. Erst eine fachliche Prüfung klärt ihre Bedeutung.
Wie arbeitet k-Means?

k-Means ist ein Verfahren für hartes Clustering. Die Zahl der gewünschten Cluster wird vorher als k festgelegt. Jedes Datenobjekt wird genau einem Cluster zugeordnet.

Der Ablauf wiederholt zwei zentrale Schritte:

  1. Lege für die k Cluster zunächst je ein Zentrum fest.
  2. Ordne jedes Datenobjekt dem nächstgelegenen Zentrum zu.
  3. Berechne für jedes Cluster aus den zugeordneten Daten ein neues Zentrum.
  4. Wiederhole Zuordnung und Neuberechnung, bis sich die Zuordnungen nicht mehr ändern oder ein festgelegtes Abbruchkriterium erreicht ist.

Welches Zentrum „am nächsten“ liegt, entscheidet ein Distanzmaß. Häufig wird der euklidische Abstand verwendet. Deshalb beeinflussen die ausgewählten Merkmale, ihre Skalierung und das Distanzmaß das Ergebnis.

Beispiel

Vier Hörprofile werden durch den Anteil schneller Titel beschrieben: 1, 2, 8 und 9. Für $k=2$ starten die Clusterzentren bei 1 und 9.

Erste Zuordnung:

  • 1 und 2 liegen näher am Zentrum 1.
  • 8 und 9 liegen näher am Zentrum 9.

Neue Zentren:

  • Erstes Cluster: $(1+2)/2=1{,}5$
  • Zweites Cluster: $(8+9)/2=8{,}5$

Bei der nächsten Zuordnung bleiben 1 und 2 beim ersten sowie 8 und 9 beim zweiten Zentrum. Die Zuordnung ist stabil; der Durchlauf endet.

Das Ergebnis sind zwei Gruppen ähnlicher Hörprofile. Ob sie sinnvoll als „eher langsam“ und „eher schnell“ bezeichnet werden können, muss ein Mensch anhand der Daten und des Anwendungszwecks prüfen.

Was verändert der Parameter k?

Ein kleines k erzeugt wenige, eher grobe Gruppen. Ein größeres k erzeugt mehr und meist feinere Gruppen. Mehr Cluster bedeuten aber nicht automatisch ein besseres Ergebnis: Eine sehr feine Aufteilung kann für die eigentliche Fragestellung nutzlos sein.

Auch unterschiedliche Anfangszentren können zu unterschiedlichen Gruppierungen führen. Deshalb sollte man Ergebnisse vergleichen und nicht die erste Ausgabe ungeprüft übernehmen.

Lückentext

Wähle in jeder Lücke die passende Form und prüfe anschließend deine Antworten.

Bei k-Means wird die Zahl der Cluster durch festgelegt. Jeder Datenpunkt gehört beim harten Clustering zu Cluster. Nach der Zuordnung werden die neu bestimmt. Ein größeres k führt gewöhnlich zu Gruppen.

Lösungen: Lücke 1: k; Lücke 2: genau einem; Lücke 3: Clusterzentren; Lücke 4: mehr und feineren. k ist ein vorab gewählter Parameter. k-Means ordnet jeden Punkt genau einem Cluster zu und aktualisiert anschließend die Zentren.
Teste dich
Frage 1 von 2MittelZwei sehr ähnliche Datenpunkte landen bei k-Means normalerweise im selben Cluster. Worauf beruht diese Zuordnung?
Lösung: Auf ihrer Nähe zu einem Clusterzentrum gemäß dem gewählten Distanzmaß. — k-Means vergleicht Abstände zu den Clusterzentren. Das verwendete Distanzmaß und die Merkmale bestimmen, was als ähnlich gilt.
Frage 2 von 2SchwerNach einer Erhöhung von k entstehen mehr, kleinere Kundengruppen. Welche Schlussfolgerung ist zulässig?
Lösung: Die Aufteilung ist feiner, muss aber noch auf fachlichen Nutzen geprüft werden. — Ein größeres k verändert die Granularität. Ob die zusätzlichen Cluster hilfreich und sinnvoll sind, entscheidet der Anwendungskontext.
Wie prüfst du gefundene Muster?

Beim unüberwachten Lernen fehlt meist eine Ground Truth, also eine Sammlung bekannter richtiger Zielantworten. Deshalb lässt sich ein Cluster nicht einfach als „richtig“ oder „falsch“ markieren.

Eine verantwortungsvolle Prüfung betrachtet mehrere Ebenen:

  1. Datenqualität: Fehlen Werte? Gibt es Messfehler oder ungeeignete Daten?
  2. Merkmale: Beschreiben die ausgewählten Eigenschaften die Fragestellung sinnvoll?
  3. Parameter und Verfahren: Wie verändern k, Anfangszentren, Distanzmaß oder Vorverarbeitung das Ergebnis?
  4. Innere Struktur: Sind Punkte innerhalb eines Clusters ähnlich und verschiedene Cluster ausreichend getrennt?
  5. Fachliche Bedeutung: Können Fachleute die Gruppen nachvollziehbar deuten und für den vorgesehenen Zweck verwenden?

Kennzahlen wie der Silhouetten-Score oder Verfahren wie die Ellenbogenmethode können beim Vergleich von Clusterlösungen helfen. Sie ersetzen jedoch nicht die fachliche Interpretation.

Gut zu wissen

Ein Algorithmus findet rechnerische Muster, aber kein menschliches Problemverständnis. Eine auffällige Gruppe kann durch einen echten Zusammenhang entstehen – oder durch verzerrte Daten, eine ungeeignete Skalierung oder zufällige Besonderheiten.

Typische Denkfehler

  • „Ein Cluster ist eine echte natürliche Kategorie.“ Cluster hängen von Daten, Merkmalen, Parametern und Verfahren ab.
  • „Eine Korrelation erklärt die Ursache.“ Gemeinsames Auftreten zeigt zunächst nur eine Beziehung, keine Ursache.
  • „Ein Ausreißer ist sicher ein Betrugsfall.“ Eine Anomalie ist ein Prüfhinweis, kein fertiges Urteil.
  • „Ohne Labels ist keine Kontrolle nötig.“ Gerade ohne richtige Zielantworten sind Vergleiche und Fachwissen wichtig.
Teste dich
Frage 1 von 2MittelEin Modell bildet Kundengruppen hauptsächlich nach dem Alter. Was solltest du zuerst fragen?
Lösung: Ob das Alter für den Zweck ein sinnvolles Merkmal ist und ob andere Merkmale angemessen berücksichtigt wurden. — Vor der Nutzung muss geprüft werden, ob Daten, Merkmale und Gruppierung zur Fragestellung passen und keine irreführende Deutung fördern.
Frage 2 von 2SchwerEin System markiert eine ungewöhnliche Zahlung als Anomalie. Welche Reaktion ist angemessen?
Lösung: Die Zahlung als auffällig behandeln und mit weiteren Informationen prüfen. — Anomalieerkennung liefert Hinweise. Entscheidungen mit möglichen Folgen benötigen zusätzliche Prüfung und Kontext.
Karteikasten
Karteikasten

Überlege zuerst selbst und drehe die Karte anschließend zum Prüfen um.

Alles auf einen Blick
Mindmap
  • Unüberwachtes Lernen
    • Grundlage: ungelabelte Daten
    • Ziel: unbekannte Strukturen entdecken
    • Clustering: ähnliche Objekte gruppieren
    • Assoziation: gemeinsames Auftreten finden
    • Dimensionsreduktion: Merkmale verdichten
    • Anomalieerkennung: ungewöhnliche Fälle markieren
    • Prüfung: Daten, Merkmale und Parameter vergleichen
    • Deutung: Ergebnisse fachlich validieren
Abschluss-Check
Teste dich
Frage 1 von 5LeichtWelche Aussage grenzt unüberwachtes Lernen korrekt ab?
Lösung: Es entdeckt Strukturen ohne vorgegebene Ziel-Labels. — Die Daten besitzen keine Ziel-Labels. Menschen bleiben dennoch für Auswahl, Kontrolle und Deutung verantwortlich.
Frage 2 von 5MittelEin Händler möchte herausfinden, welche Produkte häufig gemeinsam gekauft werden. Welche Methode passt unmittelbar?
Lösung: Assoziationsanalyse — Assoziationsanalyse sucht häufiges gemeinsames Auftreten und kann dadurch Warenkorbmuster sichtbar machen.
Frage 3 von 5MittelBei k-Means liefert k = 3 eine andere Gruppierung als k = 6. Was zeigt das?
Lösung: Die Clusterstruktur hängt unter anderem vom gewählten Parameter k ab. — k legt die Zahl der Gruppen fest. Mehrere Einstellungen sollten rechnerisch und fachlich verglichen werden.
Frage 4 von 5SchwerZwei Teams clustern denselben Datensatz, verwenden aber unterschiedliche Merkmale. Ihre Ergebnisse unterscheiden sich. Welche Erklärung ist am besten?
Lösung: Die Merkmalswahl verändert, welche Ähnlichkeiten das Verfahren erkennen kann. — Daten werden nur anhand der bereitgestellten Merkmale verglichen. Deshalb gehören Merkmalswahl und Ergebnisinterpretation zusammen.
Frage 5 von 5SchwerEine gefundene Kundengruppe erhält den Namen „wenig interessiert“. Was ist vor der Verwendung dieses Namens nötig?
Lösung: Prüfen, welche beobachtbaren Merkmale das Cluster tatsächlich kennzeichnen und ob die Deutung daraus folgt. — Cluster besitzen zunächst keine sichere inhaltliche Bedeutung. Eine Bezeichnung muss durch die enthaltenen Daten begründet und auf mögliche Verzerrungen geprüft werden.

Passend dazu