Informatik

Trainingsdaten: Qualität, Aufteilung und Bias

Trainingsdaten: Qualität, Aufteilung und Bias
Trainingsdaten: Qualität, Aufteilung und Bias
Für Quiz, Lückentext, Lernkarten und Fortschritt ist JavaScript nötig. Alle Inhalte und Lösungen bleiben direkt lesbar.

Trainingsdaten sind Beispiele, aus denen ein Machine-Learning-Modell Muster und Zusammenhänge lernt. Ob es später bei neuen Fällen zuverlässig funktioniert, hängt nicht nur von der Datenmenge ab. Ebenso wichtig sind Qualität, Vielfalt, Repräsentativität und eine saubere Trennung von Trainings-, Validierungs- und Testdaten.

Deine Lernziele

Hake ab, was du schon kannst — und komm am Ende hierher zurück!

Wie lernt ein Modell aus Daten?

Ein Machine-Learning-Modell erhält viele Beispiele. Während des Trainings passt ein Lernverfahren das Modell so an, dass es in den Daten wiederkehrende Muster nutzen kann. Das Ergebnis soll anschließend auch bei neuen, bisher ungesehenen Fällen funktionieren.

Trainingsdaten können sehr unterschiedlich aussehen:

  • Texte, etwa E-Mails oder Produktbewertungen
  • Bilder und Videos
  • Audioaufnahmen
  • Tabellen und Messwerte
Definition

Merkmal

Ein Merkmal ist eine beobachtete Eigenschaft eines Beispiels. Bei einer Maschine können Temperatur und Schwingung Merkmale sein. Bei einer E-Mail können Wörter in der Betreffzeile als Merkmale dienen.

Definition

Label

Ein Label ist das vorgegebene richtige Ergebnis eines Trainingsbeispiels. Eine E-Mail kann zum Beispiel das Label Spam oder kein Spam tragen.

Definition

Vorhersage

Eine Vorhersage ist das Ergebnis, das das trainierte Modell für einen neuen Fall erzeugt. Sie ist nicht automatisch richtig und muss geprüft werden.

Beim überwachten Lernen enthalten die Trainingsdaten Merkmale und passende Labels. Das Modell lernt die Beziehung zwischen Eingaben und erwarteten Ergebnissen. Beim unüberwachten Lernen fehlen vorgegebene Labels. Das Verfahren sucht stattdessen selbst nach Strukturen oder Gruppen in den Daten.

Beispiel

Ein Modell soll E-Mails als Spam oder kein Spam einordnen.

  1. Die Wörter und weitere Eigenschaften einer E-Mail bilden die Merkmale.
  2. Menschen kennzeichnen Trainingsbeispiele mit Spam oder kein Spam. Das sind die Labels.
  3. Das Modell sucht Zusammenhänge zwischen Merkmalen und Labels.
  4. Bei einer neuen E-Mail erzeugt es eine Vorhersage.

Ein einzelnes Wort wie „kostenlos“ reicht dabei nicht als sichere Regel. Das Modell muss mehrere gelernte Hinweise zusammenführen.

Lückentext

Wähle in jeder Lücke die passende Form und prüfe anschließend deine Antworten.

Beim überwachten Lernen heißen beobachtete Eigenschaften . Das vorgegebene richtige Ergebnis ist das . Das Ergebnis des Modells für einen neuen Fall heißt . Beim unüberwachten Lernen gibt es keine vorgegebenen .

Lösungen: Lücke 1: Merkmale; Lücke 2: Label; Lücke 3: Vorhersage; Lücke 4: Labels. Merkmale beschreiben die Eingabe, Labels geben Trainingsbeispielen ein Ziel, und Vorhersagen entstehen durch das Modell.
Teste dich
Frage 1 von 2LeichtWelche Angabe ist im Spam-Beispiel ein Label?
Lösung: „Spam“ — Das Label ist die bekannte Zielangabe eines Trainingsbeispiels.
Frage 2 von 2MittelEin Datensatz enthält Kaufhäufigkeit und Bestellwert, aber keinen Kundentyp. Was kann ein unüberwachtes Verfahren damit tun?
Lösung: Ähnliche Kundinnen und Kunden anhand der Daten gruppieren — Unüberwachtes Lernen sucht Muster oder Gruppen ohne vorgegebene Zielklassen.
Warum werden Daten in drei Teile getrennt?

Ein Modell darf nicht mit denselben Beispielen lernen und anschließend ausschließlich an diesen Beispielen bewertet werden. Sonst zeigt das Ergebnis vor allem, wie gut es die bekannten Daten angepasst hat.

TeilmengeAufgabeDarf das Modell daraus lernen?
TrainingModellparameter anpassenJa
ValidierungVarianten und Hyperparameter vergleichen, Überanpassung erkennenNicht als eigentliche Trainingsmenge
Testabschließende Leistung an ungesehenen Fällen prüfenNein

Modellparameter werden während des Trainings aus den Beispielen angepasst. Hyperparameter sind Einstellungen des Lernverfahrens oder der Modellgestaltung, die vor oder zwischen Trainingsläufen gewählt werden.

Eine Aufteilung in 70 % Training, 20 % Validierung und 10 % Test ist ein mögliches Beispiel. Die Anteile ergeben zusammen 100 %, sind aber keine allgemeingültige Vorschrift. Eine sinnvolle Aufteilung hängt unter anderem von Aufgabe, Datenmenge und Prüfverfahren ab.

Merke

Der Testdatensatz ist die Abschlussprüfung des Modells. Wird er schon zur Auswahl oder Verbesserung des Modells benutzt, ist die spätere Testbewertung nicht mehr unabhängig.

Beispiel

Ein Team entwickelt mehrere Varianten eines Bilderkennungsmodells.

  1. Jede Variante lernt aus den Trainingsdaten.
  2. Mit den Validierungsdaten vergleicht das Team die Varianten und wählt Einstellungen aus.
  3. Erst nachdem diese Entscheidungen abgeschlossen sind, wird das gewählte Modell einmal abschließend mit den Testdaten bewertet.

So bleiben die Testfälle für das Modell und für die Modellauswahl ungesehen.

Teste dich
Frage 1 von 2LeichtWofür werden Trainingsdaten verwendet?
Lösung: Zum Anpassen der Modellparameter — Beim Training werden die veränderbaren Parameter des Modells an die Beispiele angepasst.
Frage 2 von 2MittelWarum darf das Testset nicht fortlaufend zur Verbesserung des Modells dienen?
Lösung: Weil das Modell oder die Modellauswahl sonst indirekt an die Testfälle angepasst wird — Ein häufig betrachtetes Testset verliert seine Rolle als unabhängige Abschlussprüfung.
Woran erkennst du gute Trainingsdaten?

Ein großer Datensatz ist nicht automatisch ein guter Datensatz. Er muss die spätere Aufgabe und die tatsächlichen Einsatzbedingungen möglichst passend abbilden.

Wichtige Qualitätsmerkmale sind:

  • Relevanz: Die Daten passen zur Aufgabe.
  • Repräsentativität: Wichtige reale Fälle und Gruppen kommen angemessen vor.
  • Vielfalt: Unterschiedliche Umgebungen, Geräte, Ausdrucksweisen oder Grenzfälle sind enthalten.
  • Korrektheit: Werte und Labels sind möglichst richtig.
  • Konsistenz: Formate und Kennzeichnungsregeln werden einheitlich verwendet.
  • Klassenbalance: Seltene, aber wichtige Klassen werden nicht übersehen.

Vor dem Training werden Rohdaten deshalb häufig bereinigt und aufbereitet. Dabei können fehlende Werte, Duplikate, Formatabweichungen und fehlerhafte Labels auffallen. Bei gelabelten Daten müssen außerdem die Kennzeichnungsregeln eindeutig sein.

Definition

Verzerrung

Eine Verzerrung, oft auch Bias genannt, entsteht, wenn die Datenauswahl oder -kennzeichnung bestimmte Fälle systematisch bevorzugt oder benachteiligt. Das Modell kann diese Schieflage übernehmen.

Beispiel

Eine Spracherkennung wird fast nur mit ruhigen Studioaufnahmen trainiert. Später soll sie auch in Klassenzimmern, auf Fluren und bei unterschiedlichen Sprechweisen funktionieren.

Der Datensatz bildet die Einsatzbedingungen nicht ausreichend ab. Mehr Studioaufnahmen würden die entscheidende Lücke nicht unbedingt schließen. Nützlicher wären gezielt ausgewählte Aufnahmen aus den bisher fehlenden Situationen. Danach müsste die Leistung für diese Situationen getrennt geprüft werden.

Eine gute Gesamtkennzahl kann Probleme verdecken. Deshalb sollte die Modellleistung nicht nur insgesamt, sondern auch für wichtige Klassen, Gruppen und Grenzfälle betrachtet werden.

Teste dich
Frage 1 von 2MittelEin Bilderdatensatz enthält viele helle Außenaufnahmen, aber kaum dunkle Innenaufnahmen. Was ist der sinnvollste erste Schritt?
Lösung: Die fehlende Aufnahmesituation gezielt ergänzen und getrennt prüfen — Entscheidend ist die Abdeckung der realen Varianten, nicht allein die Gesamtmenge.
Frage 2 von 2SchwerEin Modell erreicht insgesamt eine gute Trefferquote, scheitert aber oft bei einer seltenen Klasse. Welche Schlussfolgerung ist angemessen?
Lösung: Die Gesamtkennzahl verdeckt eine Schwäche, die für diese Klasse getrennt untersucht werden muss — Segmentierte Auswertungen zeigen Fehler, die ein Durchschnittswert verdecken kann.
Wie viel Training ist genug?

Es gibt keine universelle Mindestzahl von Trainingsbeispielen. Der Bedarf hängt unter anderem von der Aufgabenkomplexität, dem Modelltyp, der Klassenanzahl, der Datenqualität, der gewünschten Zuverlässigkeit und der Vielfalt der späteren Fälle ab.

Komplexe Bild-, Audio- oder Sprachaufgaben benötigen häufig mehr und vielfältigere Daten als einfache Aufgaben mit gut aufbereiteten Tabellenmerkmalen. Ein vortrainiertes Modell kann den Bedarf an neuen aufgabenspezifischen Daten verringern.

Eine Lernkurve hilft bei der Planung:

  1. Erstelle einen repräsentativen Pilotdatensatz.
  2. Trenne Training, Validierung und Test sauber.
  3. Trainiere mit schrittweise wachsenden Anteilen der Trainingsdaten, etwa 10 %, 20 %, 40 %, 60 %, 80 % und 100 %.
  4. Miss die Leistung jeweils auf geeigneten Validierungsdaten.
  5. Prüfe, ob die Verbesserung weiter deutlich steigt oder ein Plateau erreicht.
  6. Untersuche zusätzlich wichtige Klassen und Gruppen getrennt.

Flacht die Lernkurve ab, sind zusätzliche ähnliche Daten möglicherweise weniger hilfreich. Dann können fehlerhafte Labels, ungeeignete Merkmale, Klassenungleichgewicht oder die Modellwahl wichtigere Engpässe sein.

Definition

Überanpassung

Überanpassung oder Overfitting bedeutet: Ein Modell passt sehr gut zu seinen Trainingsdaten, überträgt die gelernten Zusammenhänge aber schlecht auf neue Fälle.

Ein deutlicher Abstand zwischen guter Trainingsleistung und schwächerer Leistung auf unabhängigen Daten kann auf Überanpassung hinweisen. Er ist ein Warnsignal, das genauer untersucht werden muss.

Gut zu wissen

Datenaugmentation, Transferlernen, aktives Lernen und synthetische Daten können den Bedarf an neu erhobenen Daten senken. Diese Verfahren ersetzen die Qualitätsprüfung nicht. Insbesondere synthetische oder veränderte Beispiele müssen realistisch sein und gegen reale Daten geprüft werden.

Teste dich
Frage 1 von 2MittelEine Lernkurve steigt mit jeder größeren Trainingsmenge noch deutlich. Was spricht das am ehesten dafür?
Lösung: Weitere passende Trainingsdaten könnten noch nützen — Die Lernkurve zeigt, wie sich die gemessene Leistung mit wachsender Trainingsmenge verändert.
Frage 2 von 2SchwerDie Lernkurve erreicht ein Plateau, aber eine Minderheitsklasse bleibt schwach. Was ist die beste nächste Untersuchung?
Lösung: Die Datenabdeckung und Labels dieser Klasse getrennt prüfen — Ein Gesamtplateau kann eine gezielte Datenlücke in einzelnen Segmenten verdecken.
Welche Verantwortung gehört zur Datenauswahl?

Trainingsdaten betreffen nicht nur technische Leistung. Ihre Herkunft und Nutzung müssen ebenfalls geprüft werden.

Achte besonders auf:

  • Datenschutz und den Schutz personenbezogener Daten
  • Einwilligungen und zulässige Nutzungszwecke
  • Urheber- und Lizenzrechte
  • mögliche Benachteiligungen betroffener Gruppen
  • nachvollziehbare Herkunft und Bearbeitung der Daten

Öffentlich zugängliche Inhalte dürfen nicht automatisch für jeden Zweck frei genutzt werden. Rechtliche Ausnahmen für Text und Data Mining gelten nur unter bestimmten Voraussetzungen und sind keine allgemeine Erlaubnis für jede KI-Anwendung.

Beispiel

Ein Team findet im Internet eine große Bildsammlung. Vor der Nutzung reichen Dateimenge und technische Qualität nicht als Prüfung aus. Das Team muss auch klären, woher die Bilder stammen, welche Rechte gelten, ob personenbezogene Informationen betroffen sind und welche Gruppen oder Situationen fehlen.

Teste dich
Frage 1 von 1MittelWelche Prüfung gehört zu einer verantwortlichen Datenauswahl?
Lösung: Herkunft, Nutzungsrechte, Datenschutz und mögliche Verzerrungen gemeinsam betrachten — Technische Qualität, rechtliche Bedingungen und mögliche Folgen gehören zusammen.
Karteikasten
Karteikasten

Überlege zuerst selbst und drehe die Karte anschließend zum Prüfen um.

Alles auf einen Blick
Mindmap
  • Trainingsdaten
    • liefern Beispiele für das Lernen
    • enthalten Merkmale und manchmal Labels
    • werden von Validierungs- und Testdaten getrennt
    • brauchen Qualität, Vielfalt und Repräsentativität
    • können Verzerrungen und blinde Flecken enthalten
    • werden mit Lernkurven auf ausreichende Menge untersucht
    • erfordern Prüfung von Herkunft, Datenschutz und Rechten
Abschluss-Check
Teste dich
Frage 1 von 3LeichtWelche Reihenfolge beschreibt die Rollen der drei Datenmengen richtig?
Lösung: Training passt Parameter an, Validierung unterstützt die Auswahl, Test bewertet abschließend — Die drei Mengen erfüllen verschiedene Aufgaben und schützen gemeinsam vor einer zu optimistischen Beurteilung.
Frage 2 von 3MittelEin Modell erkennt Tierarten in den Trainingsbildern fast fehlerfrei, schneidet bei neuen Bildern aber deutlich schlechter ab. Was ist eine naheliegende Diagnose?
Lösung: Mögliche Überanpassung — Ein großer Abstand zwischen Trainings- und Testleistung kann auf Überanpassung hinweisen.
Frage 3 von 3SchwerEin Team kann entweder 10.000 sehr ähnliche Beispiele sammeln oder gezielt fehlende Umgebungen und seltene Klassen ergänzen. Welche Entscheidung ist besser begründet?
Lösung: Zuerst die erkannten Abdeckungslücken gezielt schließen und die Segmente getrennt prüfen — Die richtigen Daten sind oft wertvoller als eine undifferenzierte Vergrößerung des Datensatzes.

Du kannst Trainingsdaten nun nicht nur als große Beispielsammlung beschreiben. Du kannst auch prüfen, was sie abbilden, wie sie aufgeteilt werden und welche Fälle oder Gruppen fehlen könnten.

Passend dazu