‹ Informatik

Unicode

Unicode verständlich erklärt: Definition, Darstellung, Beispiele und Bedeutung für Zahlen, Zeichen und Information.

Wenn du eine Nachricht mit Emoji verschickst, soll sie auf dem Handy deiner Freundin genauso aussehen wie auf deinem. Auch Namen mit ä, ß oder Buchstaben aus anderen Sprachen müssen richtig ankommen. Damit Computer dabei nicht raten müssen, gibt es Unicode.

Was Unicode möglich macht

Deine Lernziele
  • Du erklärst, warum Computer Zeichen Nummern geben.
  • Du unterscheidest Unicode und UTF-8.
  • Du liest einfache Codepunkte wie U+0041.
  • Du verstehst, warum dieselbe Nachricht auf vielen Geräten lesbar bleibt.

Früher konnten Zeichensammlungen oft nur wenige Buchstaben und Zeichen speichern. Das reichte für manche Sprachen, aber nicht für Texte aus der ganzen Welt, Mathezeichen oder Emojis.

Unicode ist ein gemeinsamer Standard. Er legt für sehr viele Zeichen feste Nummern fest. Ein Zeichen kann ein Buchstabe, eine Ziffer, ein Satzzeichen, ein Symbol oder ein Emoji sein.

Definition

Unicode ordnet Zeichen eindeutige Nummern zu, damit Programme weltweit dieselben Zeichen meinen.

Beispiel

Im Wort Mädchen sind M, ä, d und c einzelne Zeichen. Auch das Leerzeichen und ein Emoji wie 🌍 können Zeichen sein.

Unicode sorgt dafür, dass das ä nicht plötzlich als ein falsches Symbol erscheint.

Merke

Unicode ist wie ein großes gemeinsames Nummernbuch für Zeichen aus vielen Sprachen und für Symbole.

Interaktive Quizfrage wird geladen ...

Zeichen haben Codepunkte

Stell dir vor, jedes Zeichen hat eine Platznummer in einem riesigen Regal. Diese Nummer heißt Codepunkt. Codepunkte schreibt man meist mit U+ davor und mit Ziffern von 0 bis 9 sowie den Buchstaben A bis F.

Diese Schreibweise heißt hexadezimal. Sie verwendet das Zahlensystem zur Basis 16. Nach 9 folgen darin A, B, C, D, E und F.

Definition

Ein Codepunkt ist die feste Unicode Nummer eines Zeichens. Zum Beispiel steht U+0041 für den Buchstaben A.

Beispiel
  • A hat den Codepunkt U+0041.
  • ß hat den Codepunkt U+00DF.
  • hat den Codepunkt U+20AC.
  • 😀 hat den Codepunkt U+1F600.

Die Nummer beschreibt, welches Zeichen gemeint ist. Sie ist nicht die Zeichnung selbst.

Manche sichtbaren Zeichen bestehen aus mehreren Codepunkten. Das gilt zum Beispiel für viele Flaggen und für Emojis mit Hautfarbe. Sie wirken wie ein Zeichen, werden aber aus einer Folge von Unicode Zeichen zusammengesetzt.

Gut zu wissen

Ein Codepunkt und die sichtbare Form sind nicht dasselbe. Außerdem entspricht nicht jede sichtbare Einheit genau einem einzelnen Codepunkt.

Interaktiver Lückentext wird geladen ...

Von Nummern zu Nullen und Einsen

Computer speichern keine Buchstaben direkt. Sie speichern Bits, also Stellen mit den Werten 0 oder 1. Acht Bits zusammen heißen Byte.

Damit aus einem Unicode Codepunkt eine Folge aus Bytes wird, braucht ein Computer eine Kodierung. Eine Kodierung ist eine Regel zum Umwandeln und Speichern von Zeichen als Bytes.

Definition

UTF-8 ist eine weit verbreitete Unicode Kodierung. Sie übersetzt Unicode Zeichen in Bytes.

UTF-8 ist besonders praktisch: Gewöhnliche lateinische Zeichen brauchen wenig Speicherplatz. Andere Zeichen können mehr Bytes benötigen. Trotzdem kann UTF-8 Text aus vielen Sprachen und Emojis speichern.

Beispiel

Das Zeichen A wird in UTF-8 mit einem Byte gespeichert. Das Zeichen ä braucht zwei Bytes. Ein Emoji wie 😀 braucht in UTF-8 vier Bytes.

Alle drei sind Unicode Zeichen. Nur ihre Speicherung als Bytes ist unterschiedlich lang.

Merke

Unicode sagt, welches Zeichen gemeint ist. UTF-8 sagt, wie dieses Zeichen als Bytes gespeichert wird.

Interaktive Quizfrage wird geladen ...

Richtig speichern und richtig lesen

Beim Speichern wandelt ein Programm Zeichen mit einer Kodierung in Bytes um. Beim Öffnen muss das andere Programm dieselbe Kodierung verwenden, um die Bytes wieder richtig zu lesen.

Wird eine Datei mit der falschen Kodierung geöffnet, entstehen manchmal seltsame Zeichen. Aus ä kann dann zum Beispiel ä werden. Das Zeichen war nicht unbedingt kaputt: Es wurde nur mit der falschen Regel gelesen.

Beispiel

Ein Programm speichert das Wort grün in UTF-8. Ein anderes Programm erwartet eine ältere Kodierung und deutet die Bytes falsch. Dann kann statt grün ein unleserliches Wort erscheinen.

Wenn beide Programme UTF-8 verwenden, bleibt grün korrekt.

Gut zu wissen

Bei einer Textdatei oder Webseite kann man oft einstellen, welche Kodierung verwendet wird. UTF-8 ist im Internet sehr verbreitet.

Interaktive Quizfrage wird geladen ...

Zeichen und Aussehen unterscheiden

Die sichtbare Form eines Zeichens heißt Glyphe. Eine Glyphe ist die Zeichnung, die eine Schriftart für ein Zeichen zeigt. Deshalb kann derselbe Buchstabe in verschiedenen Schriftarten anders aussehen.

Unicode speichert vor allem die Bedeutung eines Zeichens, nicht sein genaues Aussehen. Ob ein Gerät ein bestimmtes Zeichen schön, bunt oder überhaupt sichtbar zeigt, hängt auch von den installierten Schriftarten ab.

Beispiel

Das Zeichen A kann in einer Schrift kantig und in einer anderen rund wirken. Es bleibt trotzdem derselbe Unicode Codepunkt U+0041.

Ein älteres Gerät kennt möglicherweise ein neues Emoji noch nicht. Dann zeigt es vielleicht ein leeres Kästchen. Die Nachricht kann trotzdem den passenden Codepunkt oder eine passende Folge von Codepunkten enthalten.

Merke

Codepunkt bedeutet: Welches Zeichen ist gemeint? Glyphe bedeutet: Wie wird dieses Zeichen gerade dargestellt?

Interaktive Quizfrage wird geladen ...

Zusammenfassung

Unicode ist ein Standard mit festen Nummern für Zeichen aus vielen Sprachen, für Symbole und für Emojis. Diese Nummern heißen Codepunkte und werden oft wie U+00DF geschrieben. Manche sichtbaren Zeichen bestehen aus mehreren Codepunkten.

Computer speichern Zeichen als Bits und Bytes. UTF-8 ist eine Kodierung, die Unicode Zeichen in Bytes umwandelt. Damit Text richtig ankommt, müssen speicherndes und lesendes Programm dieselbe Kodierung verwenden.

Merke dir besonders: Unicode bestimmt die Bedeutung eines Zeichens. Eine Schriftart bestimmt sein Aussehen.