Wenn du eine Nachricht mit Emoji verschickst, soll sie auf dem Handy deiner Freundin genauso aussehen wie auf deinem. Auch Namen mit ä, ß oder Buchstaben aus anderen Sprachen müssen richtig ankommen. Damit Computer dabei nicht raten müssen, gibt es Unicode.
Was Unicode möglich macht
- Du erklärst, warum Computer Zeichen Nummern geben.
- Du unterscheidest Unicode und UTF-8.
- Du liest einfache Codepunkte wie U+0041.
- Du verstehst, warum dieselbe Nachricht auf vielen Geräten lesbar bleibt.
Früher konnten Zeichensammlungen oft nur wenige Buchstaben und Zeichen speichern. Das reichte für manche Sprachen, aber nicht für Texte aus der ganzen Welt, Mathezeichen oder Emojis.
Unicode ist ein gemeinsamer Standard. Er legt für sehr viele Zeichen feste Nummern fest. Ein Zeichen kann ein Buchstabe, eine Ziffer, ein Satzzeichen, ein Symbol oder ein Emoji sein.
Unicode ordnet Zeichen eindeutige Nummern zu, damit Programme weltweit dieselben Zeichen meinen.
Im Wort Mädchen sind M, ä, d und c einzelne Zeichen. Auch das Leerzeichen und ein Emoji wie 🌍 können Zeichen sein.
Unicode sorgt dafür, dass das ä nicht plötzlich als ein falsches Symbol erscheint.
Unicode ist wie ein großes gemeinsames Nummernbuch für Zeichen aus vielen Sprachen und für Symbole.
Interaktive Quizfrage wird geladen ...
Zeichen haben Codepunkte
Stell dir vor, jedes Zeichen hat eine Platznummer in einem riesigen Regal. Diese Nummer heißt Codepunkt. Codepunkte schreibt man meist mit U+ davor und mit Ziffern von 0 bis 9 sowie den Buchstaben A bis F.
Diese Schreibweise heißt hexadezimal. Sie verwendet das Zahlensystem zur Basis 16. Nach 9 folgen darin A, B, C, D, E und F.
Ein Codepunkt ist die feste Unicode Nummer eines Zeichens. Zum Beispiel steht U+0041 für den Buchstaben A.
Ahat den CodepunktU+0041.ßhat den CodepunktU+00DF.€hat den CodepunktU+20AC.😀hat den CodepunktU+1F600.
Die Nummer beschreibt, welches Zeichen gemeint ist. Sie ist nicht die Zeichnung selbst.
Manche sichtbaren Zeichen bestehen aus mehreren Codepunkten. Das gilt zum Beispiel für viele Flaggen und für Emojis mit Hautfarbe. Sie wirken wie ein Zeichen, werden aber aus einer Folge von Unicode Zeichen zusammengesetzt.
Ein Codepunkt und die sichtbare Form sind nicht dasselbe. Außerdem entspricht nicht jede sichtbare Einheit genau einem einzelnen Codepunkt.
Interaktiver Lückentext wird geladen ...
Von Nummern zu Nullen und Einsen
Computer speichern keine Buchstaben direkt. Sie speichern Bits, also Stellen mit den Werten 0 oder 1. Acht Bits zusammen heißen Byte.
Damit aus einem Unicode Codepunkt eine Folge aus Bytes wird, braucht ein Computer eine Kodierung. Eine Kodierung ist eine Regel zum Umwandeln und Speichern von Zeichen als Bytes.
UTF-8 ist eine weit verbreitete Unicode Kodierung. Sie übersetzt Unicode Zeichen in Bytes.
UTF-8 ist besonders praktisch: Gewöhnliche lateinische Zeichen brauchen wenig Speicherplatz. Andere Zeichen können mehr Bytes benötigen. Trotzdem kann UTF-8 Text aus vielen Sprachen und Emojis speichern.
Das Zeichen A wird in UTF-8 mit einem Byte gespeichert. Das Zeichen ä braucht zwei Bytes. Ein Emoji wie 😀 braucht in UTF-8 vier Bytes.
Alle drei sind Unicode Zeichen. Nur ihre Speicherung als Bytes ist unterschiedlich lang.
Unicode sagt, welches Zeichen gemeint ist. UTF-8 sagt, wie dieses Zeichen als Bytes gespeichert wird.
Interaktive Quizfrage wird geladen ...
Richtig speichern und richtig lesen
Beim Speichern wandelt ein Programm Zeichen mit einer Kodierung in Bytes um. Beim Öffnen muss das andere Programm dieselbe Kodierung verwenden, um die Bytes wieder richtig zu lesen.
Wird eine Datei mit der falschen Kodierung geöffnet, entstehen manchmal seltsame Zeichen. Aus ä kann dann zum Beispiel ä werden. Das Zeichen war nicht unbedingt kaputt: Es wurde nur mit der falschen Regel gelesen.
Ein Programm speichert das Wort grün in UTF-8. Ein anderes Programm erwartet eine ältere Kodierung und deutet die Bytes falsch. Dann kann statt grün ein unleserliches Wort erscheinen.
Wenn beide Programme UTF-8 verwenden, bleibt grün korrekt.
Bei einer Textdatei oder Webseite kann man oft einstellen, welche Kodierung verwendet wird. UTF-8 ist im Internet sehr verbreitet.
Interaktive Quizfrage wird geladen ...
Zeichen und Aussehen unterscheiden
Die sichtbare Form eines Zeichens heißt Glyphe. Eine Glyphe ist die Zeichnung, die eine Schriftart für ein Zeichen zeigt. Deshalb kann derselbe Buchstabe in verschiedenen Schriftarten anders aussehen.
Unicode speichert vor allem die Bedeutung eines Zeichens, nicht sein genaues Aussehen. Ob ein Gerät ein bestimmtes Zeichen schön, bunt oder überhaupt sichtbar zeigt, hängt auch von den installierten Schriftarten ab.
Das Zeichen A kann in einer Schrift kantig und in einer anderen rund wirken. Es bleibt trotzdem derselbe Unicode Codepunkt U+0041.
Ein älteres Gerät kennt möglicherweise ein neues Emoji noch nicht. Dann zeigt es vielleicht ein leeres Kästchen. Die Nachricht kann trotzdem den passenden Codepunkt oder eine passende Folge von Codepunkten enthalten.
Codepunkt bedeutet: Welches Zeichen ist gemeint? Glyphe bedeutet: Wie wird dieses Zeichen gerade dargestellt?
Interaktive Quizfrage wird geladen ...
Zusammenfassung
Unicode ist ein Standard mit festen Nummern für Zeichen aus vielen Sprachen, für Symbole und für Emojis. Diese Nummern heißen Codepunkte und werden oft wie U+00DF geschrieben. Manche sichtbaren Zeichen bestehen aus mehreren Codepunkten.
Computer speichern Zeichen als Bits und Bytes. UTF-8 ist eine Kodierung, die Unicode Zeichen in Bytes umwandelt. Damit Text richtig ankommt, müssen speicherndes und lesendes Programm dieselbe Kodierung verwenden.
Merke dir besonders: Unicode bestimmt die Bedeutung eines Zeichens. Eine Schriftart bestimmt sein Aussehen.
Mit Google fortfahren