Heim  >  Artikel  >  Der Unicode-Zeichensatz verwendet mehrere Bytes zur Darstellung eines Zeichens

Der Unicode-Zeichensatz verwendet mehrere Bytes zur Darstellung eines Zeichens

青灯夜游
青灯夜游Original
2021-05-07 16:43:2614228Durchsuche

Der Unicode-Zeichensatz verwendet 2 Bytes zur Darstellung eines Zeichens. Unicode legt eine einheitliche und eindeutige Binärkodierung für jedes Zeichen in jeder Sprache fest, um die Anforderungen für die sprach- und plattformübergreifende Textkonvertierung und -verarbeitung zu erfüllen. Mit der 2-Byte-Kodierung können alle Texte auf der Welt vereinheitlicht werden.

Der Unicode-Zeichensatz verwendet mehrere Bytes zur Darstellung eines Zeichens

Die Betriebsumgebung dieses Tutorials: Windows 7-System, Dell G3-Computer.

Der Unicode-Zeichensatz verwendet 2 Bytes zur Darstellung eines Zeichens.

Unicode (Unicode, Universal Code, Unicode) ist eine Zeichenkodierung, die auf Computern verwendet wird. Es legt eine einheitliche und eindeutige Binärcodierung für jedes Zeichen in jeder Sprache fest, um die Anforderungen für die sprach- und plattformübergreifende Textkonvertierung und -verarbeitung zu erfüllen.

Wenn verschiedene Textkodierungen als Dialekte verschiedener Orte beschrieben werden, dann ist Unicode eine Sprache, die von Ländern auf der ganzen Welt gemeinsam entwickelt wurde.

In dieser Sprachumgebung gibt es keine Sprachkodierungskonflikte mehr. Inhalte können in jeder Sprache auf demselben Bildschirm angezeigt werden. Das bedeutet, dass der gesamte Text der Welt einheitlich mit 2 Bytes kodiert ist. Auf diese Weise reichen bei einer einheitlichen Codierung wie dieser 2 Bytes aus, um den größten Teil des Textes in allen Sprachen der Welt unterzubringen.

Der wissenschaftliche Name von Unicode ist „Universal Multiple-Octet Coded Character Set“, auch UCS genannt.

Die frühen Unicode-Standards hießen UCS-2 und UCS-4. UCS-2 ist mit zwei Bytes kodiert und UCS-4 ist mit 4 Bytes kodiert. Derzeit wird UCS-2 verwendet, eine 2-Byte-Kodierung, und UCS-4 wurde entwickelt, um zu verhindern, dass 2 Bytes in Zukunft nicht mehr ausreichen.

UCS-4 ist basierend auf dem höchsten Byte in 2^7=128 Gruppen unterteilt, wobei das höchste Bit 0 ist. Jede Gruppe ist entsprechend dem nächsthöheren Byte in 256 Ebenen unterteilt. Jede Ebene ist entsprechend dem dritten Byte in 256 Zeilen unterteilt, und jede Zeile verfügt über 256 Codepunkte (Zellen). Ebene 0 der Gruppe 0 heißt BMP (Basic Multilingual Plane). UCS-2 wird durch Entfernen der ersten beiden Nullbytes des BMP von UCS-4 erhalten.

Weitere Informationen zu diesem Thema finden Sie in der Spalte „FAQ“!

Das obige ist der detaillierte Inhalt vonDer Unicode-Zeichensatz verwendet mehrere Bytes zur Darstellung eines Zeichens. Für weitere Informationen folgen Sie bitte anderen verwandten Artikeln auf der PHP chinesischen Website!

Stellungnahme:
Der Inhalt dieses Artikels wird freiwillig von Internetnutzern beigesteuert und das Urheberrecht liegt beim ursprünglichen Autor. Diese Website übernimmt keine entsprechende rechtliche Verantwortung. Wenn Sie Inhalte finden, bei denen der Verdacht eines Plagiats oder einer Rechtsverletzung besteht, wenden Sie sich bitte an admin@php.cn