Simsun

Simsun
Unicode-Logo Unicode
Kodierungen
Techniken

Der chinesische Zeichenkodierungsstandard GB18030 beschreibt 27.484 Zeichen der chinesischen Schrift. Seit dem 1. September 2001 ist er verbindlich für alle in der Volksrepublik verkauften Betriebssysteme und Programme; es ist der Nachfolgestandard für die Kodierungen GBK und GB2312 und deckt traditionelle und vereinfachte Zeichen ab. Der offizielle Name ist GB18030-2000 und enthält GB für Guojia Biaozhun (國家標準 / 国家标准), was nationaler Standard bedeutet. Veröffentlicht wurde der Standard am 17. März 2000, ein Update erschien am 21. November 2000.

GB18030 kann als das chinesische Äquivalent zu UTF-8 angesehen werden, weil es die Codepunkte für den gesamten Unicodebereich enthält, auch für heute noch nicht zugewiesene Codepoints. Ähnlich wie UTF-8 ist es eine zu ASCII abwärtskompatible Kodierung, die über eine Million Codepunkte zusätzlich repräsentiert (im 4-Byte-Bereich von Unicode). Im Unterschied zu UTF-8 jedoch erhält GB18030 die Kompatibilität mit GBK und GB2312; ein Teil der Zuordnungstabelle wurde direkt von GBK übernommen, der Rest algorithmisch ermittelt. Zusätzlich schließt GB18030 auch die Zeichen aus dem taiwanischen Big5 ein.

Die meisten (westlichen) Computersysteme hatten bereits eine Variante von Unicode standardisiert, als GB18030 erschien. Die dabei vorgenommene technische Vereinfachung, Unicode als fixe Einheiten mit 16-bit Länge UCS-2 zu behandeln, konnte nach seinem Erscheinen nicht mehr fortgeführt werden. Betriebssystemhersteller und Programmierer wurden sozusagen durch eine „volksrepublikanische Verfügung“ gezwungen, entweder variable Formate wie UTF-8 oder UTF-16 zu verwenden, oder aber größere Formate fixer Breite, wie UCS-4 oder UTF-32. Mit Windows 2000 nahm Microsoft diesen Schritt vor, Linux unterstützt dies ebenfalls seit einigen Jahren.

Der Zeichensatz SimSun (Founder Extended) ermöglicht die Anzeige aller Glyphen aus GB18030, also des gesamten Zeichenvorrates aus Unicode 2.1 und die zusätzlichen aus den „Unicode CJK Unified Ideographs Extensions A und B“. Weitere bekannte Zeichensätze mit zumindest teilweiser Unterstützung (CJK Extension A) sind SimSun 18030 oder Code2000.

Aufbau der Zeichen

Sequenzen aus einem Byte entsprechen ASCII und reichen von 00hex bis 7Fhex. Sequenzen aus 2 Byte entsprechen GB2312 und bestehen aus einem Start-Byte aus dem Bereich 81hex … FEhex, gefolgt von einem Byte aus dem Bereich 40hex … FEhex. Sequenzen aus 4 Byte bilden die bis hierhin unberücksichtigten Unicode-Zeichen ab. Das erste und dritte Byte ist aus dem Bereich 81hex … FEhex, das zweite und vierte Byte aus 30hex … 39hex. Im Gegensatz zu UTF-8 kann man also bei einem Oktett im Bereich 30hex … 7Fhex nicht davon ausgehen, dass es für ein ASCII-Zeichen ist, sondern dieser Bytewert kann in Abhängigkeit von seiner Position verschiedene Bedeutung haben.

Weblinks


Wikimedia Foundation.

Игры ⚽ Поможем сделать НИР

Schlagen Sie auch in anderen Wörterbüchern nach:

  • List of CJK fonts — Contents 1 Ming 1.1 Pan Unicode 1.2 Chinese 1.3 Japanese …   Wikipedia

  • GB 18030 — GB18030 is the registered Internet name for the official character set of the People s Republic of China (PRC) superseding GB2312. This character set is formally called Chinese National Standard GB 18030 2005: Information technology Chinese coded …   Wikipedia

  • Ming (typeface) — Infobox font name = Ming familyname = Ming style = Serif classifications = creator = commissioned by = foundry = foundries = creationdate = Song Dynasty releasedate = trademark = based on = aka = Song variations = imitated Song sample = shown… …   Wikipedia

  • List of Microsoft Windows fonts — This list of fonts contains every font ever shipped with Windows.[1][2] Fonts shipped with Microsoft Office or other Microsoft applications are not included. Family Name Faces Available Target script and other notes Windows version Example image… …   Wikipedia

  • Microsoft litigation — Microsoft has been involved in numerous high profile litigations over the history of the company, including cases against the United States, the European Union, and competitors. Contents 1 Governmental 1.1 Anti trust 1.1.1 European Union …   Wikipedia

  • 18030 — Unicode Kodierungen UTF 7 UTF 8 CESU 8 UTF 16 UTF 32 UTF EBCDIC SCSU Punycode GB 18030 Techniken BOM …   Deutsch Wikipedia

  • GB18030 — Unicode Kodierungen UTF 7 UTF 8 CESU 8 UTF 16 UTF 32 UTF EBCDIC SCSU Punycode GB 18030 Techniken BOM …   Deutsch Wikipedia

  • GB 18030 — Der chinesische Zeichenkodierungsstandard GB18030 beschreibt 27.484 Zeichen der chinesischen Schrift. Seit dem 1. September 2001 ist er verbindlich für alle in der Volksrepublik verkauften Betriebssysteme und Programme; es ist der… …   Deutsch Wikipedia

  • List of typefaces — This is a list of typefaces, which are separated into groups by distinct artistic differences. Contents 1 Serif 1.1 Slab serif 2 Sans serif 3 Semi serif …   Wikipedia

  • HKSCS — The Hong Kong Supplementary Character Set (zh t|香港增補字符集; commonly abbreviated to HKSCS) is a set of Chinese characters 4,702 in total in the initial release used exclusively in Cantonese. It evolved from the preceding Government Chinese Character …   Wikipedia

Share the article and excerpts

Direct link
Do a right-click on the link above
and select “Copy Link”