Введение
Сборник японских стандартов кодирования цифровых символов. В вычислительной технике кодировка JIS относится к ряду японских промышленных стандартов для кодирования японского языка. В строгом смысле термин означает: набор стандартных кодированных наборов символов для японского языка, в частности: JIS X 0201 – японская версия ISO 646 (ASCII), содержащая базовые 7-битные символы ASCII (с некоторыми модификациями) и 64 символа катаканы половинной ширины; JIS X 0208 – наиболее распространенный набор символов кандзи, содержащий 6879 символов, включая 6355 кандзи и 524 других символа (одна плоскость 94x94); JIS X 0212 – дополнение к JIS X 0208, добавляющее 5801 кандзи, в общей сложности 12156 кандзи (вторая плоскость 94x94); JIS X 0213, расширяющий JIS X 0208 (две плоскости); JIS X 0202 (также известный как ISO 2022 JP) – набор механизмов кодирования для передачи данных символов JIS через каналы передачи, поддерживающие только 7-битные данные. На практике под "кодировкой JIS" обычно подразумевают данные символов JIS X 0208, закодированные с использованием JIS X 0202. Например, IANA использует обозначение JIS Encoding для ссылки на JIS X 0202, а ISO 2022 JP – для обозначения профиля, определяемого [этим стандартом]. Другие механизмы кодирования символов JIS включают Shift JIS и EUC JP. Shift JIS добавляет кандзи, хирагану и катакану полной ширины из JIS X 0208 к JIS X 0201, обеспечивая обратную совместимость. Shift JIS, вероятно, является наиболее широко используемой кодировкой в Японии, поскольку совместимость с однобайтовым набором символов JIS X 0201 позволила производителям электронного оборудования (например, кассовых аппаратов) предложить обновление со старого, более дешевого оборудования, не способного отображать кандзи, на новое, сохраняя при этом совместимость наборов символов. EUC JP используется в системах UNIX, где кодировки JIS несовместимы со стандартами POSIX. Более современной альтернативой кодированным символам JIS является Unicode (кодированные символы UCS), особенно механизм кодирования UTF-8.
In computing, JIS encoding refers to several Japanese Industrial Standards for encoding the Japanese language. Strictly speaking, the term means either:
A set of standard coded character sets for Japanese, notably:
JIS X 0201, the Japanese version of ISO 646 (ASCII) containing the base 7 bit ASCII characters (with some modifications) and 64 half width katakana characters. JIS X 0208, the most common kanji character set containing 6,879 characters, including 6,355 kanji and 524 other characters (one 94 by 94 plane)
JIS X 0212, a supplement for JIS X 0208 which adds 5,801 kanji, totaling 12,156 kanji (a second 94 by 94 plane)
JIS X 0213, which extends JIS X 0208 (two planes)
JIS X 0202 (also known as ISO 2022 JP), a set of encoding mechanisms for sending JIS character data over transmission media that only support 7 bit data. In practice, "JIS encoding" usually refers to JIS X 0208 character data encoded with JIS X 0202. For instance, the IANA uses the JIS Encoding label to refer to JIS X 0202, and the ISO 2022 JP label to refer to the profile thereof defined by
Other encoding mechanisms for JIS characters include the Shift JIS encoding and EUC JP. Shift JIS adds the kanji, full width hiragana and full width katakana from JIS X 0208 to JIS X 0201 in a backward compatible way. Shift JIS is perhaps the most widely used encoding in Japan, as the compatibility with the single byte JIS X 0201 character set made it possible for electronic equipment manufacturers (such as cash register manufacturers) to offer an upgrade from older cheaper equipment that was not capable of displaying kanji to newer equipment while retaining character set compatibility. EUC JP is used on UNIX systems, where the JIS encodings are incompatible with POSIX standards. A more recent alternative to JIS coded characters is Unicode (UCS coded characters), particularly in the UTF 8 encoding mechanism.
Сравнение кодирования
В следующей таблице сравниваются характеристики трех основных схем кодирования для JIS X 0208.