Введение
Стандартные кодировки символов на основе ASCII для арабского языка. ISO/IEC 8859-6:1999, Информационные технологии — 8-битные однобайтовые кодированные графические наборы символов — Часть 6: Латинский/арабский алфавит, является частью серии стандартов кодировки символов ISO/IEC 8859 на основе ASCII, первое издание которого было опубликовано в 1987 году. Он неофициально известен как Latin/Arabic. Он был разработан для поддержки арабского языка. Кодируются только базовые буквы, без предварительно сформированных вариантов, поэтому для отображения требуется обработка формирования символов. Он не включает дополнительные буквы, необходимые для записи большинства языков, использующих арабский шрифт, кроме самого арабского (например, персидского, урду и других). ISO 8859-6 является предпочтительным именем кодировки IANA для этого стандарта при использовании совместно с управляющими кодами C0 и C1 из ISO/IEC 6429. Текст представлен в логическом порядке, поэтому для отображения требуется обработка BiDi. Формально ISO 8859-6 (страница кода 28596) предназначена для "визуального порядка", а ISO 8859-6 I (страница кода 38596) — для логического порядка. Однако на практике, и в соответствии с требованиями HTML и XML, ISO 8859-6 также обозначает текст в логическом порядке. Существует также ISO 8859-6 E, который, предположительно, требует явного указания направления текста с помощью специальных управляющих символов; однако этот вариант на практике не используется. IBM присвоила кодовую страницу/CCSID 1089 стандарту ISO 8859-6. Это эмуляция для их операционной системы AIX. В настоящее время ISO 8859-6 технологически устарел, и Unicode предпочтительнее в современных приложениях, особенно в Интернете, а именно доминирующая кодировка UTF-8 для веб-страниц (см. также статью "Арабский шрифт в Unicode" для полного охвата, в отличие от, например, ISO 8859-6 или Windows 1256, которые не включают дополнительные символы). Менее 0,0002% всех веб-страниц используют ISO 8859-6, и он даже не входит в тройку самых популярных кодировок для арабского языка в Интернете.
ISO/IEC 8859 6:1999, Information technology — 8 bit single byte coded graphic character sets — Part 6: Latin/Arabic alphabet, is part of the ISO/IEC 8859 series of ASCII based standard character encodings, first edition published in 1987. It is informally referred to as Latin/Arabic. It was designed to cover Arabic. Only nominal letters are encoded, no preshaped forms of the letters, so shaping processing is required for display. It does not include the extra letters needed to write most Arabic script languages other than Arabic itself (such as Persian, Urdu, etc.). ISO 8859 6 is the IANA preferred charset name for this standard when supplemented with the C0 and C1 control codes from ISO/IEC 6429. The text is in logical order, so BiDi processing is required for display. Nominally ISO 8859 6 (code page 28596) is for "visual order", and ISO 8859 6 I (code page 38596) is for logical order. But in practice, and required for HTML and XML documents, ISO 8859 6 also stands for logical order text. There is also ISO 8859 6 E which supposedly requires directionality to be explicitly specified with special control characters; this latter variant is in practice unused. IBM has assigned code page/CCSID 1089 to ISO 8859 6. It is an emulation for their AIX operating system. ISO 8859 6 is now technologically obsolete, and Unicode is preferred in modern applications, especially on the Internet; meaning the dominant UTF 8 encoding for web pages (see also Arabic script in Unicode, for complete coverage, unlike for e. g. ISO 8859 6 or Windows 1256 that do not cover extras). Less than 0.0002% of all web pages use ISO 8859 6, and it is not even the third most popular encoding option for Arabic on the web.
История
ASMO 708 был разработан ныне несуществующей Арабской организацией по стандартизации и метрологии в 1986 году как 8-битный стандарт для использования в арабскоязычных странах. Дизайн этого набора символов был вдохновлен предыдущим 7-битным стандартом ASMO 449, но он не является просто переносом 7-битного набора символов в верхнюю часть; существуют некоторые различия. ASMO 708 – это двунаправленный набор символов. Нижняя часть набора отличается от стандарта ISO 646 в плане отображения цифр и некоторых знаков препинания. В зависимости от контекста (используются ли цифры в латинском или арабском тексте), цифры отображаются либо как латинские, либо как арабские. Кроме того, в зависимости от контекста, симметричные знаки препинания отображаются зеркально, то есть форма знака препинания меняется в зависимости от направления письма. Верхняя часть набора символов содержит только арабские буквы, арабские знаки препинания, отличные от латинских, и несколько других символов. ASMO 708 был разработан в тесном сотрудничестве с ECMA, которая приняла его в качестве собственного стандарта ECMA 114 в 1986 году. Он также был утвержден как стандарт ISO под номером ISO 8859-6. В 1986 году он был зарегистрирован в Международном реестре кодированных наборов символов как IR 127.
Кодовая диаграмма
Коды от 0xEB до 0xF2 присваиваются объединяющим символам.