Кодирование символов
-
Двунаправленный текст: поддержка и особенности отображения
Двунаправленный текст: LTR и RTL. Особенности отображения и поддержки разных алфавитов (иврит, арабский, персидский) в компьютерных программах.
-
Кодировка символов и международные символы в HTML
Кодировка символов в HTML: UTF-8, HTML 4.0 и HTML5. Обеспечьте корректное отображение международных символов и языков в браузере для целостности данных.
-
EBCDIC: Восьмибитная кодировка IBM и её особенности
EBCDIC: 8-битная кодировка IBM, альтернатива ASCII. Особенности символов, перевод строк (NEL), совместимость и хранение данных в старшем бите.
-
Стандарты кодировки символов ISO/IEC 8859
ISO/IEC 8859: 8-битные кодировки символов. Стандарты ISO и IEC, включающие 15 частей (кроме 8859-12). История, Ecma International, отмена поддержки.
-
Unicode и HTML: Взаимосвязь кодировок и представление текста.
Unicode и HTML: связь, кодировки символов (ISO 8859-1, Windows-1252, ISO 10646). Как HTML отображает многоязычный текст с использованием Unicode.
-
UTF-8: Переменная ширина кодировки Unicode, совместимая с ASCII
UTF-8: кодировка Unicode переменной длины (1-4 байта). Совместимость с ASCII, поддержка всех символов Unicode. Оптимальна для веб и обмена данными.
-
Жирный шрифт доски: стили, кодировка и применение в математике.
Жирный шрифт для доски (Blackboard Bold): математические обозначения, наборы чисел (ℝ, ℤ, ℕ). Unicode, TeX, AMSFonts. Типографика и двойное написание.
-
UTF-16: Переменная ширина кодирования Unicode
UTF-16: кодировка Unicode переменной ширины (1 или 2 блока по 16 бит). Поддержка всех символов, включая emoji и CJK. Используется в Windows, Java, JavaScript.
-
Графические символы в кодировках: от ASCII к Unicode
Графические символы в кодировках ASCII, ISO 8859 и Unicode: определение, отображение, различия между печатными и управляющими символами, пробел и DEL.
-
Кодировка ISO/IEC 8859-15: Латинский алфавит №9
ISO 8859-15: кодировка символов для западноевропейских языков, включая евро (€). Подробное описание, применение и отличия от ISO 8859-1.
-
Кодировка Big5 для традиционных китайских иероглифов
Кодировка Big5 для традиционных китайских символов: применение в Тайване, Гонконге и Макао. Особенности, дубликаты символов и отображение чисел.
-
Хранение Unicode в формате UTF-32: особенности и недостатки
UTF-32: кодировка Unicode с фиксированной длиной в 4 байта. Эффективна для обработки символов вне BMP, но неэффективна по объему хранения. Сравнение с UTF-8/UTF-16.
-
Искажение текста из-за неправильной кодировки символов
Моджибаке: что это такое? Искажение текста из-за неверной кодировки символов. Объясняем причины появления "кракозябр" и как избежать проблем с UTF-8, UTF-16.
-
Унификация иероглифов CJK в Unicode: от графем к семемам.
Унификация CJK в Unicode: объединение китайских, японских, корейских и вьетнамских иероглифов (hanzi, kanji, hanja). Различия и стандарты кодировки.
-
Консорциум Unicode: Стандартизация текста и эмодзи для всех языков мира.
Unicode Consortium: разработка и поддержка единого стандарта кодировки символов для всех языков. Включает эмодзи, XML, Java и другие технологии.
-
Знак йены и юаня (¥): история и кодировка
Знак йены и юаня (¥): история, использование в латинском алфавите и отличия от иероглифов. Символ японской йены и китайского юаня.
-
Кодировка китайских, японских и корейских символов в компьютерах.
Кодировка китайских символов: Unicode, GB, Big5 для языков CJK (китайский, японский, корейский). Особенности и применение локальных систем кодировки.
-
Тайская кодировка символов: ISO/IEC 8859-11 и TIS 620
Кодировка тайского языка ISO/IEC 8859-11:2001 (Latin/Thai) – стандарт на основе ASCII, почти идентичный TIS 620. Подробности и отличия в статье.
-
ISO/IEC 8859-8: Кодировка для латиницы и иврита
ISO/IEC 8859-8: кодировка символов для иврита и латиницы. Стандарт ISO/IEC 8859, версия 1999 года, включает все буквы иврита (без гласных). Кодовая страница IBM 916.
-
Типографские символы и орнаменты
Ди́нгбаты в типографии: орнаменты, символы для оформления, разделители текста. История от линотипа до Unicode шрифтов. 🖋️📚💻
-
Локализация в компьютерных системах: параметры и идентификаторы.
Локаль в IT: язык, регион и настройки интерфейса. Важные параметры для интернационализации (i18n) в C/C++. Форматы текста, чисел, валюты и времени.
-
Кодировка доменных имен в Unicode: Punycode
Кодировка Unicode доменных имен: Punycode преобразует Unicode в ASCII для совместимости с DNS. Узнайте, как работает IDNA и LDH-субсет.
-
Диграфы и триграфы в программировании
Диграфы и триграфы в программировании: последовательности символов, заменяемые одним. Устаревают в C/C++ из-за Unicode/UTF-8. История и причины использования.
-
Транслитерация индийских языков и поддержка Unicode шрифтов
Национальная библиотека Калькутты: система романизации индийских языков, схожая с ISO 15919 и IAST. Транслитерация, Unicode, выбор символов.
-
Кодировки символов для арабского языка: ISO 8859-6 и ASMO 708
Кодировка ISO/IEC 8859-6: поддержка арабского алфавита. 8-битная кодировка символов, требует обработки для отображения текста на арабском языке.
-
ISO/IEC 8859-9: Стандарт кодировки для турецкого языка
ISO/IEC 8859-9: кодировка для турецкого языка (Latin 5). Стандарт символов для ИТ, Ecma 128, TS 5881. Подробности о Latin 5 и ее применении.
-
Кодировка ISO/IEC 8859-14: Символьный набор для кельтских языков
ISO/IEC 8859-14 (Latin 8, Celtic): 8-битная кодировка для кельтских языков (ирландский, валлийский и др.). Стандарт ISO/IEC, разработанный в 1998 году.
-
Двухбайтовые кодировки символов: история и современные подходы.
Двухбайтовые кодировки (DBCS): поддержка языков с большим количеством символов (японский, китайский, корейский). Расширенный набор символов до 65,536.
-
Японские стандарты кодировки символов JIS
Японские кодировки JIS: стандарты X 0201, 0208, 0212, 0213 для кодирования японского языка. ASCII, катакана, кандзи, Shift JIS, EUC JP.
-
Невидимый символ разделения глифов (ZWNJ)
Невидимый символ ZWNJ в Unicode: разделяет буквы в лигатурах, сохраняя сближение. Важен для корректного отображения текста в некоторых языках.
-
Кодировка символов ISO/IEC 2022: Структура и методы расширения
ISO/IEC 2022: кодировка символов 7 и 8 бит. Стандарт для представления текста, escape-последовательности, поддержка языков (JIS, ISO 8859).
-
Комбинируемые символы в типографии Unicode
Комбинирующие символы в типографии: диакритические знаки Unicode, нормализация текста, кодировка. Важно для корректного отображения и сравнения строк.
-
Предсоставленные и разложенные символы Unicode
Символы Unicode: предварительно составленные и разлагаемые. Узнайте о представлении букв с диакритическими знаками (é) и лигатур в кодировке.
-
VISCII: Неофициальная кодировка для вьетнамского алфавита
VISCII: неофициальная кодировка для вьетнамского алфавита. Замена управляющих символов, 128 новых символов. Устарела, требуется конвертация в Unicode/Windows-1258.
-
Arial Unicode MS: История и особенности шрифта
Arial Unicode MS: шрифт TrueType, расширенная версия Arial, поддержка Unicode 2.1. Большой размер (22МБ), отсутствие курсива. Устарел в Office 2016.
-
Шахматные символы в Unicode
Шахматные символы Unicode: используйте текстовые обозначения фигур (♘, ♞) вместо картинок! Фигурный алгебраический формат, независимый от языка.
-
Кодировка Shift JIS: особенности и применение
Shift JIS: кодировка для японского языка, расширение JIS X 0201. Используется на 5.2% японских сайтов (.jp). Отличия от ASCII, katakana.
-
Системы кодирования символов восточноазиатских языков (Sistemy kodirovaniya simvolov vostochnoaziatskikh yazykov)
EUC кодировки: японский, корейский, китайский. Описание системы кодирования символов, отличия EUC CN, KR, JP, TW. Актуальность UTF-8.
-
Упрощенный китайский набор символов GB/T 2312
GB/T 2312: упрощенные китайские иероглифы, кодировка EUC CN. История стандарта, изменения в 2017 году и текущий статус GB/T 2312 1980.
-
Майкл Эверсон: Американский ирландский специалист по компьютерной кодировке письменности.
Майкл Эверсон: американский ирландский дизайнер шрифтов, лингвист и эксперт по компьютерной кодировке письменности. Разработчик Unicode, автор сотен предложений.
-
Кодировка Windows-1251 для кириллицы
Windows 1251: кодировка для кириллицы (русский, украинский и др.). Распространение в сети, преимущества и недостатки, переход на UTF-8.
-
Схема сжатия Unicode (SCSU): Технический стандарт
Схема сжатия Unicode (SCSU) – стандарт для эффективного хранения текста, особенно с небольшим набором символов. Оптимизация размера, совместимость с ASCII.
-
Расширенная кодировка символов для кантонского диалекта
Расширенная кодировка для кантонского диалекта: HKSCS – набор из 4702 символов для кантонского языка и названий мест Гонконга. Эволюция GCCS.
-
КОИ: Семейство кодовых страниц для кириллицы
КОИ: кодировка для кириллицы, обеспечивающая читаемость при потере старшего бита. Основана на ASCII и фонетическом соответствии латинице. История и особенности.
-
Кодировка TSCII для тамильского письма: История и стандартизация
Кодировка TSCII для тамильского письма: история, регистрация IANA (2007), отличие от Unicode и ISCII. Визуальный порядок кодирования символов.
-
iconv: Утилита преобразования кодировок символов в UNIX
iconv: конвертация кодировок символов в Unix/Linux. Преобразование из любой кодировки через Unicode. Стандарт SUS, GNU libiconv, LGPL лицензия.
-
Числовые ссылки на символы в SGML, HTML и XML
Числовые символьные ссылки (NCR) в SGML, XML и HTML: представление символов Unicode, недоступных в кодировке документа. Узнайте больше!
-
Армянский стандарт кодировки символов ArmSCII
ArmSCII: устаревшие 7-битные кодировки армянского алфавита. Стандарт ARMSCII, предшественник Unicode, не получил широкого распространения. Информация о кодах и символах.
-
Математические Алфавитно-Числовые Символы Unicode
Математические символы Unicode: стилизованные буквы и цифры для единообразия в формулах. U+1D400–U+1D7FF – обозначения, используемые в математике.
-
Блоки и диапазоны символов Unicode
Блоки Unicode: диапазоны символов, определяемые консорциумом Unicode для языков, математики и других областей. Уникальные имена блоков для удобства.
-
Широкие символы и кодировка текста: от ASCII к Unicode
Широкие символы в компьютерных данных: от ASCII к CJK идеограммам. Увеличенный размер типов данных для поддержки больших наборов символов и целостности данных.
-
Искусство из символов Shift JIS: Японская ASCII-графика (AA)
Искусство Shift JIS: создание изображений из символов японской кодировки. Популярно в Японии, особенно на 2channel. Зависимость от шрифта MS PGothic.
-
Компьютерный ввод и кодировка корейского языка.
Корейский язык на компьютере: кодировка, ввод и отображение слогов (хангыль, джамо). Unicode, ISO 2022 KR, шрифты и особенности корейской письменности.
-
Тайская кодировка символов TIS 620 и её стандарты
TIS 620: стандарт кодировки тайского языка для компьютеров в Таиланде. Информация о версии 2533 (1990) и устаревшей TIS 620 2529 (1986).
-
Символы для рисования рамок и блоков в Unicode
Символы для рисования рамок Unicode: использование в текстовых интерфейсах и коде. Создание геометрических фигур и коробок с помощью текста.
-
Международные компоненты для Юникода (ICU): Обзор и обновления
ICU: библиотека Unicode для C/C++ и Java. Обеспечивает интернационализацию и глобализацию ПО, кроссплатформенность и единообразие результатов. Поддержка Windows 10+.
-
Переменная ширина кодирования символов
Переменная ширина кодировки: схемы кодирования текста в компьютерах, использование разной длины кодов для символов. Мультибайтовые кодировки, история и применение.
-
Кодировка UTF EBCDIC для Unicode, совместимая с EBCDIC
UTF-EBCDIC: кодировка Unicode для EBCDIC-систем. Поддержка всех символов Unicode (до 5 байт). Совместимость с устаревшими приложениями на мейнфреймах.
-
Юникод-шрифты: Обзор и Свободные Альтернативы.
Шрифты Unicode: открытый исходный код, поддержка разных языков и символов. Обзор проектов, оптимизация размера файлов и форматы OpenType.
-
Кодовая страница 866: История и варианты русской кодировки
Кодовая страница 866 (CP866): русская кодировка для DOS, сохраняющая символы и порядок букв. Поддержка HTML5, стандарты ГОСТ. История и особенности.
-
Кодовая страница Windows 1250 для центральноевропейских языков
Windows 1250: кодировка для чешского, польского, словацкого и других языков Центральной Европы. Устарела, заменена на Unicode (UTF-8).
-
Кодовая страница Windows 1253 для греческого алфавита
Кодировка Windows 1253 для греческого алфавита: особенности, отличия от ISO 8859-7, поддержка современного греческого языка и несовместимость с политоникой.
-
Кодовая страница Windows 1255 для иврита
Кодировка Windows 1255 для иврита: таблица символов, особенности, сравнение с ISO 8859-8 и Unicode (UTF-8). Устаревает, уступает Unicode.
-
Кодовая страница Windows 1256 для арабского письма
Кодировка Windows 1256 для арабского языка: поддержка арабской письменности (персидский, урду). Отличия от ISO 8859-6 и MacArabic, особенности кодирования символов.
-
Кодовая страница Windows 1257 для балтийских языков
Windows 1257: кодировка для литовского, латышского и эстонского языков. Стандарт LST 1590, отличия от ISO 8859-13 и несовместимость с ISO 8859-4/10.
-
Интернационализация URI: от ASCII к Unicode и расширенному набору символов
IRI протокол: расширенный набор символов в URI для поддержки Unicode, включая кириллицу, китайский, японский и корейский. RFC 3987.
-
Кодовая страница CCCII: Стандарт кодировки китайских символов
CCCII: кодировка символов для обмена информацией на Тайване. Стандарт 94n, разработанный в 1980-х. Подробности о структуре и реализации ISO/IEC 2022.
-
Национальный стандарт кодировки символов CNS 11643 (Тайвань)
CNS 11643: Стандартный набор символов для тайваньского китайского языка. Охватывает до 141376 символов, соответствует ISO 2022. Big5 – де-факто стандарт.
-
Проблемы кодировки букв İ и ı в Unicode и локализациях.
Буквы İi и Iı в тюркских языках: проблемы Unicode, различия в написании, предложения по унификации и риски для существующих данных.
-
BOCU 1: MIME-совместимая схема сжатия Unicode
BOCU 1: Unicode сжатие для коротких строк. Совместимость с MIME, сочетает UTF-8 и SCSU. Эффективно сохраняет порядок кодовых точек. Unicode Technical Note.
-
Омоглифы: визуально похожие символы и знаки.
Омоглифы: похожие символы в типографике и орфографии. Различия в значениях при одинаковом внешнем виде (1/l, 0/O). Unicode и технический отчет.
-
Webdings: История и особенности декоративного шрифта
Webdings: шрифт декоративных символов и глифов. Включен в Windows 98 и Unicode 7.0. Иконки погоды, транспорта, зданий и IT. Скачать и использовать.
-
文字鏡: Японская система кодирования символов
Модзикё (文字鏡) – схема кодировки символов, разработанная Институтом Модзикё. CD-ROM и веб-подписка, шрифты TrueType. История, релизы с 1997 года.
-
Визуально похожие символы в доменных именах
Атаки с использованием похожих доменов (IDN homograph attack): обман пользователей через визуально идентичные символы разных алфавитов. Защита от подмены сайтов.
-
Формат файлов шрифтов BDF: поддержка многонаправленного письма и Unicode.
Формат шрифтов BDF: описание, применение в Unix, особенности хранения растровых шрифтов. Устаревший формат, замененный PCF, OpenType и TrueType.
-
Кодировка TRON: Особенности и структура
TRON Code: многобайтовая кодировка символов, альтернатива Unicode для CJK языков. Раздельное кодирование иероглифов, поддержка 150 млн символов.
-
Символ неопределённой валюты: описание и история использования
Символ валюты ¤: описание, происхождение и применение. Альтернатива знаку доллара ($), предложенная Италией. Узнайте больше о "скарабее"!
-
Инициатива Medieval Unicode Font Initiative: Кодирование средневековых текстов.
MUFI: кодировка средневековых текстов Unicode. Проект координирует отображение специальных символов, лигатур и аббревиатур латинских и рунических рукописей.
-
Unicode и электронная почта: технические аспекты кодирования
Unicode и электронная почта: поддержка, кодировка, SMTPUTF8, MIME. Отправка писем с не-ASCII символами, избежание "моджибаке". Технические требования.
-
Кодовая точка: определение и применение.
Кодовая точка: уникальная позиция в кодировке символов, определяющая его значение. Используется в стандартах обработки информации и телекоммуникаций.
-
Кодировка GBK для упрощенных китайских иероглифов
GBK: кодировка упрощенных китайских символов (Китай). Расширение GB 2312, включает символы Unicode 1.1. Подробно о GBK 1.0 и кодовой странице 936.
-
Устаревшие 8-битные кодировки символов для западноевропейских языков
Устаревшие 8-битные кодировки для европейских языков (ISO 8859). История, поддержка латиницы, проблемы совместимости и замена Unicode.
-
Приватные области кодовых точек Unicode
Unicode PUA: частные области кодировки для пользовательских символов. Нестандартизированные кодовые точки, зарезервированные для личного использования и расширения.
-
Список глифов Adobe и Unicode
Список глифов Adobe (AGL): сопоставление 4281 имени глифов с Unicode. Руководство для разработчиков шрифтов и ПО, стандарты именования глифов от Adobe.
-
Cyrillic script in Unicode
-
Управляющие символы Unicode C0 и C1
Управляющие символы Unicode (C0, C1): коды ASCII, форматирование текста, позиция курсора, новые строки. Стандарты ISO 646, ECMA 48, ISO/IEC 2022.
-
Переносимый Набор Символов и Кодировка Unicode
Переносимый набор символов (Portable Character Set): стандарт POSIX, 103 символа, включая ASCII. Описание, кодировка, соответствие Unicode и ANSI C.
-
Дубликаты и омоглифы в Unicode 2.0
Unicode 2.0: дубликаты символов, совместимость со старыми системами, каноническая эквивалентность и омоглифы. Различия в кодировке и отображении символов.
-
Сравнение кодировок Unicode: UTF-8, UTF-16 и UTF-32
Сравнение кодировок Unicode: UTF-8, UTF-7, UTF-16. Особенности использования в разных средах, совместимость с ASCII и сжатие данных. SEO-оптимизация Unicode.
-
Z-variant
-
Кодовые страницы Windows 80-х и 90-х годов.
Кодовые страницы Windows: наборы символов 80-х и 90-х. OEM и ANSI кодировки, поддержка Unicode, использование Alt-кодов. История и применение.
-
Дефис-минус: наиболее распространенный символ тире.
Дефис-минус: самый распространенный знак препинания в цифровых текстах. Используется как дефис, минус и тире. История и применение символа.
-
Кодировка символов ISO/IEC 6937: Расширение ASCII для европейских языков
T.51 / ISO/IEC 6937: кодировка символов для передачи текста. Расширение ASCII для латинского алфавита с диакритическими знаками. Стандарт с 1983 года.
-
Идентификаторы кодированных наборов символов (CCSID)
Идентификатор кодировки символов (CCSID): что это такое? Объяснение кодовых страниц, глифов и их связи с Unicode (UTF-8, UTF-16, UTF-32). IBM терминология.
-
Кодировка HZ для передачи китайского текста по 7-битным каналам ASCII
Кодировка HZ: передача китайского текста (GB 2312) по 7-битным ASCII каналам. RFC 1843, USENET, электронная почта, Hanzi. История и применение.
-
Кодовая страница Windows 936 для упрощенного китайского языка
Кодировка Windows 936 (MS936) для упрощенного китайского. Подробно о кодировке символов, GBK, CP1386, Windows 95 и поддержке евро (€).
-
Кодовая страница 950 для традиционного китайского языка в Windows
Кодовая страница 950 Windows для традиционного китайского. Реализация кодировки Big5 с расширением ETEN. Отличия, символы, совместимость и применение.
-
Кодовая страница Windows 949 для корейского языка
Кодировка Windows 949 для корейского языка: расширение Wansung, поддержка всех слогов хангыль. Особенности, отличия от EUC KR и Unicode. SEO-оптимизация.
-
Резервный шрифт Unicode и шрифт "Последний шанс" (Last Resort)
Резервные шрифты: что это такое? Обеспечивают отображение всех символов Unicode, заменяя отсутствующие глифы. Избегайте "пустых" символов!
-
Японская однобайтовая кодировка символов JIS X 0201
Японская кодировка JIS X 0201: история, 7- и 8-битные наборы символов, катакна. Основа для ранних японских компьютеров, предшественник Unicode (UTF-8).