Введение

Использование систем кодирования для международных символов в HTML
список ссылок на сущности символов

Хотя язык гипертекстовой разметки (HTML) используется с 1991 года, HTML 4.0, выпущенный в декабре 1997 года, стал первой стандартизированной версией, в которой международные символы получили достаточно полное освещение. При включении в HTML-документ специальных символов, выходящих за пределы семибитного ASCII, следует учитывать две важные задачи: обеспечение целостности информации и универсальность отображения в браузерах.

Алгоритм обнаружения кодирования

Начиная с HTML5, рекомендуемой кодировкой является UTF-8, а также используются другие механизмы предварительного определения кодировки. Символы, выходящие за пределы печатаемого диапазона ASCII (от 32 до 126), обычно отображаются некорректно. Это не создает серьезных проблем для пользователей, говорящих на английском языке, но другие языки регулярно – а в некоторых случаях и всегда – требуют символов, выходящих за пределы этого диапазона. В языковых средах, использующих китайский, японский и корейский (CJK) языки, где применяется несколько различных многобайтовых кодировок, часто также используется автоматическое определение кодировки. Кроме того, браузеры обычно позволяют пользователю вручную переопределить неверно указанную кодировку. Все чаще многоязычные веб-сайты и веб-сайты на языках, отличных от западных, используют UTF-8, что позволяет использовать одну и ту же кодировку для всех языков. UTF-16 или UTF-32, которые также могут использоваться для всех языков, применяются реже, поскольку их сложнее обрабатывать в языках программирования, предполагающих байто-ориентированную кодировку, являющуюся расширением ASCII, и они менее эффективны для текста с высокой частотой символов ASCII, что обычно характерно для HTML-документов. Успешное отображение страницы не обязательно свидетельствует о правильном указании её кодировки. Если создатель и читатель страницы используют кодировку символов, специфичную для платформы, а сервер не передает никакой идентифицирующей информации, то читатель увидит страницу так, как задумал создатель, но другие читатели на разных платформах или с другими языковыми настройками могут увидеть страницу не так, как предполагалось.

Ссылки на персонажи

В дополнение к нативным кодировкам символов, символы также могут быть закодированы как ссылки на символы, которые могут быть числовыми ссылками на символы (десятичными или шестнадцатеричными) или ссылками на сущности символов. Ссылки на сущности символов также иногда называют именованными сущностями или HTML-сущностями, особенно в контексте HTML. Использование ссылок на символы в HTML восходит к SGML.