Введение

Стандарт представления языков

ISO 639 — это стандарт Международной организации по стандартизации (ISO), касающийся представления языков и языковых групп. В настоящее время он состоит из четырех наборов кодов (1, 3, 5), названных по номерам частей, которые ранее описывали соответствующие наборы (часть 4 представляла собой руководство без собственной системы кодирования); часть 6 была опубликована, но впоследствии отозвана. Впервые стандарт был утвержден в 1967 году как единая рекомендация ISO, ISO/R 639, и заменен в 2002 году частью 1 новой серии, ISO 639-1, за которой последовали дополнительные части. Все существующие части серии были объединены в единый стандарт в 2023 году, в значительной степени на основе текста ISO 639-4.

Использование кодов ISO 639

Языковые коды, определенные в различных частях стандарта ISO 639, используются в библиографии, а также в компьютерных и интернет-средах как ключевой элемент данных локализации. Эти коды также применяются в различных областях, например, в URL-адресах Википедии для обозначения языковых версий.

Текущие наборы и исторические части стандарта

Набор (часть) Прежнее название (коды для представления названий языков – ) Регистрационный орган Первое издание Текущий № в списке (на 2023 год) Комплект 1 Часть 1: Код Alpha 2 Infoterm 1967 (оригинальный ISO 639) 2023 184 Комплект 2 Часть 2: Код Alpha 3 Библиотека Конгресса 1998 2023 482 + 20 B только + 4 специальных + 520 для местного использования Комплект 3 Часть 3: Код Alpha 3 для всестороннего охвата языков SIL International 2007 2023 7916 + 4 специальных + 520 для местного использования (ISO 639-4) Часть 4: Руководство по реализации и общие принципы кодирования языков ISO/TC 37/SC 2 2010 07 16 2023 (не является списком) Комплект 5 Часть 5: Код Alpha 3 для языковых семей и групп Библиотека Конгресса 2008 05 15 2023 115 (включая 36 остаточных + 29 регулярных групп из ISO 639-2) (ISO 639-6) Часть 6: Альфа 4 представление для всестороннего охвата языковых вариантов (отозван) Geolang 2009 11 17 отозван 21 000+

Каждый комплект стандартов поддерживается организацией по техническому обслуживанию, которая добавляет коды и изменяет статус кодов при необходимости. ISO 639-6 был отозван в 2014 году и не включен в ISO 639:2023.

Код с двумя буквами

В наборе 1 используются двухбуквенные (ранее "Альфа 2") идентификаторы (для кодов, состоящих из двух букв основного латинского алфавита ISO). Когда потребовались коды для большего числа языков, охватывающие более двухбуквенные комбинации (максимум 26² = 676), был разработан набор 2, использующий трехбуквенные коды. (Однако последний был опубликован официально первым.)

Код трех букв

Три буквы (ранее "Альфа 3") идентификаторы (для кодов, состоящих из 3 букв базового латинского алфавита ISO) используются в наборах 2, 3 и 5. Количество языков и языковых групп, которые могут быть представлены таким образом, составляет 26³ = 17 576. Широкое использование трехбуквенных кодов тремя наборами ISO 639 требует определенной координации в рамках более крупной системы. Набор 2 определяет четыре специальных кода – mis, mul, und, zxx, зарезервированный диапазон qaa–qtz (20 × 26 = 520 кодов), а также содержит 20 двойных записей (коды B/T) и 2 записи с устаревшими кодами B. В сумме это составляет 520 + 22 + 4 = 546 кодов, которые нельзя использовать в наборе 3 для представления языков или в наборе 5 для представления языковых семей или групп. Остается 17 576 – 546 = 17 030 кодов. На Земле в настоящее время существует от шести до семи тысяч языков. Таким образом, этих 17 030 кодов достаточно для присвоения уникального кода каждому языку, хотя некоторые языки могут получить произвольные коды, не имеющие отношения к их традиционному названию (названиям).

Кодовое пространство Альфа-4 (утрачено)

Коды "Альфа 4" (коды, состоящие из 4 букв базового латинского алфавита ISO) предлагалось использовать в ISO 639-6, который был отозван. Максимальное количество языков и диалектов, которые могут быть представлены, равно 26⁴ = 456 976.