Кіріспе

Unicode код нүктесі бойынша 4 байт ретінде сақтау. UTF-32 (32 биттік Unicode түрлендіру форматы) – Unicode код нүктелерін кодтау үшін қолданылатын, әрбір код нүктесіне дәл 32 бит (төрт байт) қолданатын белгіленген ұзындығы бар кодтау (бірақ 232 Unicode код нүктесінен әлдеқайда аз болғандықтан, шын мәнінде 21 бит қана керек, сондықтан алдыңғы биттердің саны нөл болуы керек). UTF-32-нің басты кемшілігі – кеңістікті тиімді пайдаланбайды, әрбір код нүктесіне төрт байт, оның ішінде әрқашан нөл болатын 11 бит қолданады. Көптеген мәтіндерде (мысалы, кейбір танымал эмодзилер бар мәтіндерді қоспағанда) BMP-ден тыс символдар сирек кездеседі және өлшемді бағалау үшін оларды елемеуге болады. Бұл UTF-32-ні UTF-16-дан шамамен екі есе үлкен етеді. ASCII кіші жиынтығындағы символдардың санына байланысты UTF-8 өлшемінен төрт есеге дейін үлкен болуы мүмкін. ISO стандартында (Unicode 2.1, 1998 жыл) 0xE00000-ден 0xFFFFFF-ке дейін және 0x60000000-ден 0x7FFFFFFF-ке дейін «жеке пайдалану үшін резервтелген» деп белгіленгенімен, бұл аймақтар кейінгі нұсқаларда алынып тасталды. ISO/IEC JTC 1/SC 2 жұмыс тобының қағидалары мен процедуралары құжатында код нүктелерінің болашақтағы барлық тағайындамалары Unicode диапазонымен шектелетіні айтылғандықтан, UTF-32 барлық UCS код нүктелерін көрсетуге қабілетті және UTF-32 мен UCS-4 бірдей.

Нұсқалар

Техникалық тұрғыдан жарамсыз болғанымен, орынбасар жартылары көбінесе кодталып, қабылданады. Бұл жарамсыз UTF-16 (мысалы, Windows файлдық атаулары) UTF-32 форматына аударуға мүмкіндік береді, бұл UTF-8 форматының WTF-8 нұсқасының жұмыс істеу принципіне ұқсас. Кейде BMP емес символдардың орнына жұп орынбасарлар кодталады, CESU-8 сияқты. Қолданылмаған 32 биттік мәндердің көптігіне байланысты, Unicode емес мәндерді қолдану арқылы жарамсыз UTF-8 сақтауға да болады, бұл UTF-8 қателерін кодтау үшін пайдаланылады, алайда мұндай әрекеттерге арналған стандарт жоқ.