Кіріспе
Unicode код нүктесі бойынша 4 байт ретінде сақтау. UTF-32 (32 биттік Unicode түрлендіру форматы) – Unicode код нүктелерін кодтау үшін қолданылатын, әрбір код нүктесіне дәл 32 бит (төрт байт) қолданатын белгіленген ұзындығы бар кодтау (бірақ 232 Unicode код нүктесінен әлдеқайда аз болғандықтан, шын мәнінде 21 бит қана керек, сондықтан алдыңғы биттердің саны нөл болуы керек). UTF-32-нің басты кемшілігі – кеңістікті тиімді пайдаланбайды, әрбір код нүктесіне төрт байт, оның ішінде әрқашан нөл болатын 11 бит қолданады. Көптеген мәтіндерде (мысалы, кейбір танымал эмодзилер бар мәтіндерді қоспағанда) BMP-ден тыс символдар сирек кездеседі және өлшемді бағалау үшін оларды елемеуге болады. Бұл UTF-32-ні UTF-16-дан шамамен екі есе үлкен етеді. ASCII кіші жиынтығындағы символдардың санына байланысты UTF-8 өлшемінен төрт есеге дейін үлкен болуы мүмкін. ISO стандартында (Unicode 2.1, 1998 жыл) 0xE00000-ден 0xFFFFFF-ке дейін және 0x60000000-ден 0x7FFFFFFF-ке дейін «жеке пайдалану үшін резервтелген» деп белгіленгенімен, бұл аймақтар кейінгі нұсқаларда алынып тасталды. ISO/IEC JTC 1/SC 2 жұмыс тобының қағидалары мен процедуралары құжатында код нүктелерінің болашақтағы барлық тағайындамалары Unicode диапазонымен шектелетіні айтылғандықтан, UTF-32 барлық UCS код нүктелерін көрсетуге қабілетті және UTF-32 мен UCS-4 бірдей.
UTF 32 (32 bit Unicode Transformation Format) is a fixed length encoding used to encode Unicode code points that uses exactly 32 bits (four bytes) per code point (but a number of leading bits must be zero as there are far fewer than 232 Unicode code points, needing actually only 21 bits). The main disadvantage of UTF 32 is that it is space inefficient, using four bytes per code point, including 11 bits that are always zero. Characters beyond the BMP are relatively rare in most texts (except for e. g. texts with some popular emojis), and can typically be ignored for sizing estimates. This makes UTF 32 close to twice the size of UTF 16. It can be up to four times the size of UTF 8 depending on how many of the characters are in the ASCII subset. Although the ISO standard had (as of 1998 in Unicode 2.1) "reserved for private use" 0xE00000 to 0xFFFFFF, and 0x60000000 to 0x7FFFFFFF these areas were removed in later versions. Because the Principles and Procedures document of ISO/IEC JTC 1/SC 2 Working Group 2 states that all future assignments of code points will be constrained to the Unicode range, UTF 32 will be able to represent all UCS code points and UTF 32 and UCS 4 are identical.
Нұсқалар
Техникалық тұрғыдан жарамсыз болғанымен, орынбасар жартылары көбінесе кодталып, қабылданады. Бұл жарамсыз UTF-16 (мысалы, Windows файлдық атаулары) UTF-32 форматына аударуға мүмкіндік береді, бұл UTF-8 форматының WTF-8 нұсқасының жұмыс істеу принципіне ұқсас. Кейде BMP емес символдардың орнына жұп орынбасарлар кодталады, CESU-8 сияқты. Қолданылмаған 32 биттік мәндердің көптігіне байланысты, Unicode емес мәндерді қолдану арқылы жарамсыз UTF-8 сақтауға да болады, бұл UTF-8 қателерін кодтау үшін пайдаланылады, алайда мұндай әрекеттерге арналған стандарт жоқ.