Кіріспе
Unicode 2.0
Unicode-та кейбір таңбалардың қайталануы бар. Бұл – канондық түрде тең келетін бір Юникод код нүктелерінің жұптары. Мұның себебі – бұрынғы жүйелермен үйлесімділік мәселелері. Егер екі таңба канондық түрде тең болмаса, олар тар мағынада «көшірме» емес. Дегенмен, екі Юникод таңбасы бір графеманы кодтай ма, жоқ па дегенде пікір қақтығыстары болуы мүмкін. Бұл, тарихи жағынан туысқан (мысалы, грек тіліндегі Η мен латын тіліндегі H) немесе кездейсоқ ұқсастықтан туындаған (мысалы, грек тіліндегі Ρ мен латын тіліндегі P, немесе грек тіліндегі Η мен кириллицадағы Н, немесе төмендегі гомоглифтік жетілік: «Күн» астрономиялық символы ☉, «шеңберлі нүкте операторы» ⊙, готикалық әріп 𐍈, екі екілік шерту үшін IPA символы, Osage әрпі 𐓃, Tifinagh әрпі ⵙ, және архаикалық кириллица әрпі Ꙩ) бірдей немесе дерлік бірдей глифтер (гомоглифтер) ретінде көрсетілген Юникод таңбаларынан нақты ажыратылуы керек.
This should be clearly distinguished from Unicode characters that are rendered as identical glyphs or near identical glyphs (homoglyphs), either because they are historically cognate (such as Greek Η vs. Latin H) or because of coincidental similarity (such as Greek Ρ vs. Latin P, or Greek Η vs. Cyrillic Н, or the following homoglyph septuplet: astronomical symbol for "Sun" ☉, "circled dot operator" ⊙, the Gothic letter 𐍈, the IPA symbol for a bilabial click , the Osage letter 𐓃, the Tifinagh letter ⵙ, and the archaic Cyrillic letter Ꙩ).
Қайталанған немесе ауыстырылған таңба
Юникод графемаларды кодтауға бағытталған, графемалардың жеке "мағыналарын" ("семантикасын") емес, сондай-ақ глифтерді емес. Мұндай таңбаларды техникалық контексте қолданғанда бөлек кодтау қажеттігі әрбір жағдайда жеке қарастырылады, мысалы, математикалық символдар ретінде қолданылатын грек әріптері: осылайша, грек тілінен бөлек "микро белгісі" µ, бірақ латын тілінен бөлек "Мега белгісі" жоқ, Unicode консорциумының тарихи себептерге (атап айтқанда, Латын 1-де микро белгісінің болуына) байланысты прагматикалық шешімі болды. Техникалық тұрғыдан алғанда, µ және μ бір-бірін қайталайтын таңбалар емес, себебі консорциум осы символдарды ерекше таңбалар ретінде қарастырды (ал "Mega" және латын әрпі M-ді бір таңба ретінде қарастырды). Бір графеманы бірнеше таңбаға бөлу үшін әртүрлі "мағыналардың" болуы ғана жеткілікті емес екенін ескеру қажет: мысалы, жіті акцент уэльс немесе швед тілдерінде сөздің екпінін білдіре алады, француз тілінде дауыстының сапасын, ал венгр, исланд немесе ирланд тілдерінде дауыстының ұзақтығын көрсетеді. Бұл тілдердің бәрі бір әріпте – яғни латын әрпінде жазылғандықтан, әртүрлі мағынадағы жіті акцент бір біріктірілген диакритикалық таңба (U+0301) ретінде қарастырылады, сондықтан француз және венгр тілдеріндегі é әрпі бірдей таңба болып табылады. Тондық тілдерді транскрипциялау үшін U+0341 нөмірімен бөлек "біріктірілген диакритикалық жіті тон белгісі" бар, жіті акценттен басты айырмашылығы – француз тілі сияқты тілдерде жіті акцент кішкентай i әрпінің үстіндегі нүктені алмастыра алады, ал вьетнам тілінде жіті тон белгісі нүктенің үстіне қосылады. Тәуелсіз деп есептелетін әліпбилерге арналған диакритикалық белгілер бөлек кодталуы мүмкін, мысалы, грек әліпбиі үшін U+0384 және армян әліпбиі үшін U+055B нөміріндегі жіті ("тонос") белгілері. Кейбір кириллицаға негізделген әліпбилер (мысалы, орыс тілі) де жіті акцентті қолданады, бірақ жеке кодталған "кириллицалық жіті" белгісі жоқ және U+0301 кириллица үшін де, латын үшін де қолданылуы керек (Unicode-дегі кириллицалық таңбаларды қараңыз). Бір графеманың көптеген "мағыналары" болуы мысалы, U әрпін қарастырғанда одан да анық көрінеді, ол әртүрлі тілдерде (ағылшын және т.б., француз, неміс және т.б.) орфографияда қолданылғанда мүлдем басқа фонемиялық сілтемелерге ие (U-нің символ ретіндегі әртүрлі қолданысын ескермегенде).
CJK толық ені нысандары
Дәстүрлі қытай мінелер кодтауларында мінелер көбінесе бір байтты (жартылай енді деп аталады) немесе екі байтты (толық енді деп аталады) алып келді. Бір байтты мінелер екі байтты мінелерге қарағанда екі есе тар көрінетін. Латын әліпбиі сияқты кейбір мінелер жартылай және толық енді түрлерінде қол жетімді болды. Жартылай енді түрлері жиірек қолданылғандықтан, олар әдетте сол мінелер үшін стандартты кодтық нүктелерге бейімделді. Сондықтан, осы ерекшелікті сақтау үшін толық енді түрлерге жеке бөлім қажет болды.
Хат тәрізді символдар
Кейбір жағдайларда, нақты графемалар бастапқы қызметінен өзгеше, арнайы символдық немесе техникалық мағынаға ие болған. Көрінетін мысалы – грек әрпі π, ол грек тілін білмейтін адамдардың арасында да шеңбердің ұзындығын диаметріне бөлгендегі математикалық тұрақтының символы ретінде кеңінен танылған. Грек және латын әліпбилерінің математикалық символдар ретінде қолдану үшін арналған бірнеше түрлері Математикалық әріптік-сандық символдар диапазонында кодталған. Бұл диапазон, әдетте әрпің қалыптарының нұсқалары саналатын символдарды, олардың кеңінен қолданылуына байланысты (мысалы, L, "script L", "blackletter L", "boldface blackletter L") ерекше математикалық символдар ретінде бөлек кодтауға мүмкіндік береді. Ол тек математикалық немесе техникалық нотацияда қолдануға арналған, техникалық емес мәтінде қолдануға болмайды.
Грек тілінде
Көптеген грек әріптері техникалық белгілер ретінде қолданылады. Барлық грек әріптері Юникодтың грек бөлімінде кодталған, бірақ олардың көпшілігі олар көрсететін техникалық символдың атауымен екінші рет кодталған. "Микробелгі" (U+00B5, µ) ISO 8859-1 стандартынан мұраланған, ал қалғандарының шығу тегі осыншалықты анық емес. Басқа грек глифтерінің нұсқалары бөлек символдар ретінде кодталған, мысалы, ай тәрізді сигма Ϲ ϲ (Σ σ-ға қарама-қарсы), соңғы сигма ς (қатаң айтқанда, контексттік глиф нұсқасы) σ-ға қарама-қарсы, Qoppa сандық символы Ϟ ϟ (архаикалық Ϙ ϙ-ға қарама-қарсы).
Грек әріптеріне бөлек "символ" кодтық нүктелер тағайындалған: әріп сияқты символдар ϐ, ϵ, ϑ, ϖ, ϱ, ϒ және ϕ (β, ε, θ, π, ρ, Υ, φ-ға қарама-қарсы); Ом символы Ω (ω-ға қарама-қарсы); және көбейту ∏ және қосу ∑ математикалық операторлары (Π және Σ-ға қарама-қарсы).
Рим цифрлары
Юникодта U+2160-тан U+2183 аралығындағы Сандық пішіндер диапазонының бөлігі ретінде, рим цифрлары ретінде арнайы белгіленген бірнеше таңбалар бар. Мысалы, 1988 жылғы рим саны мынадай жазылуы мүмкін: Бұл диапазон үлкен және кіші әріптердегі сандарды, сондай-ақ 12-ге дейінгі сандар үшін алдын ала біріктірілген глифтерді қамтиды (сағаттардың беттері үшін негізінен арналған). Алдын ала біріктірілген глифтерді жеке сандарды көрсету үшін ғана қолдану керек, егер жеке глифтерді пайдалану қажет болмаса, және күрделі сандарды алмастыру үшін емес. Мысалы, адам «бір» және «он» глифтерін біріктіріп, рим цифрымен он бірді білдіре алады, сондықтан U+216A канондық түрде эквивалентті болады. Мұндай таңбалар жиынтық үйлесімділік таңбалары немесе бөлінетін үйлесімділік таңбалары деп те аталады. Бұл таңбалар, әдетте, басқа қолданыстағы кодтамалармен үйлесімділік болмаса, Юникод стандартына енгізілмес еді (Юникод үйлесімділік таңбаларын қараңыз). Мақсаты – қолданыстағы кодтамалардан Юникодқа қарапайым аударма жасауды қамтамасыз ету. Бұл кері аударманы қиындатады, себебі бірнеше Юникод таңбасы басқа кодтамадағы бір таңбаға сәйкес келуі мүмкін. Үйлесімділік қажеттіліктері болмаса, тек мына таңбалар ғана қажет болар еді: ; қалған барлық рим цифрларын осы таңбалардан құрастыруға болады.