Кіріспе

Көптеген компьютерлік бағдарламалық қамтамасының әріптерді тексеру мүмкіндігі. Әріптерді ұсыну – бұл көптеген компьютерлік бағдарламалық қамтамасында қате жазылған болуы мүмкін сөздерге ұқсас нұсқаларды табу үшін қолданылатын мүмкіндік. Әріптерді ұсыну мүмкіндіктері көбінесе интернеттік ізденіс жүйелерінде, мәтін редакторында, әріптерді тексеру бағдарламаларында, медициналық транскрипцияда, автоматты сұранысты қайта жасау кезінде және жиілік тізімі статистикасын есептеуде қолданылады.

Алгоритмдер

Кез келген орфографиялық тексерушінің мақсатты тілдегі сөздер туралы жалпы немесе арнайы біліммен (мысалы, медициналық сөздік сияқты) деректері болуы керек. Бұл деректер мыналардан құралуы мүмкін: барлық белгілі сөздердің сөздігі; дұрыс жазылатын типтік мәтінді қамтитын мәтін корпусы; жиі қате жазылатын сөздердің тізімі, онда қателерді түзетулермен сәйкестендіріледі; адамдардың мәтін енгізу журналдары, мысалы, танымал іздеу жүйелерінен алынған мәліметтер. Бұл, әдетте, көпшілік ресурстарынан жиналған материал, бірақ онда орфографиялық қателер болуы мүмкін. Сондай-ақ, адамдар орфографиялық ұсынысты қашан таңдайтыны немесе одан да ұқсас сұранысты қайталап беретіні туралы мәліметтер де қамтылуы мүмкін. Бұл дұрыс емес жазылған сөздерді сенімді түзетулермен байланыстыратын көпшілік картасын құруға көмектеседі. Жиі қате жазылатын сөздердің тізіміне, мүмкін, бірнеше сөзден тұратын тіркестер де енгізілуі мүмкін, және енгізілген сөздердің немесе тіркестердің тізімде бар-жоғын тексеруге болады. Егер түзетулерге дейінгі қателерді түзетуге арналған алдын ала жасалған карта болмаса, сөздікті пайдаланудың әдеттегі тәсілі – енгізілген сөз бен сөздіктегі әрбір сөз арасындағы өңдеу қашықтығын есептеу болып табылады. Левенштейн арақашықтығы метрикасы бір әріпті енгізуді, жоюды немесе басқа әріппен алмастыруды «өңдеу» деп қарастырады. Ал Дамерау-Левенштейн арақашықтығына көрші әріптерді алмастыру (транспозиция) қосылады. Егер кіріс сөз сөздіктегі сөзден 1 өңдеу қашықтығында болса, онда ол түзету ретінде өте ықтимал деп есептеледі, 2 қашықтықтағы сөздер аз ықтимал, ал 3 қашықтықтағы сөздер кейде ұсыныстарға қосылады, кейде назарда ұсталмайды. Мәтін корпусын белгілі сөздердің сөздігі ретінде қарастыруға болады, онда әр сөздің пайда болу жиілігі көрсетіледі. Бұл мәліметтер жазу ұсыныстарын сұрыптау үшін пайдаланылуы мүмкін. Мысалы, егер 1 қашықтықта бірнеше түзету ұсынысы болса, корпуста жиі кездесетін сөздер қажетті түзетулер болуы мүмкін. Белгілі сөздердің сөздігі өте үлкен болғандықтан, кіріс сөз бен сөздіктегі әрбір сөз арасындағы өңдеу қашықтығын есептеу көп есептеу ресурстарын қажет етеді және салыстырмалы түрде баяу болады. Сақтау іздеулерін жылдамдату үшін BK ағаштары сияқты әртүрлі дерек құрылымдарын пайдалануға болады. Питер Норвиг ұсынған жылдам тәсіл кіріс сөзден барлық мүмкін өңдеулердің барлық пермутацияларын жасайды. Ұзындығы n сөз үшін және а әліпби өлшемі үшін, өңдеу қашықтығы 1 үшін ең көп дегенде n өшіру, n-1 транспозиция, a*n өзгеріс және a*(n+1) енгізу болады. Ағылшын алфавитіндегі 26 әріпті ғана пайдалансақ, бұл тек 54*n+25 сөздік іздеуін береді, кез келген қайталануды алып тастағанда (бұл сөздегі нақты әріптерге байланысты). Бұл жүздеген мың сөздікпен салыстырғанда салыстырмалы түрде аз. Дегенмен, 2 және одан үлкен арақашықтықты өңдеу үшін ондаған немесе жүздеген мың іздеулер қажет болуы мүмкін. Вольф Гарбтың тағы бір жаңалығы – SymSpell деп аталады. Басқалар үлкен көлемде деректерді және терең оқыту әдістерін (машиналық оқытудың бір түрі) қолдану арқылы нейрондық желілерді орфографиялық түзетуді орындауға үйрету үшін тәжірибе жүргізді.