Кіріспе

Екі объектінің ұқсастығын сандық түрде бағалайтын нақты мәнді функция. Статистика және оған қатысты салаларда ұқсастық өлшемі, ұқсастық функциясы немесе ұқсастық метрикасы – екі объектінің ұқсастығын сандық түрде бағалайтын нақты мәнді функция болып табылады. Ұқсастықтың жалғыз ғана анықтамасы болмаса да, мұндай өлшемдер көбінесе арақашықтық метрикасының кері шамасы болып келеді: олар ұқсас объектілер үшін жоғары мәндерді, ал өте ұқсамайтын объектілер үшін нөл немесе теріс мәнді қабылдайды. Дегенмен, кең мағынада ұқсастық функциясы метрикалық аксиомаларды орындауы да мүмкін. Косинус ұқсастығы – нақты мәнді векторлар үшін жиі қолданылатын ұқсастық өлшемі, ол ақпаратты іздеуде (басқа салалармен қатар) векторлық кеңістік моделіндегі құжаттардың ұқсастығын бағалау үшін қолданылады. Машиналық оқытуда RBF ядросы сияқты кең таралған ядролық функцияларды ұқсастық функциялары ретінде қарастыруға болады.

Кластерлеуде қолдану

Кластерлік талдау – ұқсас объектілерді біріктіру арқылы деректердегі үлгілерді табуға қолданылатын деректерді өндіру әдісі. Ол деректер жиынтығын олардың ұқсастығына негізделген топтарға немесе кластерлерге бөлуді қамтиды. Кластерлеудің негізгі аспектілерінің бірі – дерек нүктелерінің ұқсастығын өлшеу. Ұқсастық өлшемдері көптеген кластерлеу әдістерінде маңызды рөл атқарады, себебі олар екі дерек нүктесінің қаншалықты тығыз байланысты екенін және оларды бір кластерге топтастыру қажеттігін анықтау үшін қолданылады. Ұқсастық өлшемі топталатын деректердің түріне және шешілетін нақты мәселеге байланысты әр түрлі нысанда болуы мүмкін. Ең көп қолданылатын ұқсастық өлшемдерінің бірі – Евклид қашықтығы, ол көптеген кластерлеу әдістерінде қолданылады, соның ішінде K-орталықтар кластерлеуі және Иерархиялық кластерлеу. Евклид қашықтығы – жоғары өлшемді кеңістіктегі екі нүкте арасындағы тура сызық қашықтығының өлшемі. Ол екі нүктелердің сәйкес координаталары арасындағы айырмашылықтардың квадратының қосындысының квадрат түбірі ретінде есептеледі. Мысалы, егер бізде екі дерек нүктесі және болса, олардың арасындағы Евклид қашықтығы келесідей есептеледі: .

Тағы бір көп қолданылатын ұқсастық өлшемі – Жаккард индексі немесе Жаккард ұқсастығы, ол бинарлық деректермен жұмыс істейтін кластерлеу әдістерінде қолданылады, мысалы, қатысу/болмауы немесе Бульдік деректер. Жаккард ұқсастығы, әсіресе, мәтіндік деректермен жұмыс істейтін кластерлеу әдістері үшін пайдалы, онда оны ұқсас құжаттардың кластерлерін олардың ортақ ерекшеліктері немесе кілт сөздер негізінде анықтау үшін қолдануға болады. Ол екі жиынның қиылысының мөлшеріне екі жиынның бірігісінің мөлшеріне бөлінгендей есептеледі. 162 маңызды ядролық профильдің ұқсастығы Жаккард ұқсастық өлшемі арқылы тексеріледі (суреттегі жылу картасын қараңыз). Ядролық профильдің Жаккард ұқсастығы 0-ден 1-ге дейін өзгереді, мұнда 0 екі жиынның ұқсастығы жоқ екенін, ал 1 – ең ұқсас ядролық профильді кластерлеу мақсатында толық ұқсастықты білдіреді. Манхэттен қашықтығы, сондай-ақ Такси геометриясы деп аталады, үздіксіз деректермен жұмыс істейтін кластерлеу техникасында жиі қолданылатын ұқсастық өлшемі. Бұл жоғары өлшемді кеңістіктегі екі дерек нүктесі арасындағы қашықтықтың өлшемі, ол екі нүктелердің сәйкес координаталары арасындағы абсолютті айырмашылықтардың қосындысы ретінде есептеледі. Спектрлік кластерлеуде деректерді түрлендіру үшін ұқсастық немесе туыстық өлшемі қолданылады, бұл деректер таралуының пішініндегі дөңес еместікке байланысты қиындықтарды жеңуге көмектеседі. Бұл өлшем n нүктелер жиынтығы үшін өлшемді матрицаны құрайды, онда матрицадағы жазба – нүктелер мен арасындағы (кері) Евклид қашықтығы немесе Гаусс сияқты қашықтықтың күрделі өлшемі болуы мүмкін. Ұқсастық өлшемін таңдау топталатын деректердің түріне және шешілетін нақты мәселеге байланысты. Мысалы, гендік экспрессия деректері сияқты үздіксіз деректермен жұмыс істеу үшін Евклид қашықтығы немесе косинус ұқсастығы қолайлы болуы мүмкін. Егер ядролық профильде геномдық локустың болуы сияқты бинарлық деректермен жұмыс істеген жағдайда, Жаккард индексі қолайлырақ болуы мүмкін. Соңында, желілік немесе торлық құрылымда орналастырылған деректермен жұмыс істеу, мысалы, бейне немесе сигнал өңдеу деректері, Манхэттен қашықтығы кластерлеу үшін өте пайдалы.

Ұсыныстар жүйелерінде пайдалану

Ұсыныс беруші жүйелерді әзірлеуде ұқсастық өлшемдері қолданылады. Ол пайдаланушының әртүрлі нысандарды қабылдауын және ұнатуын бақылайды. Ұсыныс беруші жүйелерде әдіс қашықтық есептеуді пайдаланады, мысалы, немесе, кез келген нысандар жұбының ұқсастығын көрсететін мәндермен матрица құрады. Содан кейін матрицадағы мәндерді талдап, салыстыру арқылы екі нысанды пайдаланушының қалауымен сәйкестендіруге немесе пайдаланушыларды олардың бағалары бойынша байланыстыруға болады. Бұл жүйеде мәннің өзі де, екі мән арасындағы абсолютті қашықтық та маңызды. Осы деректерді жинау пайдаланушыға бағаның ұнау деңгейін, сондай-ақ екі бағаның бір-біріне қаншалықты жақын екенін, немесе қабылдамауын көрсете алады. Осыдан кейін пайдаланушыға оның ұнатуымен өте ұқсас нысандарды ұсынуға болады. Ұсыныс беруші жүйелерді көптеген онлайн ойын-сауық платформаларында, әлеуметтік желілерде және ағымдық веб-сайттарда кездестіруге болады. Бұл жүйелерді құру логикасы ұқсастық өлшемдеріне негізделген.

Реттілік сәйкестендіруде қолдану

Ұқсастық матрицалары тізбектерді салыстыруда қолданылады. Көбірек ұқсас символдарға жоғары балл, ал ұқсамайтын символдарға төмен немесе теріс балл беріледі. Нуклеотидтік ұқсастық матрицалары нуклеин қышқылы тізбектерін салыстыру үшін қолданылады. ДНҚ-да әдетте төрт нуклеотид ғана кездесетіндіктен (аденин (А), цитозин (С), гуанин (G) және тимин (Т)), нуклеотидтік ұқсастық матрицалары ақуыздық ұқсастық матрицаларына қарағанда әлдеқайда қарапайым. Мысалы, қарапайым матрица бірдей базаларға +1 балл, ал әртүрлі базаларға -1 балл береді. Күрделірек матрица трансверсияларға (пиримидиннен пуринге немесе керісінше) қарағанда транзицияларға (пиримидиннен басқа пиримидинге, мысалы, C немесе T, немесе пуриннен басқа пуринге, мысалы, A немесе G) жоғары балл береді. Матрицаның сәйкестік/айырмашылық қатынасы эволюциялық қашықтықты анықтайды. BLASTN қолданатын +1/−3 ДНК матрицасы 99% сәйкес келетін тізбектерді табуға ең қолайлы; +1/−1 (немесе +4/−4) матрицасы шамамен 70% ұқсастығы бар тізбектерге көбірек сәйкес келеді. Ұқсастығы төмен тізбектерді салыстыру үшін ұзақ тізбектерді салыстыру қажет. Аминқышқылының ұқсастық матрицалары күрделірек, себебі генетикалық кодпен кодталған 20 аминқышқылы бар, сондықтан мүмкін болатын алмастырулардың саны көп. Сондықтан аминқышқылының ұқсастық матрицасында 400 жазба бар (әдетте ол симметриялық). Алғашқы тәсіл барлық аминқышқылының өзгеруін тең бағалады. Кейінірек кодонды кодтау үшін қажетті базалық өзгерістер санына негізделген аминқышқылының ұқсастығын анықтау жасалды. Бұл модель жақсырақ, бірақ ол аминқышқылының өзгеруіне қатысты таңдау қысымын ескермейді. Жақсырақ модельдер аминқышқылының химиялық қасиеттерін ескерді. Бір тәсіл эмпирикалық түрде ұқсастық матрицаларын жасау болды. Дейхофф әдісі филогенетикалық ағаштарды және ағаштағы түрлерден алынған тізбектерді пайдаланды. Бұл тәсіл PAM матрицаларының сериясын тудырды. PAM матрицалары 100 аминқышқылына шамамен қанша нуклеотидтік өзгеріс болғанына қарай белгіленеді. PAM матрицалары жақсы түсіндірілген эволюциялық модельден пайда алғанымен, олар эволюциялық қашықтықтың қысқа аралығында (PAM10–PAM120) ең пайдалы. Ұзақ эволюциялық қашықтықта, мысалы, PAM250 немесе 20% сәйкестік, BLOSUM матрицаларының тиімдірек екені көрсетілді. BLOSUM сериясы бірнеше әртүрлі тізбектерді салыстыру арқылы жасалды. BLOSUM сериясы барлық тізбектер арасындағы өзгермеген энтропия мөлшеріне қарай белгіленеді, сондықтан BLOSUM санының төмендеуі жоғары PAM санына сәйкес келеді.