Кіріспе
Медоидтар - бұл деректер жиынтығының немесе деректер жиынтығындағы кластердің өкілдік объектілері, олардың кластердегі барлық объектілерге ұқсамаушылықтарының сомасы минималды. Медоидтар орта немесе центроидтарға ұқсас, бірақ медоидтар әрқашан деректер жиынтығының мүшелері болып табылады. Медоидтар көбінесе орташа немесе центроидты анықтауға болмайтын деректерде, мысалы, графиктерде қолданылады. Олар сондай-ақ, центроид дерек жиынтығының бейнелердегі, 3D траекториялардағы және гендік экспрессиядағы сияқты өкілі емес жағдайларда қолданылады (деректер шашыраңқы болғанымен, медоид болуы қажет емес). Бұлар, сондай-ақ, Евклидтің квадрат қашықтығынан басқа арақашықтықты пайдалана отырып, өкілді табуға тырысқанда қызықты болады (мысалы, кино рейтингтерінде). Кейбір деректер жиынтығында медиандар сияқты бір медоидтан артық болуы мүмкін. Медоидтың жалпы қолданылуы k медоидтар кластерлеу алгоритмі болып табылады, ол k орташа алгоритмге ұқсас, бірақ орташа немесе центроидты анықтауға болмайтын жағдайда жұмыс істейді. Бұл алгоритм негізінен келесідей жұмыс істейді. Алдымен медоидтар жиынтығы кездейсоқ таңдалады. Екіншісі, басқа нүктелерге дейінгі қашықтықтар есептеледі. Үшіншіден, деректер олар ең көп ұқсас медоидқа сәйкес топтастырылады. Төртіншіден, медоидтар жиынтығы итерациялық процесс арқылы оңтайландырылады. Медоид медианаға, геометриялық медианаға немесе центроидқа тең емес екеніне назар аударыңыз. Медиана тек 1 өлшемді деректерде ғана анықталады және ол нормамен (мысалы, Манхэттен қашықтығы немесе Евклид қашықтығы) индуцирленген метрикалар үшін басқа нүктелерге ұқсамауды азайтады. Геометриялық медиан кез келген өлшемде анықталады, бірақ медоидтан айырмашылығы, ол бастапқы деректер жиынтығының ішіндегі нүкте емес.
Анықтама
Қашықтық функциясы d бар кеңістіктегі нүктелер жиыны болсын. Медиода:
Қолданылу
RAND, TOPRANK және trimed бағдарламаларының орындалуы мына жерден табуға болады. Meddit-тің іске асырылуын мына жерден және мына жерден табуға болады. Корреляциялық ретті жартылаудың іске асырылуын мына жерден табуға болады.
can be found here and here. An implementation of Correlated Sequential Halving
can be found here.
Мәтін мен табиғи тіл өңдеудегі медоидтар (NLP)
Медоидтарды әр түрлі мәтіндік және НЛП тапсырмаларына талдаудың тиімділігі мен дәлдігін арттыру үшін қолдануға болады. Текст деректерін ұқсастыққа негіздеп кластерлеу арқылы медоидтар дерек жиынтығындағы өкілді мысалдарды анықтауға көмектеседі, бұл деректерді жақсы түсінуге және түсіндіруге әкеледі.
Мәтін кластерлеуі
Мәтіндерді кластерлеу - ұқсас мәтіндерді немесе құжаттарды олардың мазмұнына қарай топтастыру процесі. Медоидқа негізделген кластерлеу алгоритмдері үлкен көлемдегі мәтінді кластерлерге бөлу үшін қолданылуы мүмкін, әр кластер медоид құжатымен бейнеленеді. Бұл әдіс іздеу жүйелері, әлеуметтік медиа талдаулары және ұсынымдар жүйелері сияқты көптеген құжаттар жинақтарынан ақпаратты ұйымдастыруға, қорытындылауға және алуға көмектеседі.
Мәтіннің түйінді мазмұны
Мәтіннің түйіндемесі ең маңызды және маңызды ақпаратты алу арқылы үлкен мәтіннің қысқаша және бірізді түйіндемесін жасауды көздейді. Медоидқа негізделген кластерлеу құжаттың немесе құжаттар тобының ең танымал сөйлемдерін анықтау үшін пайдаланылуы мүмкін, содан кейін оларды жиынтықтау үшін біріктіруге болады. Бұл тәсіл, әсіресе, экстрактивті қорытындылау тапсырмаларында пайдалы, мұнда мақсат түпнұсқа мәтіннен ең маңызды сөйлемдерді таңдап, қорытынды жасау болып табылады.
Сезімталдықты талдау
Сезімді талдау мәтіннің бір бөлігінде айтылған сезімді немесе эмоцияны, мысалы оң, теріс немесе бейтарап сезімді анықтауды қамтиды. Медоидқа негізделген кластерлеуді ұқсас сезім үлгілеріне негізделген топтық мәтіндік деректерге қолдануға болады. Әр кластердің медоидтарын талдау арқылы зерттеушілер кластердің басым сезімдері туралы түсінік ала алады, бұл пікірлерді өндіру, тұтынушылардың пікірлерін талдау және әлеуметтік медиа мониторингі сияқты тапсырмаларда көмектеседі.
Тақырыпты модельдеу
Тақырыпты модельдеу - құжаттар жинағында кездесетін абстрактілі тақырыптарды табу үшін қолданылатын әдіс. Медоидқа негізделген кластерлеуді ұқсас тақырыптар немесе тақырыптар бар топтық құжаттарға қолдануға болады. Осы кластерлердің медоидтарын талдау арқылы зерттеушілер мәтін корпусындағы негізгі тақырыптарды түсіне алады, бұл құжат категориясын, үрдісті талдау және мазмұнды ұсыну сияқты міндеттерді жеңілдетеді.
Медоидқа негізделген кластерлеуде мәтіннің ұқсастығын өлшеу әдістері
МЕДОИД-қа негізделген кластерлеуді мәтіндік деректерге қолданғанда, құжаттарды тиімді салыстыру үшін ұқсас өлшемені таңдау өте маңызды. Әрбір әдістің өз артықшылықтары мен шектеулері бар, ал ұқсастық өлшемін таңдау талдау жүргізіліп жатқан мәтіндік деректердің ерекше талаптары мен сипаттамаларына негізделуі керек. Медоидтық кластерлеуде мәтіннің ұқсастығын өлшеудің жалпы әдістері:
Косинус ұқсастығы
Косинус ұқсастығы - екі мәтіннің ұқсастығын салыстыру үшін кеңінен қолданылатын өлшем. Ол екі құжат векторының арасындағы бұрыштың косинусын жоғары өлшемді кеңістікте есептейді.
Евклидтік қашықтық
Евклидтік қашықтық - көп өлшемді кеңістіктегі екі нүкте арасындағы ұқсастықтарды өлшеу үшін қолданылатын стандартты қашықтық метрикасы. Мәтіндік деректер жағдайында құжаттар көбінесе TF векторлары сияқты жоғары өлшемді векторлар ретінде бейнеленеді, ал Евклидтік қашықтықты олардың арасындағы ұқсастықтарды өлшеу үшін қолдануға болады. Евклидтік қашықтық төмен болса, бұл құжаттар арасындағы ұқсастықтың жоғары дәрежесін көрсетеді.
Үлкен тілдік модельдің кіріктірілуін талдау әдістері
Медоидтер BERT, GPT немесе RoBERTa сияқты үлкен тілдік модельдер (LLM) арқылы құрылған векторлық кеңістікті талдау және түсіну үшін пайдаланылуы мүмкін. Бұл модельдер сөздерді, сөз тіркестерін немесе сөйлемдерді құрайтын кластерлеуді қолдану арқылы зерттеушілер LLM-термен алынған семантикалық қатынастарды зерттей алады. Бұл тәсіл семантикалық ұқсас субъектілердің кластерлерін анықтауға көмектеседі, бұл модельдер туғызатын жоғары өлшемді кіріктірілген кеңістіктердің құрылымы мен ұйымына түсінік береді.
Деректерді таңдау және белсенді оқыту әдістері
Активті оқыту модельдің өнімділігін арттыратын оқыту қорынан деректерді таңдауды қамтиды. Медоидтар деректерді таңдау мен белсенді оқытуда маңызды рөл атқарады. Медоидқа негізделген кластерлеуді үлкен мәтіндік деректер жиынтығынан репрезентативті және әртүрлі үлгілерді анықтау үшін қолдануға болады, содан кейін оны ЖОО-ны тиімдірек реттеу немесе жақсы оқыту жиынтықтарын құру үшін пайдалануға болады. Медоидтарды оқыту үлгілері ретінде таңдап, зерттеушілер теңгерімді және ақпараттық оқыту жиынтығын ала алады, бұл ұсақ көйлендірілген модельдердің жалпылануын және беріктігін жақсарта алады.
Үлгілерді түсіндіру және қауіпсіздікке арналған әдістер
LLM-де медоидтарды қолдану модельдің түсіндіруді жақсартуға ықпал етеді. LLM-термен жасалған кіріктірулерді кластерлеу және әр кластердің өкілдері ретінде медоидтарды таңдау арқылы зерттеушілер модельдің мінез-құлқының көбірек түсіндірілетін түйіндемесін бере алады. Бұл тәсіл модельдің шешім қабылдау процесін түсінуге, ықтимал бейімділіктерді анықтауға және LLM-де құрылған кіріктірулердің негізгі құрылымын ашуға көмектеседі. ТЖМ-ның түсіндірілуі мен қауіпсіздігі туралы пікірталастар күшейіп келе жатқандықтан, медоидтарды қолдану осы мақсатқа жету үшін құнды құрал бола алады.
Нақты әлемдегі қолданбалар
Көпжақты кластерлеу әдісі ретінде медоидтарды биология мен медицинадан бастап жарнама мен маркетингке және әлеуметтік желілерге дейінгі көптеген салалардағы әртүрлі нақты әлем мәселелеріне қолдануға болады. Оның күрделі деректер жиынтығын жоғары дәрежеде түсінбеушілікпен өңдеу мүмкіндігі оны қазіргі заманғы деректерді талдаудың қуатты құралы етеді.
Гендік экспрессияны талдау
Гендік экспрессияны талдау кезінде зерттеушілер микромассивтер мен РНК реттілігінен тұратын озық технологияларды биологиялық үлгілердегі көптеген гендердің экспрессия деңгейін өлшеу үшін қолданады, бұл күрделі және талдау қиын болатын көп өлшемді деректерге әкеледі. Медоидтар - бұл негізінен экспрессиялық профильдеріне негізделген гендерді кластерлеу арқылы әлеуетті шешім, бұл зерттеушілерге биологиялық процестер мен аурулардың молекулалық механизмдеріне құнды түсінік бере алатын гендердің бірлесіп экспрессияланатын топтарын ашуға мүмкіндік береді.
Әлеуметтік желілерді талдау
Әлеуметтік желілерді бағалау үшін медоидтар әлеуметтік желідегі орталық немесе ықпалды тораптарды тану үшін ерекше құрал бола алады. Зерттеушілер түйіндерді олардың байланыс стиліне қарай топтастыра алады және желілердің қызметі мен құрылымына елеулі әсер ететін түйіндерді анықтай алады. Әлеуметтік желілерді талдауда медоидтарды пайдаланудың бір танымал тәсілі - олардың қасиеттеріне негізделген түйіндер жұптарының арасындағы қашықтық немесе ұқсастық метрикасын есептеу.
Нарықты сегменттеу
Медоидтар нарықты сегменттеу үшін де қолданылуы мүмкін, бұл аналитикалық процедура, оның ішінде клиенттерді негізінен олардың сатып алу мінез-құлқына, демографиялық ерекшеліктеріне және басқа да түрлі атрибуттарына негізделген топтарға бөлу. Медоидтарды пайдалану арқылы клиенттерді сегменттерге топтастыру компанияларға әр клиент тобының қажеттіліктеріне сәйкес келетін жарнамалық және маркетингтік әдістерін жасауға мүмкіндік береді. Медоидтар әрбір кластердің ішінде өкілдік факторлар ретінде қызмет етеді, бұл топтағы клиенттердің негізгі сипаттамаларын қамтиды. Топтар ішіндегі квадраттық қателер қосындысы (WGSS) - бұл кластерлер ішіндегі квадраттық қателердің шоғырлануын өлшеуді көздейтін нарықты сегменттеуде қолданылатын формула. Ол қателердің топтар ішіндегі үлестірімін оларды квадраттау және нәтижелерді агрегаттау арқылы алуға тырысады. WGSS метрикасы кластерлер ішіндегі үлгілердің біріктірілуін өлшеуге мүмкіндік береді, бұл WGSS-тің төменгі мәндері бар және кластерлеудің тиісінше жоғары әсері бар тығыз кластерлерді көрсетеді. WGSS формуласы: k-шы кластердегі үлгілердің орташа қашықтығы және k-шы кластердегі үлгілердің саны.
Where is the average distance of samples within the k th cluster and is the number of samples in the k th cluster.
Аномалияны анықтау
Медоидтар аномалияларды анықтауда да маңызды рөл атқарады, ал бір тиімді әдіс - кластерлік аномалияларды анықтау. Оларды деректердің қалған бөлігінен айтарлықтай ауытқуы бар деректер топтарын табу үшін пайдалануға болады. Медоидтарды қолдана отырып, деректерді топтарға топтастыру және әрбір кластердің қасиеттерін деректерге салыстыру арқылы зерттеушілер аномальды кластерлерді анық анықтай алады.
Мақсаты
Медоидтық кластерлеуді визуализациялау медоидтық кластерлеудің қалай жұмыс істейтінін түсінуге тырысқанда пайдалы болуы мүмкін. Зерттеулер көрсеткендей, адамдар визуалды ақпаратпен жақсы үйренеді. Медоидты топтастыруда медоид топтың орталығы болып табылады. Бұл k-нысалды кластерлеуден ерекшеленеді, онда орталық нақты деректер нүктесі емес, оның орнына деректер нүктелерінің арасында болуы мүмкін. Медоидты кluster деректерін топтастыру үшін қолданамыз, ол кластердегі барлық басқа объектілерге орташа ұқсамаушылығы ең аз элементті табу арқылы алынады. Қолданылған визуализациялық мысал k medoids кластерлеуді пайдаланғанымен, визуализацияны k means кластерлеуге де қолдануға болады, ол орташа ұқсастықты пайдаланылатын деректер жиынтығының орташасымен алмастыру арқылы.
Қашықтық матрицасы
Медоидқа негізделген кластерлеу үшін арақашықтық матрицасы қажет, ол Джакардтың ұқсамаушылығын (яғни 1 Джакард индексі) пайдалана отырып жасалады. Бұл қашықтық матрицасы бір өлшемді графиктегі екі нүкте арасындағы қашықтықты есептеу үшін қолданылады. Жоғарыдағы суретте Жакардтың ұқсастықсыздық графигінің мысалы көрсетілген.
Жоғары өлшемді медоидтар
K-медоидтар кластерлеуі мен басқа да медоидтар негізінде кластерлеу алгоритмдерінің ортақ проблемасы - "өлшектіліктің қарғысы", онда деректер нүктелері тым көп өлшемдер немесе ерекшеліктерден тұрады. Мәліметтерге өлшемдер қосылғанда, олардың арасындағы қашықтық аз болады және кластерлеуді тек Евклидтік қашықтықпен сипаттау қиынға соғады. Нәтижесінде, қашықтыққа негізделген ұқсас өлшемдер тұрақтыға жиналады және бізде нүктелер арасындағы қашықтықтың сипаттамасы бар, ол біздің деректер жиынтығын мәнді түрде көрсетпеуі мүмкін. Өлшемілік қарғысының әсерін азайтудың бір жолы - спектрлік кластерлеуді қолдану. Спектрлік кластерлеу негізгі компоненттік талдауды қолдана отырып, деректердің өлшемділігін азайту, деректерді төменгі өлшемді субкеңістікке жобалау және содан кейін таңдалған кластерлеу алгоритмін бұрынғыдай орындау арқылы анағұрлым орынды талдауды жүзеге асырады. Дегенмен, бір нәрсе ескерілуі керек, өйткені кез келген өлшемді азайту кезінде біз ақпаратты жоғалтамыз, сондықтан ол кластерлеуге қарсы алдын ала өлшенуі керек, тым көп дерек жоғалмас бұрын қаншалықты азайту қажет. Жоғары өлшемділік тек қашықтық өлшемдеріне ғана әсер етпейді, өйткені уақыт күрделілігі де ерекшеліктердің санымен бірге артады. k медоидтар бастапқы медоидтарды таңдауға сезімтал, өйткені олар әдетте кездейсоқ таңдалады. Мұндай медоидтардың қалай инициализациялануына байланысты k медоидтар әр түрлі жергілікті оптималарға шоғырлануы мүмкін, нәтижесінде әр түрлі кластерлер мен сапа өлшемдері пайда болады, яғни k медоидтар әр түрлі инициализациялармен бірнеше рет орындалуы керек, нәтижесінде орындалу уақыты әлдеқайда жоғары болады. Мұны тепе-теңдеудің бір жолы k medoids ++ пайдалану болып табылады, k medoids-қа балама k оның k теңдесімен ұқсас, k means ++ ықтималдық үлестіріміне негізделген бастапқы медоидтарды таңдайды, егер сіз қаласаңыз, "ақпаратты кездейсоқтық" немесе білімді болжау ретінде. Егер мұндай медоидтар осы негізде таңдалса, нәтиже - кластерлеуде жұмыс уақытының жақсаруы және жақсы өнімділік. k medoids++ алгоритмі былайша сипатталады: Бастапқы медоид барлық кеңістіктік нүктелердің арасынан кездейсоқ таңдалады. Әрбір кеңістіктік нүкте үшін p және ең жақын медиоидтар арасындағы қашықтықты есептеңіз, ол D ((p) деп аталады және барлық қашықтықты S-ке қосыңыз. Келесі медиоид салмақталған ықтималдық үлестірімін пайдалану арқылы анықталады. Нақтырақ айтқанда, нөл мен жиынтық қашықтық арасындағы кездейсоқ сан R таңдалады және сәйкес келетін кеңістіктік нүкте келесі медиод болып табылады. К-медоидтар таңдалғанға дейін (2) және (3) кезеңдер қайталанады. Медоидтар үшін бірінші таңдауды жасағанда k медоидтардың қалыпты түрін орындауға болады.
The initial medoid is chosen randomly among all of the spatial points. For each spatial point 𝑝, compute the distance between 𝑝 and the nearest medoids which is termed as D(𝑝) and sum all the distances to 𝑆 The next medoid is determined by using weighted probability distribution. Specifically, a random number 𝑅 between zero and the summed distance 𝑆 is chosen and the corresponding spatial point is the next medoid. Step (2) and Step (3) are repeated until 𝑘 medoids have been chosen. Now that we have appropriate first selections for medoids, the normal variation of k medoids can be run.