Введение
Медиоды - это репрезентативные объекты набора данных или кластера в пределах набора данных, сумма несоответствий ко всем объектам в кластере которых минимальна. Медоиды похожи по своей концепции на средние или центроиды, но медоиды всегда ограничены членами набора данных. Медоиды чаще всего используются для данных, когда среднее или центроид не могут быть определены, например, для графов. Они также используются в контекстах, где центроид не является представителем набора данных, как в изображениях, 3D траекториях и экспрессии генов (где, хотя данные редки, медоид не должен быть). Они также представляют интерес при поиске представителя с использованием какого-либо расстояния, отличного от евклидовой расстояния в квадрате (например, в рейтингах фильмов). Для некоторых наборов данных может быть более одного медоида, как и в случае медиан. Общим применением медоида является алгоритм кластеризации k-медоидов, который похож на алгоритм k-средних, но работает, когда среднее или центроид не определяется. Этот алгоритм работает следующим образом. Сначала, набор медоидов выбирается случайным образом. Во-вторых, расстояния до других точек рассчитываются. В-третьих, данные кластеризуются в соответствии с медоидом, с которым они наиболее похожи. В-четвертых, множество медоидов оптимизируется с помощью итеративного процесса. Обратите внимание, что медоид не эквивалентен медиане, геометрической медиане или центроиду. Медиана определяется только на 1-мерных данных, и она только минимизирует несоответствие другим точкам для метрик, индуцированных нормой (такой как расстояние Манхэттена или расстояние Евклида). Геометрическая медиана определяется в любом измерении, но в отличие от медоида, она не обязательно является точкой из исходного набора данных.
Определение
Пусть будет множество точек в пространстве с функцией расстояния d. Медиода определяется как
Реализация
Реализацию RAND, TOPRANK и trimed можно найти здесь. Реализацию Meddit можно найти здесь и здесь. Реализацию коррелирующего последовательного удлинения можно найти здесь.
can be found here and here. An implementation of Correlated Sequential Halving
can be found here.
Медоиды в текстовой и естественной обработке языка (НЛП)
Медоиды могут применяться к различным задачам текстовой и НЛП для повышения эффективности и точности анализа. Кластеризация текстовых данных на основе сходства позволяет определить репрезентативные примеры в рамках набора данных, что приводит к лучшему пониманию и интерпретации данных.
Кластеризация текста
Кластеризация текста - это процесс группировки похожих текстов или документов вместе на основе их содержания. Алгоритмы кластеризации на основе медоида могут использоваться для разделения большого количества текста на кластеры, причем каждый кластер представлен медоидным документом. Этот метод помогает организовывать, обобщать и извлекать информацию из больших коллекций документов, например, в поисковых системах, аналитике социальных сетей и системах рекомендаций.
Резюме текста
Резюмирование текста направлено на то, чтобы создать краткое и последовательное резюме более крупного текста путем извлечения наиболее важной и релевантной информации. Кластеризация на основе медоида может использоваться для определения наиболее репрезентативных предложений в документе или группе документов, которые затем могут быть объединены для создания резюме. Этот подход особенно полезен для задач экстрактивного обобщения, где цель состоит в том, чтобы сгенерировать резюме, выбрав наиболее релевантные предложения из исходного текста.
Анализ настроений
Анализ настроений включает определение настроения или эмоции, выраженной в тексте, например, положительного, отрицательного или нейтрального. Кластеризация на основе медоидов может применяться к групповым текстовым данным, основанным на аналогичных моделях настроений. Анализируя медоид каждого кластера, исследователи могут получить представление о преобладающих настроениях кластера, помогая в таких задачах, как добыча мнений, анализ отзывов клиентов и мониторинг социальных сетей.
Моделирование темы
Моделирование темы - это метод, используемый для обнаружения абстрактных тем, которые встречаются в коллекции документов. Кластеризация на основе медоидов может применяться к групповым документам с аналогичными темами или темами. Анализируя медоиды этих кластеров, исследователи могут получить представление о основных темах в текстовом корпусе, облегчая такие задачи, как категоризация документов, анализ тенденций и рекомендации по содержанию.
Методы измерения сходства текста в кластеризации на основе медоидов
При применении к кластеризации текстовых данных на основе метода медоида необходимо выбрать подходящую меру сходства для эффективного сравнения документов. Каждый метод имеет свои преимущества и ограничения, и выбор меры сходства должен основываться на конкретных требованиях и характеристиках анализируемых текстовых данных. Ниже приведены общие методы измерения сходства текста в кластеризации на основе медоида:
Сходство косинуса
Сходство косинусов - это широко используемая мера для сравнения сходства между двумя фрагментами текста. Он вычисляет косинус угла между двумя векторами документа в пространстве высоких измерений.
Евклидово расстояние
Евклидово расстояние - стандартная метрика расстояния, используемая для измерения различия между двумя точками в многомерном пространстве. В контексте текстовых данных документы часто представляются как высокомерные векторы, такие как векторы TF, и расстояние Евклида может быть использовано для измерения различия между ними. Более низкое расстояние по Евклиду указывает на более высокую степень сходства между документами.
Методы анализа встраиваемых в большие языковые модели
Медоиды могут использоваться для анализа и понимания представлений векторного пространства, генерируемых большими языковыми моделями (LLM), такими как BERT, GPT или RoBERTa. Применяя кластерирование на основе медоида на встраиваниях, производимых этими моделями для слов, фраз или предложений, исследователи могут исследовать семантические отношения, захваченные LLM. Этот подход может помочь определить кластеры семантически похожих сущностей, предоставляя представление о структуре и организации высокомерных встраивающих пространств, генерируемых этими моделями.
Методы выбора данных и активного обучения
Активное обучение включает выбор точек данных из пула обучения, которые максимизируют производительность модели. Медоиды могут играть решающую роль в выборе данных и активном обучении с помощью LLM. Кластеризация на основе медоидов может использоваться для выявления репрезентативных и разнообразных образцов из большого текстового набора данных, которые затем могут быть использованы для более эффективной настройки LLM или создания лучших наборов обучения. Выбирая медоиды в качестве образцов обучения, исследователи могут иметь более сбалансированный и информативный набор обучения, потенциально улучшая обобщение и надежность тонко настроенных моделей.
Методы для интерпретации и безопасности модели
Применение медоидов в контексте LLM может способствовать улучшению интерпретации модели. Кластеризация встраиваний, генерируемых LLM, и выбор медоидов в качестве представителей каждого кластера позволяет исследователям обеспечить более интерпретируемое резюме поведения модели. Этот подход может помочь в понимании процесса принятия решений модели, выявлении потенциальных искажений и раскрытии основной структуры встроенных элементов LLM. Поскольку дискуссия вокруг интерпретации и безопасности LLM продолжает нарастать, использование медоидов может служить ценным инструментом для достижения этой цели.
Реальные приложения
Как универсальный метод кластеризации, медоиды могут применяться к различным проблемам реального мира в многочисленных областях, начиная от биологии и медицины до рекламы и маркетинга и социальных сетей. Его потенциал для обработки сложных наборов данных с высокой степенью запутанности делает его мощным устройством в современной аналитике данных.
Анализ экспрессии генов
При анализе экспрессии генов исследователи используют передовые технологии, состоящие из микромассивов и секвенирования РНК, для измерения уровня экспрессии многочисленных генов в биологических образцах, что приводит к получению многомерных данных, которые могут быть сложными и трудно анализируемыми. Медоиды являются потенциальным решением путем кластеризации генов, в первую очередь на основе их профилей экспрессии, что позволяет исследователям обнаруживать группы генов, которые могут предоставить ценную информацию о молекулярных механизмах биологических процессов и заболеваний.
Анализ социальных сетей
Для оценки социальной сети медоиды могут быть исключительным инструментом для распознавания центральных или влиятельных узлов в социальной сети. Исследователи могут кластеризовать узлы на основе их стилей подключения и определить узлы, которые, скорее всего, окажут существенное влияние на функцию и структуру сети. Один из популярных подходов к использованию медоидов в анализе социальных сетей - это вычисление расстояния или метрики сходства между парами узлов на основе их свойств.
Сегментация рынка
Медоиды также могут использоваться для сегментации рынка, которая является аналитической процедурой, которая включает в себя группировку клиентов, в первую очередь, на основе их покупательского поведения, демографических черт и различных других атрибутов. Кластеризация клиентов по сегментам с использованием медоидов позволяет компаниям адаптировать свои методы рекламы и маркетинга таким образом, чтобы они соответствовали потребностям каждой группы клиентов. Медоиды служат в качестве репрезентативных факторов в каждом кластере, обобщая основные характеристики клиентов в этой группе. Сумма квадратированной ошибки внутри групп (WGSS) - это формула, используемая в сегментации рынка, которая направлена на количественное определение концентрации квадратированных ошибок в кластерах. Он стремится зафиксировать распределение ошибок в группах, выровняя их в квадраты и агрегируя результаты. WGSS метрика количественно определяет сплоченность образцов в кластерах, указывая на более тесные кластеры с более низкими значениями WGSS и соответственно более высоким эффектом кластеризации. Формула WGSS: где - среднее расстояние образцов в пределах k-го кластера и число образцов в k-м кластере.
Where is the average distance of samples within the k th cluster and is the number of samples in the k th cluster.
Обнаружение аномалий
Медоиды также могут быть полезны для выявления аномалий, и одним из эффективных методов является обнаружение аномалий на основе кластеров. Они могут использоваться для обнаружения кластеров точек данных, которые значительно отклоняются от остальных данных. Кластеризация данных в группы с использованием медоидов и сравнение свойств каждого кластера с данными позволяет исследователям четко обнаруживать аномальные кластеры.
Цель
Визуализация кластеризации на основе медоида может быть полезной при попытке понять, как работает кластеризация на основе медоида. Исследования показали, что люди лучше учатся с помощью визуальной информации. В медоидном кластеризации медоид является центром кластера. Это отличается от кластеризации k-средств, где центр не является реальной точкой данных, а может лежать между точками данных. Мы используем медоид для группировки "кластеров" данных, что получается путем нахождения элемента с минимальным средним различием от всех других объектов в кластере. Хотя в примере визуализации используется кластеризация k medoids, визуализация может быть применена к кластеризации k сред, а также путем замены среднего различия со средним значением используемого набора данных.
Матрица расстояний
Для кластеризации на основе медоида требуется матрица расстояния, которая генерируется с использованием диссомолярности Джакарда (которая равна 1 индексу Джакарда). Эта матрица расстояний используется для расчета расстояния между двумя точками на одномерном графике. На изображении выше показан пример графика несовпадений Джакарда.
Медоиды в больших размерах
Общей проблемой с кластерированием к-медоидов и другими алгоритмами кластерирования на основе медоидов является "проклятие размерности", в котором точки данных содержат слишком много измерений или особенностей. По мере добавления измерений к данным расстояние между ними становится редким, и становится трудно охарактеризовать кластерирование только по евклидовому расстоянию. В результате, измерения сходства, основанные на расстоянии, сходятся на постоянной, и мы имеем характеристику расстояния между точками, которая может не отражать наш набор данных в значимых отношениях. Один из способов смягчить последствия проклятия измерений - использование спектрального кластеризации. Спектральное кластерирование достигает более подходящего анализа путем уменьшения размерности данных с использованием анализа основных компонентов, проектирования точек данных в нижнее измерение подпространства, а затем запуска выбранного алгоритма кластерирования, как и раньше. Однако следует отметить, что, как и при любом уменьшении размеров, мы теряем информацию, поэтому необходимо взвесить, сколько необходимо уменьшить, прежде чем будет потеряно слишком много данных. Однако высокая размерность не только влияет на метрику расстояния, так как временная сложность также увеличивается с количеством функций. k Медиоды чувствительны к первоначальному выбору медиодов, поскольку они обычно выбираются случайным образом. В зависимости от того, как такие медоиды инициируются, k медоиды могут сходиться к различным локальным оптималам, что приводит к различным кластерам и мерам качества, а это означает, что k медоидам может потребоваться запускать несколько раз с различными инициализациями, что приводит к гораздо более высокому времени запуска. Один из способов уравновесить это - использовать k medoids++, альтернативу k medoids, аналогичную k means, k means++ которая выбирает начальные medoids, чтобы начать с основанного на распределении вероятности, как своего рода "информированная случайность" или образованный угадывание, если вы хотите. Если такие медоиды выбираются с учетом этого обоснования, результатом является улучшение времени выполнения и лучшая производительность в кластерах. Алгоритм k medoids++ описывается следующим образом: начальный медоид выбирается случайным образом среди всех пространственных точек. Для каждой пространственной точки p вычислить расстояние между p и ближайшим медиодом, которое называется D ((p) и суммировать все расстояния до S Следующий медиод определяется с использованием взвешенного распределения вероятности. В частности, выбирается случайное число R между нулем и суммированным расстоянием S, и соответствующая пространственная точка является следующим медиодом. Шаг (2) и Шаг (3) повторяются до выбора k медоидов. Теперь, когда у нас есть соответствующие первые выборы для медоидов, можно запустить нормальную вариацию k медоидов.
The initial medoid is chosen randomly among all of the spatial points. For each spatial point 𝑝, compute the distance between 𝑝 and the nearest medoids which is termed as D(𝑝) and sum all the distances to 𝑆 The next medoid is determined by using weighted probability distribution. Specifically, a random number 𝑅 between zero and the summed distance 𝑆 is chosen and the corresponding spatial point is the next medoid. Step (2) and Step (3) are repeated until 𝑘 medoids have been chosen. Now that we have appropriate first selections for medoids, the normal variation of k medoids can be run.