Введение
Реальнозначная функция, которая количественно определяет степень сходства между двумя объектами.
В статистике и смежных областях мера сходства, функция сходства или метрика сходства – это реальнозначная функция, которая количественно определяет степень сходства между двумя объектами. Хотя единого определения сходства не существует, как правило, такие меры в некотором смысле являются обратными метрикам расстояния: они принимают большие значения для схожих объектов и нулевые или отрицательные значения для сильно различающихся объектов. Однако, в более широком смысле, функция сходства может также удовлетворять аксиомам метрики. Косинусное сходство – это часто используемая мера сходства для реальнозначных векторов, применяемая, в частности, в информационном поиске для оценки сходства документов в векторной модели пространства. В машинном обучении, распространенные функции ядра, такие как RBF-ядро, можно рассматривать как функции сходства.
Использование в кластерах
Кластеризация или кластерный анализ – это метод интеллектуального анализа данных, который используется для выявления закономерностей в данных путем группировки схожих объектов. Он включает в себя разделение набора точек данных на группы или кластеры на основе их сходства. Один из фундаментальных аспектов кластеризации – это способ измерения сходства между точками данных. Меры сходства играют решающую роль во многих методах кластеризации, поскольку они используются для определения степени взаимосвязанности двух точек данных и необходимости их объединения в один кластер. Меры сходства могут принимать различные формы в зависимости от типа кластеризуемых данных и решаемой задачи. Одной из наиболее часто используемых мер сходства является евклидово расстояние, которое применяется во многих методах кластеризации, включая k-средних и иерархическую кластеризацию. Евклидово расстояние – это мера расстояния по прямой между двумя точками в многомерном пространстве. Оно вычисляется как квадратный корень из суммы квадратов разностей соответствующих координат двух точек. Например, если у нас есть две точки данных и , то евклидово расстояние между ними равно .
Another commonly used similarity measure is the Jaccard index or Jaccard similarity, which is used in clustering techniques that work with binary data such as presence/absence data or Boolean data; The Jaccard similarity is particularly useful for clustering techniques that work with text data, where it can be used to identify clusters of similar documents based on their shared features or keywords. It is calculated as the size of the intersection of two sets divided by the size of the union of the two sets. Similarities among 162 Relevant Nuclear Profile are tested using the Jaccard Similarity measure (see figure with heatmap). The Jaccard similarity of the nuclear profile ranges from 0 to 1, with 0 indicating no similarity between the two sets and 1 indicating perfect similarity with the aim of clustering the most similar nuclear profile. Manhattan distance, also known as Taxicab geometry, is a commonly used similarity measure in clustering techniques that work with continuous data. It is a measure of the distance between two data points in a high dimensional space, calculated as the sum of the absolute differences between the corresponding coordinates of the two points. In spectral clustering, a similarity, or affinity, measure is used to transform data to overcome difficulties related to lack of convexity in the shape of the data distribution. The measure gives rise to an sized for a set of n points, where the entry in the matrix can be simply the (reciprocal of the) Euclidean distance between and , or it can be a more complex measure of distance such as the Gaussian
The choice of similarity measure depends on the type of data being clustered and the specific problem being solved. For example, working with continuous data such as gene expression data, the Euclidean distance or cosine similarity may be appropriate. If working with binary data such as the presence of a genomic loci in a nuclear profile, the Jaccard index may be more appropriate. Lastly, working with data that is arranged in a grid or lattice structure, such as image or signal processing data, the Manhattan distance is particularly useful for the clustering.
Другой часто используемой мерой сходства является индекс Жаккара или сходство Жаккара, который применяется в методах кластеризации, работающих с бинарными данными, такими как данные о наличии/отсутствии или булевы данные. Сходство Жаккара особенно полезно для методов кластеризации, работающих с текстовыми данными, где оно может использоваться для выявления кластеров схожих документов на основе общих признаков или ключевых слов. Оно вычисляется как отношение размера пересечения двух множеств к размеру их объединения. Сходство между 162 релевантными ядерными профилями оценивается с использованием меры сходства Жаккара (см. рисунок с тепловой картой). Сходство Жаккара ядерных профилей варьируется от 0 до 1, где 0 указывает на отсутствие сходства между двумя наборами, а 1 – на полное сходство, с целью кластеризации наиболее схожих ядерных профилей. Расстояние Манхэттена, также известное как таксиметрическая геометрия, является часто используемой мерой сходства в методах кластеризации, работающих с непрерывными данными. Это мера расстояния между двумя точками данных в многомерном пространстве, вычисляемая как сумма абсолютных разностей соответствующих координат двух точек. В спектральной кластеризации мера сходства или аффинности используется для преобразования данных и преодоления трудностей, связанных с отсутствием выпуклости в форме распределения данных. Эта мера создает матрицу размера для набора из n точек, где элемент в матрице может быть просто (обратной величиной) евклидова расстояния между и , или более сложной мерой расстояния, такой как гауссовская.
Another commonly used similarity measure is the Jaccard index or Jaccard similarity, which is used in clustering techniques that work with binary data such as presence/absence data or Boolean data; The Jaccard similarity is particularly useful for clustering techniques that work with text data, where it can be used to identify clusters of similar documents based on their shared features or keywords. It is calculated as the size of the intersection of two sets divided by the size of the union of the two sets. Similarities among 162 Relevant Nuclear Profile are tested using the Jaccard Similarity measure (see figure with heatmap). The Jaccard similarity of the nuclear profile ranges from 0 to 1, with 0 indicating no similarity between the two sets and 1 indicating perfect similarity with the aim of clustering the most similar nuclear profile. Manhattan distance, also known as Taxicab geometry, is a commonly used similarity measure in clustering techniques that work with continuous data. It is a measure of the distance between two data points in a high dimensional space, calculated as the sum of the absolute differences between the corresponding coordinates of the two points. In spectral clustering, a similarity, or affinity, measure is used to transform data to overcome difficulties related to lack of convexity in the shape of the data distribution. The measure gives rise to an sized for a set of n points, where the entry in the matrix can be simply the (reciprocal of the) Euclidean distance between and , or it can be a more complex measure of distance such as the Gaussian
The choice of similarity measure depends on the type of data being clustered and the specific problem being solved. For example, working with continuous data such as gene expression data, the Euclidean distance or cosine similarity may be appropriate. If working with binary data such as the presence of a genomic loci in a nuclear profile, the Jaccard index may be more appropriate. Lastly, working with data that is arranged in a grid or lattice structure, such as image or signal processing data, the Manhattan distance is particularly useful for the clustering.
Выбор меры сходства зависит от типа кластеризуемых данных и решаемой задачи. Например, при работе с непрерывными данными, такими как данные об экспрессии генов, могут быть уместны евклидово расстояние или косинусное сходство. Если работа ведется с бинарными данными, такими как наличие геномного локуса в ядерном профиле, индекс Жаккара может быть более подходящим. Наконец, при работе с данными, организованными в виде сетки или решетки, например, данными обработки изображений или сигналов, расстояние Манхэттена особенно полезно для кластеризации.
Another commonly used similarity measure is the Jaccard index or Jaccard similarity, which is used in clustering techniques that work with binary data such as presence/absence data or Boolean data; The Jaccard similarity is particularly useful for clustering techniques that work with text data, where it can be used to identify clusters of similar documents based on their shared features or keywords. It is calculated as the size of the intersection of two sets divided by the size of the union of the two sets. Similarities among 162 Relevant Nuclear Profile are tested using the Jaccard Similarity measure (see figure with heatmap). The Jaccard similarity of the nuclear profile ranges from 0 to 1, with 0 indicating no similarity between the two sets and 1 indicating perfect similarity with the aim of clustering the most similar nuclear profile. Manhattan distance, also known as Taxicab geometry, is a commonly used similarity measure in clustering techniques that work with continuous data. It is a measure of the distance between two data points in a high dimensional space, calculated as the sum of the absolute differences between the corresponding coordinates of the two points. In spectral clustering, a similarity, or affinity, measure is used to transform data to overcome difficulties related to lack of convexity in the shape of the data distribution. The measure gives rise to an sized for a set of n points, where the entry in the matrix can be simply the (reciprocal of the) Euclidean distance between and , or it can be a more complex measure of distance such as the Gaussian
The choice of similarity measure depends on the type of data being clustered and the specific problem being solved. For example, working with continuous data such as gene expression data, the Euclidean distance or cosine similarity may be appropriate. If working with binary data such as the presence of a genomic loci in a nuclear profile, the Jaccard index may be more appropriate. Lastly, working with data that is arranged in a grid or lattice structure, such as image or signal processing data, the Manhattan distance is particularly useful for the clustering.
Использование в системах рекомендаций
Меры сходства используются для разработки систем рекомендаций. Они анализируют восприятие пользователем и его предпочтения относительно нескольких объектов. В системах рекомендаций метод использует вычисление расстояния, например, или , для создания матрицы со значениями, представляющими степень сходства между любой парой объектов. Затем, анализируя и сравнивая значения в этой матрице, можно сопоставить объекты с предпочтениями пользователя или связать пользователей на основе их оценок. В данной системе важно учитывать как само значение, так и абсолютную разницу между двумя значениями. Сбор этих данных позволяет оценить вероятность того, что оценка понравится пользователю, а также степень взаимного сходства или неприятия двух оценок. На основе этого можно рекомендовать пользователю объекты, обладающие высокой степенью сходства с его предпочтениями. Системы рекомендаций широко используются на различных онлайн-развлекательных платформах, в социальных сетях и на стриминговых сайтах. Логика построения этих систем основана на мерах сходства.
Использование в выравнивании последовательности
Матрицы сходства используются при выравнивании последовательностей. Более высокие баллы присваиваются более похожим символам, а более низкие или отрицательные баллы – непохожим символам. Матрицы сходства нуклеотидов используются для выравнивания последовательностей нуклеиновых кислот. Поскольку в ДНК обычно встречается только четыре нуклеотида (аденин (A), цитозин (C), гуанин (G) и тимин (T)), матрицы сходства нуклеотидов намного проще, чем матрицы сходства белков. Например, простая матрица присваивает идентичным основаниям балл +1, а неидентичным – балл -1. Более сложная матрица присваивает более высокий балл транзициям (изменения от пиримидина, такого как C или T, к другому пиримидину, или от пурина, такого как A или G, к другому пурину), чем трансверсиям (от пиримидина к пурину или наоборот). Соотношение совпадений к несовпадениям в матрице определяет целевое эволюционное расстояние. Матрица +1/−3 ДНК, используемая BLASTN, лучше всего подходит для поиска совпадений между последовательностями, которые на 99% идентичны; матрица +1/−1 (или +4/−4) гораздо лучше подходит для последовательностей с примерно 70% сходством. Матрицы для последовательностей с меньшей степенью сходства требуют более длинных выравниваний. Матрицы сходства аминокислот более сложны, поскольку существует 20 аминокислот, кодируемых генетическим кодом, и, следовательно, большее количество возможных замен. Поэтому матрица сходства для аминокислот содержит 400 элементов (хотя обычно она симметрична). Первоначально все изменения аминокислот оценивались одинаково. Позднее было усовершенствовано определение сходства аминокислот на основе количества изменений оснований, необходимых для изменения кодона, кодирующего эту аминокислоту. Эта модель лучше, но она не учитывает селективное давление, оказываемое на изменения аминокислот. Более совершенные модели учитывали химические свойства аминокислот. Одним из подходов было эмпирическое построение матриц сходства. Метод Дэйхоффа использовал филогенетические деревья и последовательности, взятые из видов, представленных на дереве. Этот подход привел к созданию серии матриц PAM. Матрицы PAM маркируются в зависимости от количества изменений нуклеотидов, произошедших на 100 аминокислот. Хотя матрицы PAM выигрывают от наличия хорошо понятной эволюционной модели, они наиболее полезны на небольших эволюционных расстояниях (PAM10–PAM120). На больших эволюционных расстояниях, например, PAM250 или при 20% идентичности, было показано, что матрицы BLOSUM гораздо эффективнее. Серия BLOSUM была получена путем сравнения ряда дивергентных последовательностей. Серии BLOSUM обозначаются в зависимости от количества энтропии, которая остается неизменной между всеми последовательностями, поэтому более низкое число BLOSUM соответствует более высокому числу PAM.