Введение

Реальнозначная функция, которая количественно определяет степень сходства между двумя объектами.

В статистике и смежных областях мера сходства, функция сходства или метрика сходства – это реальнозначная функция, которая количественно определяет степень сходства между двумя объектами. Хотя единого определения сходства не существует, как правило, такие меры в некотором смысле являются обратными метрикам расстояния: они принимают большие значения для схожих объектов и нулевые или отрицательные значения для сильно различающихся объектов. Однако, в более широком смысле, функция сходства может также удовлетворять аксиомам метрики. Косинусное сходство – это часто используемая мера сходства для реальнозначных векторов, применяемая, в частности, в информационном поиске для оценки сходства документов в векторной модели пространства. В машинном обучении, распространенные функции ядра, такие как RBF-ядро, можно рассматривать как функции сходства.

Использование в кластерах

Кластеризация или кластерный анализ – это метод интеллектуального анализа данных, который используется для выявления закономерностей в данных путем группировки схожих объектов. Он включает в себя разделение набора точек данных на группы или кластеры на основе их сходства. Один из фундаментальных аспектов кластеризации – это способ измерения сходства между точками данных. Меры сходства играют решающую роль во многих методах кластеризации, поскольку они используются для определения степени взаимосвязанности двух точек данных и необходимости их объединения в один кластер. Меры сходства могут принимать различные формы в зависимости от типа кластеризуемых данных и решаемой задачи. Одной из наиболее часто используемых мер сходства является евклидово расстояние, которое применяется во многих методах кластеризации, включая k-средних и иерархическую кластеризацию. Евклидово расстояние – это мера расстояния по прямой между двумя точками в многомерном пространстве. Оно вычисляется как квадратный корень из суммы квадратов разностей соответствующих координат двух точек. Например, если у нас есть две точки данных и , то евклидово расстояние между ними равно .

Другой часто используемой мерой сходства является индекс Жаккара или сходство Жаккара, который применяется в методах кластеризации, работающих с бинарными данными, такими как данные о наличии/отсутствии или булевы данные. Сходство Жаккара особенно полезно для методов кластеризации, работающих с текстовыми данными, где оно может использоваться для выявления кластеров схожих документов на основе общих признаков или ключевых слов. Оно вычисляется как отношение размера пересечения двух множеств к размеру их объединения. Сходство между 162 релевантными ядерными профилями оценивается с использованием меры сходства Жаккара (см. рисунок с тепловой картой). Сходство Жаккара ядерных профилей варьируется от 0 до 1, где 0 указывает на отсутствие сходства между двумя наборами, а 1 – на полное сходство, с целью кластеризации наиболее схожих ядерных профилей. Расстояние Манхэттена, также известное как таксиметрическая геометрия, является часто используемой мерой сходства в методах кластеризации, работающих с непрерывными данными. Это мера расстояния между двумя точками данных в многомерном пространстве, вычисляемая как сумма абсолютных разностей соответствующих координат двух точек. В спектральной кластеризации мера сходства или аффинности используется для преобразования данных и преодоления трудностей, связанных с отсутствием выпуклости в форме распределения данных. Эта мера создает матрицу размера для набора из n точек, где элемент в матрице может быть просто (обратной величиной) евклидова расстояния между и , или более сложной мерой расстояния, такой как гауссовская.

Выбор меры сходства зависит от типа кластеризуемых данных и решаемой задачи. Например, при работе с непрерывными данными, такими как данные об экспрессии генов, могут быть уместны евклидово расстояние или косинусное сходство. Если работа ведется с бинарными данными, такими как наличие геномного локуса в ядерном профиле, индекс Жаккара может быть более подходящим. Наконец, при работе с данными, организованными в виде сетки или решетки, например, данными обработки изображений или сигналов, расстояние Манхэттена особенно полезно для кластеризации.

Использование в системах рекомендаций

Меры сходства используются для разработки систем рекомендаций. Они анализируют восприятие пользователем и его предпочтения относительно нескольких объектов. В системах рекомендаций метод использует вычисление расстояния, например, или , для создания матрицы со значениями, представляющими степень сходства между любой парой объектов. Затем, анализируя и сравнивая значения в этой матрице, можно сопоставить объекты с предпочтениями пользователя или связать пользователей на основе их оценок. В данной системе важно учитывать как само значение, так и абсолютную разницу между двумя значениями. Сбор этих данных позволяет оценить вероятность того, что оценка понравится пользователю, а также степень взаимного сходства или неприятия двух оценок. На основе этого можно рекомендовать пользователю объекты, обладающие высокой степенью сходства с его предпочтениями. Системы рекомендаций широко используются на различных онлайн-развлекательных платформах, в социальных сетях и на стриминговых сайтах. Логика построения этих систем основана на мерах сходства.

Использование в выравнивании последовательности

Матрицы сходства используются при выравнивании последовательностей. Более высокие баллы присваиваются более похожим символам, а более низкие или отрицательные баллы – непохожим символам. Матрицы сходства нуклеотидов используются для выравнивания последовательностей нуклеиновых кислот. Поскольку в ДНК обычно встречается только четыре нуклеотида (аденин (A), цитозин (C), гуанин (G) и тимин (T)), матрицы сходства нуклеотидов намного проще, чем матрицы сходства белков. Например, простая матрица присваивает идентичным основаниям балл +1, а неидентичным – балл -1. Более сложная матрица присваивает более высокий балл транзициям (изменения от пиримидина, такого как C или T, к другому пиримидину, или от пурина, такого как A или G, к другому пурину), чем трансверсиям (от пиримидина к пурину или наоборот). Соотношение совпадений к несовпадениям в матрице определяет целевое эволюционное расстояние. Матрица +1/−3 ДНК, используемая BLASTN, лучше всего подходит для поиска совпадений между последовательностями, которые на 99% идентичны; матрица +1/−1 (или +4/−4) гораздо лучше подходит для последовательностей с примерно 70% сходством. Матрицы для последовательностей с меньшей степенью сходства требуют более длинных выравниваний. Матрицы сходства аминокислот более сложны, поскольку существует 20 аминокислот, кодируемых генетическим кодом, и, следовательно, большее количество возможных замен. Поэтому матрица сходства для аминокислот содержит 400 элементов (хотя обычно она симметрична). Первоначально все изменения аминокислот оценивались одинаково. Позднее было усовершенствовано определение сходства аминокислот на основе количества изменений оснований, необходимых для изменения кодона, кодирующего эту аминокислоту. Эта модель лучше, но она не учитывает селективное давление, оказываемое на изменения аминокислот. Более совершенные модели учитывали химические свойства аминокислот. Одним из подходов было эмпирическое построение матриц сходства. Метод Дэйхоффа использовал филогенетические деревья и последовательности, взятые из видов, представленных на дереве. Этот подход привел к созданию серии матриц PAM. Матрицы PAM маркируются в зависимости от количества изменений нуклеотидов, произошедших на 100 аминокислот. Хотя матрицы PAM выигрывают от наличия хорошо понятной эволюционной модели, они наиболее полезны на небольших эволюционных расстояниях (PAM10–PAM120). На больших эволюционных расстояниях, например, PAM250 или при 20% идентичности, было показано, что матрицы BLOSUM гораздо эффективнее. Серия BLOSUM была получена путем сравнения ряда дивергентных последовательностей. Серии BLOSUM обозначаются в зависимости от количества энтропии, которая остается неизменной между всеми последовательностями, поэтому более низкое число BLOSUM соответствует более высокому числу PAM.