Введение
Индекс Рэнда или мера Рэнда (названная в честь Уильяма М. Рэнда) в статистике, и в частности в кластеризации данных, является мерой сходства между двумя кластерами данных. Форма индекса Рэнда может быть определена, которая корректируется для случайной группировки элементов, это корректированный индекс Рэнда. Индекс Рэнда - это точность определения принадлежности ссылки к кластеру или нет.
The Rand index or Rand measure (named after William M. Rand) in statistics, and in particular in data clustering, is a measure of the similarity between two data clusterings. A form of the Rand index may be defined that is adjusted for the chance grouping of elements, this is the adjusted Rand index. The Rand index is the accuracy of determining if a link belongs within a cluster or not.
Связь с точностью классификации
Индекс Рэнда также можно рассматривать через призму точности бинарной классификации по парам элементов в двух классах этикеток " и находятся в одном подмножестве в и " и " и находятся в разных подмножествах в и ". В этой обстановке, число пар правильно обозначено как принадлежащие к одному и тому же подмножеству (истинные положительные), и число пар правильно обозначено как принадлежащие к разным подмножествам (истинные отрицательные).
Корректированный индекс рэнда
Корректированный индекс Рэнда - это корректированная версия индекса Рэнда с учетом случайности. Такая коррекция на случайности устанавливает исходную линию, используя ожидаемое сходство всех парных сравнений между кластерами, указанными случайной моделью. Традиционно индекс Рэнда корректировался с использованием модели пермутации для кластеров (количество и размер кластеров в кластере фиксированы, и все случайные кластеры генерируются путем перемещения элементов между фиксированными кластерами). Однако, предпосылки модели пермутации часто нарушаются; во многих сценариях кластеризации, либо количество кластеров, либо распределение размеров этих кластеров сильно различаются. Например, рассмотрим, что в K означает, что количество кластеров фиксируется практикующим специалистом, но размеры этих кластеров выводятся из данных. Изменения скорректированного индекса Рэнд учитывают различные модели случайных кластеров. Хотя индекс Рэнда может давать только значение от 0 до +1, скорректированный индекс Рэнда может давать отрицательные значения, если индекс меньше ожидаемого индекса.
Таблица непредвиденных ситуаций
При наличии множества S из n элементов и двух группировок или разделов (например, кластеров) этих элементов, а именно и , совпадение между X и Y может быть обобщено в таблице непредвиденных обстоятельств, где каждая запись обозначает количество общих объектов между и: .