Введение

Индекс Рэнда или мера Рэнда (названная в честь Уильяма М. Рэнда) в статистике, и в частности в кластеризации данных, является мерой сходства между двумя кластерами данных. Форма индекса Рэнда может быть определена, которая корректируется для случайной группировки элементов, это корректированный индекс Рэнда. Индекс Рэнда - это точность определения принадлежности ссылки к кластеру или нет.

Связь с точностью классификации

Индекс Рэнда также можно рассматривать через призму точности бинарной классификации по парам элементов в двух классах этикеток " и находятся в одном подмножестве в и " и " и находятся в разных подмножествах в и ". В этой обстановке, число пар правильно обозначено как принадлежащие к одному и тому же подмножеству (истинные положительные), и число пар правильно обозначено как принадлежащие к разным подмножествам (истинные отрицательные).

Корректированный индекс рэнда

Корректированный индекс Рэнда - это корректированная версия индекса Рэнда с учетом случайности. Такая коррекция на случайности устанавливает исходную линию, используя ожидаемое сходство всех парных сравнений между кластерами, указанными случайной моделью. Традиционно индекс Рэнда корректировался с использованием модели пермутации для кластеров (количество и размер кластеров в кластере фиксированы, и все случайные кластеры генерируются путем перемещения элементов между фиксированными кластерами). Однако, предпосылки модели пермутации часто нарушаются; во многих сценариях кластеризации, либо количество кластеров, либо распределение размеров этих кластеров сильно различаются. Например, рассмотрим, что в K означает, что количество кластеров фиксируется практикующим специалистом, но размеры этих кластеров выводятся из данных. Изменения скорректированного индекса Рэнд учитывают различные модели случайных кластеров. Хотя индекс Рэнда может давать только значение от 0 до +1, скорректированный индекс Рэнда может давать отрицательные значения, если индекс меньше ожидаемого индекса.

Таблица непредвиденных ситуаций

При наличии множества S из n элементов и двух группировок или разделов (например, кластеров) этих элементов, а именно и , совпадение между X и Y может быть обобщено в таблице непредвиденных обстоятельств, где каждая запись обозначает количество общих объектов между и: .