Введение
Сколько различных типов содержится в наборе данных?
Индекс разнообразия — это количественная мера, отражающая количество различных типов (например, видов) в наборе данных (например, в сообществе). Более сложные индексы учитывают филогенетическое родство между типами. Индексы разнообразия — это статистические показатели, представляющие различные аспекты биоразнообразия (например, видовое богатство, равномерность и доминирование), которые служат полезными упрощениями для сравнения различных сообществ или участков.
Фактическое количество видов или количество холмов
Когда индексы разнообразия используются в экологии, типы интереса обычно представляют собой виды, но они также могут быть другими категориями, такими как роды, семейства, функциональные типы или гаплотипы. Объектами интереса обычно являются отдельные организмы (например, растения или животные), а мера численности может быть, например, число особей, биомасса или покрытие. В демографии объектами интереса могут быть люди, а типами интереса – различные демографические группы. В информатике объектами могут быть символы, а типами – различные буквы алфавита. Наиболее часто используемые индексы разнообразия представляют собой простые преобразования эффективного числа типов (также известные как «истинное разнообразие»), но каждый индекс разнообразия также может быть интерпретирован сам по себе как мера, соответствующая некоторому реальному явлению (но различному для каждого индекса разнообразия). Многие индексы учитывают только категориальное разнообразие между объектами или сущностями. Однако такие индексы не учитывают общую вариацию (разнообразие), которая может существовать между объектами или сущностями и возникает только при расчете как категориального, так и качественного разнообразия. Истинное разнообразие, или эффективное число типов, относится к числу одинаково распространенных типов, необходимых для того, чтобы средняя пропорциональная численность типов была равна наблюдаемой в интересующем наборе данных (где все типы могут быть не одинаково распространены). Истинное разнообразие в наборе данных рассчитывается путем вычисления сначала взвешенного обобщенного среднего Mq−1 пропорциональной численности типов в наборе данных, а затем взятия обратной величины этого среднего. Уравнение:
Когда , вышеуказанное уравнение не определено. Однако математический предел при q, стремящемся к 1, хорошо определен, и соответствующее разнообразие рассчитывается следующим уравнением:
которое является экспонентой энтропии Шеннона, рассчитанной с использованием натуральных логарифмов (см. выше). В других областях эта статистика также известна как перплексия. Общее уравнение разнообразия часто записывается в форме Если истинное разнообразие рассчитывается с , эффективное число типов (^(0)D) равно фактическому числу типов, что идентично показателю богатства видов (R). Эта мера была первоначально предложена Клодом Шенноном в 1948 году для количественной оценки энтропии (отсюда энтропия Шеннона, связанная с информационным содержанием Шеннона) в строках текста. Идея заключается в том, что чем больше букв и чем ближе их пропорциональная численность в интересующей строке, тем сложнее правильно предсказать, какая буква будет следующей в строке. Энтропия Шеннона количественно определяет неопределенность (энтропию или степень удивления), связанную с этим прогнозом. Чаще всего она вычисляется следующим образом:
где pi – доля символов, принадлежащих к i-му типу букв в интересующей строке. В экологии pi часто является долей особей, принадлежащих к i-му виду в интересующем наборе данных. Тогда энтропия Шеннона количественно определяет неопределенность в прогнозировании видовой принадлежности особи, взятой случайным образом из набора данных. Хотя уравнение здесь написано с использованием натуральных логарифмов, основание логарифма, используемого при расчете энтропии Шеннона, может быть выбрано свободно. Сам Шеннон обсуждал логарифмические основания 2, 10 и e, и с тех пор они стали самыми популярными основаниями в приложениях, использующих энтропию Шеннона. Каждое логарифмическое основание соответствует различной единице измерения, которая называется битами (для основания 2), децитами (для основания 10) и натами (для основания e) соответственно. Сравнение значений энтропии Шеннона, которые первоначально рассчитывались с использованием различных логарифмических оснований, требует их преобразования в одно и то же логарифмическое основание: переход от основания a к основанию b достигается умножением на logba. Тот же индекс был вновь открыт Оррисом С. Херфиндалем в 1950 году. Квадратный корень из индекса был введен в 1945 году экономистом Альбертом О. Хиршманом. В результате эта же мера обычно известна как индекс Симпсона в экологии и как индекс Херфиндала или индекс Херфиндала — Хиршмана (HHI) в экономике. Эта мера равна вероятности того, что два объекта, выбранные случайным образом из интересующего набора данных, представляют один и тот же тип. Поскольку средняя пропорциональная численность типов увеличивается с уменьшением числа типов и увеличением численности наиболее распространенного типа, λ принимает малые значения в наборах данных с высоким разнообразием и большие значения в наборах данных с низким разнообразием. Это неинтуитивное поведение для индекса разнообразия, поэтому часто используются преобразования λ, которые увеличиваются с увеличением разнообразия. Наиболее популярными из таких индексов являются обратный индекс Симпсона (1/λ) и индекс Гини — Симпсона (1 − λ). в области машинного обучения. Оригинальный индекс Симпсона λ равен вероятности того, что два объекта, выбранные случайным образом из интересующего набора данных (с возвращением), представляют один и тот же тип. Его преобразование 1 − λ, следовательно, равно вероятности того, что два объекта представляют разные типы. Эта мера также известна в экологии как вероятность межвидовой встречи (PIE) и индекс Гини — Симпсона. , также известная как индекс Блау, является той же мерой, что и индекс Гини — Симпсона. Эта величина также известна как ожидаемая гетерозиготность в популяционной генетике.
Индекс Бергера-Паркера
Индекс Бергера-Паркера равен максимальному значению pi в наборе данных, то есть пропорциональной численности наиболее распространенного типа. Это соответствует взвешенному обобщенному среднему значений pi при q, стремящемся к бесконечности, и, следовательно, равно обратному значению истинного разнообразия порядка бесконечности (1/D<sub>∞</sub>).