Кіріспе
Деректер жиынтығында қанша түрлі тип бар? Әртүрлілік индексі – деректер жиынтығында (мысалы, популяцияда) қанша түрлі тип (мысалы, түрлер) бар екенін көрсететін сандық өлшем. Типтер арасындағы филогенетикалық байланысты ескеретін күрделірек индекстер де бар. Әртүрлілік индекстері – биологиялық әртүрліліктің түрлі аспектілерін (мысалы, байлық, тепе-теңдік және басымдық) статистикалық түрде көрсетеді, және әртүрлі популяцияларды немесе жерлерді салыстыру үшін пайдалы қарапайымдау амалдар болып табылады.
A diversity index is a quantitative measure that reflects how many different types (e. g. species) there are in a dataset (e. g. a community). More sophisticated indices accounting for the phylogenetic relatedness among the types. Diversity indices are statistical representations of different aspects of biodiversity (e. g. richness, evenness, and dominance), that are useful simplifications to compare different communities or sites.
Түрлердің нақты саны немесе Хилл саны
Экологияда әртүрлілік индекстері қолданылғанда, қызығушылықтың нысандары әдетте түрлер болып табылады, бірақ олар басқа санаттар, мысалы, туыстар, отбасылар, функционалдық типтер немесе гаплотиптер де болуы мүмкін. Зерттелетін объектілер әдетте жеке организмдер (мысалы, өсімдіктер немесе жануарлар) болып табылады, ал санының өлшемі мысалы, жеке тұлғалардың саны, биомассасы немесе жабылуы болуы мүмкін. Демографияда зерттелетін объектілер адамдар, ал қызығушылық нысандары әртүрлі демографиялық топтар болуы мүмкін. Ақпарат ғылымында объектілер әр түрлі әріптердің таңбалары мен типтері болуы мүмкін. Көптеген әртүрлілік индекстері типтердің тиімді санының қарапайым түрлендірулері болып табылады (сонымен қатар «нағыз әртүрлілік» деп те аталады), бірақ әрбір әртүрлілік индексін өз алдына нақты құбылысқа сәйкес келетін өлшем ретінде қарастыруға болады (бірақ әрбір әртүрлілік индексі үшін әртүрлі). Көптеген индекстер объектілер арасындағы санаттық әртүрлілікті ғана ескереді. Дегенмен, мұндай индекстер объектілер арасындағы жалпы өзгергіштікті (әртүрлілікті) ескермейді, ол тек категориялық және сапалық әртүрлілік есептелген кезде ғана пайда болады. Нағыз әртүрлілік немесе типтердің тиімді саны – зерттелетін деректер жиынтығында байқалған типтердің орташа пропорционалдық санына тең болуы үшін қажетті бірдей пропорционалдық саны бар типтердің саны. Деректер жиынтығындағы нағыз әртүрлілік алдымен деректер жиынтығындағы типтердің пропорционалдық санының Mq−1 салмақталған жалпыланған ортасын есептеу арқылы, содан кейін оның кері шамасын алу арқылы есептеледі. Теңдеу: , жоғарыдағы теңдеу белгісіз. Алайда, q 1-ге жақындағандағы математикалық лимит анықталған және сәйкес әртүрлілік келесі теңдеумен есептеледі: ол табиғи логарифмдермен есептелген Шеннон энтропиясының экспонентасы (жоғарыда қараңыз). Басқа салаларда бұл статистика түсініксіздік деп те аталады. Әртүрліліктің жалпы теңдеуі көбінесе мынадай түрде жазылады: Егер нағыз әртүрлілік есептелсе, типтердің тиімді саны (^(0)D) типтердің нақты санына тең болады, ол байлыққа (R) сәйкес келеді. Бұл өлшемді 1948 жылы Клод Шеннон мәтіннің тізбектеріндегі энтропияны (осыдан Шеннон энтропиясы, Шеннон ақпараттық мазмұнымен байланысты) өлшеу үшін ұсынған. Идеясы мынада: әріптердің саны неғұрлым көп болса және олардың пропорционалдық саны қызығушылық тудыратын тізбекте жақын болса, тізбекте келесі әріпті дұрыс болжау соғұрлым қиын. Шеннон энтропиясы осы болжаумен байланысты белгісіздікті (энтропия немесе таңғалу дәрежесі) өлшеуге мүмкіндік береді. Ол көбінесе келесідей есептеледі: мұнда pi – қызығушылық тудыратын тізбектегі i-ші типке жататын әріптердің үлесі. Экологияда pi – қызығушылық тудыратын деректер жиынтығындағы i-ші түрге жататын жеке тұлғалардың үлесі. Содан кейін Шеннон энтропиясы деректер жиынтығынан кездейсоқ алынған жеке тұлғаның түр сәйкестігін болжаудағы белгісіздікті өлшеуге мүмкіндік береді. Бұл жерде теңдеу табиғи логарифмдермен жазылғанмен, Шеннон энтропиясын есептеу кезінде қолданылатын логарифмнің негізін еркін таңдауға болады. Шеннон өзі логарифмдік негіздерді 2, 10 және e талқылады, содан бері олар Шеннон энтропиясын қолданатын қолданбаларда ең танымал негіздерге айналды. Әрбір логарифмдік негіз әр түрлі өлшем бірлігіне сәйкес келеді, ол сәйкесінше 2, 10 және e негіздері үшін екілік сандар (бит), ондық сандар (децит) және табиғи сандар (нат) деп аталады. Алғашқыда әр түрлі логарифм негіздерімен есептелген Шеннон энтропиясының мәндерін салыстыру оларды бірдей логарифм негіздеріне аударуды талап етеді: a негізінен b негізіне ауысу logba еселеу арқылы алынады. Сол индексті 1950 жылы Орис С. Херфиндал қайтадан тапты. Индекстің квадраттық түбірін 1945 жылы экономист Альберт О. Хиршман енгізген болатын. Нәтижесінде, сол өлшем әдетте экологияда Симпсон индексі, ал экономикада Герфиндал индексі немесе Герфиндал-Хиршман индексі (ХХИ) ретінде белгілі. Өлшем зерттелетін деректер жиынтығынан кездейсоқ алынған екі объектінің бірдей типті білдіру ықтималдығына тең. Типтердің орташа пропорционалдық саны типтердің саны азайып, ең көп таралған типтің саны артуымен өседі, сондықтан λ жоғары әртүрлілік дерек жиынтықтарында кіші мәндерді және төмен әртүрлілік дерек жиынтықтарында үлкен мәндерді алады. Бұл әртүрлілік индексі үшін интуицияға қайшы әрекет, сондықтан жиі, әртүрліліктің өсуімен өсетін λ түрлендірулері қолданылады. Мұндай индекстердің ең танымалдары – кері Симпсон индексі (1/λ) және Гини-Симпсон индексі (1 − λ). Машиналық оқу саласында. Симпсоннің бастапқы индексі λ зерттелетін деректер жиынтығынан (қайта алмастыру арқылы) кездейсоқ алынған екі объектінің бірдей типті білдіру ықтималдығына тең. Оның түрлендірілуі 1 − λ, демек, екі объектінің әртүрлі типті білдіру ықтималдығына тең. Бұл өлшем экологияда түрлер аралық кездесу ықтималдығы (PIE) және Гини-Симпсон индексі ретінде де белгілі. Бұл сонымен қатар Блау индексі деп те аталады, Гини-Симпсон индексімен бірдей. Бұл шама популяциялық генетикада күтілетін гетерозиготность деп те аталады.
When , the above equation is undefined. However, the mathematical limit as q approaches 1 is well defined and the corresponding diversity is calculated with the following equation:
which is the exponential of the Shannon entropy calculated with natural logarithms (see above). In other domains, this statistic is also known as the perplexity. The general equation of diversity is often written in the form If true diversity is calculated with , the effective number of types (^(0)D) equals the actual number of types, which is identical to Richness (R). The measure was originally proposed by Claude Shannon in 1948 to quantify the entropy (hence Shannon entropy, related to Shannon information content) in strings of text. The idea is that the more letters there are, and the closer their proportional abundances in the string of interest, the more difficult it is to correctly predict which letter will be the next one in the string. The Shannon entropy quantifies the uncertainty (entropy or degree of surprise) associated with this prediction. It is most often calculated as follows:
where pi is the proportion of characters belonging to the ith type of letter in the string of interest. In ecology, pi is often the proportion of individuals belonging to the ith species in the dataset of interest. Then the Shannon entropy quantifies the uncertainty in predicting the species identity of an individual that is taken at random from the dataset. Although the equation is here written with natural logarithms, the base of the logarithm used when calculating the Shannon entropy can be chosen freely. Shannon himself discussed logarithm bases 2, 10 and e, and these have since become the most popular bases in applications that use the Shannon entropy. Each log base corresponds to a different measurement unit, which has been called binary digits (bits), decimal digits (decits), and natural digits (nats) for the bases 2, 10 and e, respectively. Comparing Shannon entropy values that were originally calculated with different log bases requires converting them to the same log base: change from the base a to base b is obtained with multiplication by logba. The same index was rediscovered by Orris C. Herfindahl in 1950. The square root of the index had already been introduced in 1945 by the economist Albert O. Hirschman. As a result, the same measure is usually known as the Simpson index in ecology, and as the Herfindahl index or the Herfindahl–Hirschman index (HHI) in economics. The measure equals the probability that two entities taken at random from the dataset of interest represent the same type. Since the mean proportional abundance of the types increases with decreasing number of types and increasing abundance of the most abundant type, λ obtains small values in datasets of high diversity and large values in datasets of low diversity. This is counterintuitive behavior for a diversity index, so often, such transformations of λ that increase with increasing diversity have been used instead. The most popular of such indices have been the inverse Simpson index (1/λ) and the Gini–Simpson index (1 − λ). in the field of Machine Learning. The original Simpson index λ equals the probability that two entities taken at random from the dataset of interest (with replacement) represent the same type. Its transformation 1 − λ, therefore, equals the probability that the two entities represent different types. This measure is also known in ecology as the probability of interspecific encounter (PIE) and the Gini–Simpson index. which is also known as the Blau index, is the same measure as the Gini–Simpson index. The quantity is also known as the expected heterozygosity in population genetics.
Бергер-Паркер индексі
Бергер-Паркер индексі деректер жиынтығындағы ең жоғары пи мәніне тең, яғни ең көп кездесетін түрдің пропорционалдық мөлшеріне тең. Бұл, q шексіздікке жақындағандағы пи мәндерінің салмақталған жалпыланған орташасына сәйкес келеді, демек шексіз реттің нақты әртүрлілігінің кері шамасына (1/^(∞)D) тең.