Кіріспе

Деректер жиынтығында қанша түрлі тип бар? Әртүрлілік индексі – деректер жиынтығында (мысалы, популяцияда) қанша түрлі тип (мысалы, түрлер) бар екенін көрсететін сандық өлшем. Типтер арасындағы филогенетикалық байланысты ескеретін күрделірек индекстер де бар. Әртүрлілік индекстері – биологиялық әртүрліліктің түрлі аспектілерін (мысалы, байлық, тепе-теңдік және басымдық) статистикалық түрде көрсетеді, және әртүрлі популяцияларды немесе жерлерді салыстыру үшін пайдалы қарапайымдау амалдар болып табылады.

Түрлердің нақты саны немесе Хилл саны

Экологияда әртүрлілік индекстері қолданылғанда, қызығушылықтың нысандары әдетте түрлер болып табылады, бірақ олар басқа санаттар, мысалы, туыстар, отбасылар, функционалдық типтер немесе гаплотиптер де болуы мүмкін. Зерттелетін объектілер әдетте жеке организмдер (мысалы, өсімдіктер немесе жануарлар) болып табылады, ал санының өлшемі мысалы, жеке тұлғалардың саны, биомассасы немесе жабылуы болуы мүмкін. Демографияда зерттелетін объектілер адамдар, ал қызығушылық нысандары әртүрлі демографиялық топтар болуы мүмкін. Ақпарат ғылымында объектілер әр түрлі әріптердің таңбалары мен типтері болуы мүмкін. Көптеген әртүрлілік индекстері типтердің тиімді санының қарапайым түрлендірулері болып табылады (сонымен қатар «нағыз әртүрлілік» деп те аталады), бірақ әрбір әртүрлілік индексін өз алдына нақты құбылысқа сәйкес келетін өлшем ретінде қарастыруға болады (бірақ әрбір әртүрлілік индексі үшін әртүрлі). Көптеген индекстер объектілер арасындағы санаттық әртүрлілікті ғана ескереді. Дегенмен, мұндай индекстер объектілер арасындағы жалпы өзгергіштікті (әртүрлілікті) ескермейді, ол тек категориялық және сапалық әртүрлілік есептелген кезде ғана пайда болады. Нағыз әртүрлілік немесе типтердің тиімді саны – зерттелетін деректер жиынтығында байқалған типтердің орташа пропорционалдық санына тең болуы үшін қажетті бірдей пропорционалдық саны бар типтердің саны. Деректер жиынтығындағы нағыз әртүрлілік алдымен деректер жиынтығындағы типтердің пропорционалдық санының Mq−1 салмақталған жалпыланған ортасын есептеу арқылы, содан кейін оның кері шамасын алу арқылы есептеледі. Теңдеу: , жоғарыдағы теңдеу белгісіз. Алайда, q 1-ге жақындағандағы математикалық лимит анықталған және сәйкес әртүрлілік келесі теңдеумен есептеледі: ол табиғи логарифмдермен есептелген Шеннон энтропиясының экспонентасы (жоғарыда қараңыз). Басқа салаларда бұл статистика түсініксіздік деп те аталады. Әртүрліліктің жалпы теңдеуі көбінесе мынадай түрде жазылады: Егер нағыз әртүрлілік есептелсе, типтердің тиімді саны (^(0)D) типтердің нақты санына тең болады, ол байлыққа (R) сәйкес келеді. Бұл өлшемді 1948 жылы Клод Шеннон мәтіннің тізбектеріндегі энтропияны (осыдан Шеннон энтропиясы, Шеннон ақпараттық мазмұнымен байланысты) өлшеу үшін ұсынған. Идеясы мынада: әріптердің саны неғұрлым көп болса және олардың пропорционалдық саны қызығушылық тудыратын тізбекте жақын болса, тізбекте келесі әріпті дұрыс болжау соғұрлым қиын. Шеннон энтропиясы осы болжаумен байланысты белгісіздікті (энтропия немесе таңғалу дәрежесі) өлшеуге мүмкіндік береді. Ол көбінесе келесідей есептеледі: мұнда pi – қызығушылық тудыратын тізбектегі i-ші типке жататын әріптердің үлесі. Экологияда pi – қызығушылық тудыратын деректер жиынтығындағы i-ші түрге жататын жеке тұлғалардың үлесі. Содан кейін Шеннон энтропиясы деректер жиынтығынан кездейсоқ алынған жеке тұлғаның түр сәйкестігін болжаудағы белгісіздікті өлшеуге мүмкіндік береді. Бұл жерде теңдеу табиғи логарифмдермен жазылғанмен, Шеннон энтропиясын есептеу кезінде қолданылатын логарифмнің негізін еркін таңдауға болады. Шеннон өзі логарифмдік негіздерді 2, 10 және e талқылады, содан бері олар Шеннон энтропиясын қолданатын қолданбаларда ең танымал негіздерге айналды. Әрбір логарифмдік негіз әр түрлі өлшем бірлігіне сәйкес келеді, ол сәйкесінше 2, 10 және e негіздері үшін екілік сандар (бит), ондық сандар (децит) және табиғи сандар (нат) деп аталады. Алғашқыда әр түрлі логарифм негіздерімен есептелген Шеннон энтропиясының мәндерін салыстыру оларды бірдей логарифм негіздеріне аударуды талап етеді: a негізінен b негізіне ауысу logba еселеу арқылы алынады. Сол индексті 1950 жылы Орис С. Херфиндал қайтадан тапты. Индекстің квадраттық түбірін 1945 жылы экономист Альберт О. Хиршман енгізген болатын. Нәтижесінде, сол өлшем әдетте экологияда Симпсон индексі, ал экономикада Герфиндал индексі немесе Герфиндал-Хиршман индексі (ХХИ) ретінде белгілі. Өлшем зерттелетін деректер жиынтығынан кездейсоқ алынған екі объектінің бірдей типті білдіру ықтималдығына тең. Типтердің орташа пропорционалдық саны типтердің саны азайып, ең көп таралған типтің саны артуымен өседі, сондықтан λ жоғары әртүрлілік дерек жиынтықтарында кіші мәндерді және төмен әртүрлілік дерек жиынтықтарында үлкен мәндерді алады. Бұл әртүрлілік индексі үшін интуицияға қайшы әрекет, сондықтан жиі, әртүрліліктің өсуімен өсетін λ түрлендірулері қолданылады. Мұндай индекстердің ең танымалдары – кері Симпсон индексі (1/λ) және Гини-Симпсон индексі (1 − λ). Машиналық оқу саласында. Симпсоннің бастапқы индексі λ зерттелетін деректер жиынтығынан (қайта алмастыру арқылы) кездейсоқ алынған екі объектінің бірдей типті білдіру ықтималдығына тең. Оның түрлендірілуі 1 − λ, демек, екі объектінің әртүрлі типті білдіру ықтималдығына тең. Бұл өлшем экологияда түрлер аралық кездесу ықтималдығы (PIE) және Гини-Симпсон индексі ретінде де белгілі. Бұл сонымен қатар Блау индексі деп те аталады, Гини-Симпсон индексімен бірдей. Бұл шама популяциялық генетикада күтілетін гетерозиготность деп те аталады.

Бергер-Паркер индексі

Бергер-Паркер индексі деректер жиынтығындағы ең жоғары пи мәніне тең, яғни ең көп кездесетін түрдің пропорционалдық мөлшеріне тең. Бұл, q шексіздікке жақындағандағы пи мәндерінің салмақталған жалпыланған орташасына сәйкес келеді, демек шексіз реттің нақты әртүрлілігінің кері шамасына (1/^(∞)D) тең.