Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Статистикалық тест
Statistical test
Статистикада G тесттері – ықтималдық қатынасы немесе максималды ықтималдық бойынша статистикалық маңыздылықты анықтау тесттері. Бұрын хи-квадрат тесттері ұсынылған жағдайларда олар жиі қолданылады.
In statistics, G tests are likelihood ratio or maximum likelihood statistical significance tests that are increasingly being used in situations where chi squared tests were previously recommended.
Алыстыру
G сынағының мәнін логикалық ықтималдық қатынасы сынағынан шығаруға болады, егер негізгі модель мультиномиалды модель болса. Егер бізде үлгі болса, онда әрқайсысы – белгілі бір типтегі нысанды байқаған кездегі саны. Сонымен қатар, байқалған нысандардың жалпы саны болсын. Егер негізгі модель мультиномиалды деп есептесек, тест статистикасы былай анықталады: мұнда – нөлдік гипотеза, ал – деректер бойынша параметрлердің ең жоғары ықтималдық бағасы (МЖБ). Мультиномиалды модель үшін белгілі бір деректерге сәйкес МЖБ былай анықталады. Сонымен қатар, әрбір нөлдік гипотеза параметрін мына түрде көрсетуге болады. Осылайша, және логикалық ықтималдық қатынасында көрсетілгендерді қойғанда, теңдеу келесідей жеңілдейді. Айнымалыларды –мен, ал –ты –мен ауыстырыңыз. Содан соң, G сынағының формуласы Пирсонның хи-квадрат формуласына асимптотикалық түрде тең болуын қамтамасыз ету үшін (көбейткіш ретінде) көбейтіңіз.
We can derive the value of the G test from the log likelihood ratio test where the underlying model is a multinomial model. Suppose we had a sample where each is the number of times that an object of type was observed. Furthermore, let be the total number of objects observed. If we assume that the underlying model is multinomial, then the test statistic is defined bywhere is the null hypothesis and is the maximum likelihood estimate (MLE) of the parameters given the data. Recall that for the multinomial model, the MLE of given some data is defined byFurthermore, we may represent each null hypothesis parameter asThus, by substituting the representations of and in the log likelihood ratio, the equation simplifies toRelabel the variables with and with Finally, multiply by a factor of (used to make the G test formula asymptotically equivalent to the Pearson's chi squared test formula) to achieve the form
Түйсіндіру бойынша, –ты үздіксіз деп және нөлге жақындаған деп елестете аласыз, онда – және нөлдік байқаулары бар терминдерді жай ғана түсіріп тастауға болады. Дегенмен, әдісті қолдану үшін әрбір жасушадағы күтілетін сандар нөлден қатаң жоғары болуы керек.
Heuristically, one can imagine as continuous and approaching zero, in which case and terms with zero observations can simply be dropped. However the expected count in each cell must be strictly greater than zero for each cell to apply the method.
Тарату және пайдалану
Берілген күтілетін жиіліктерге ие үлестіруден кездейсоқ үлгі алу нәтижесінде байқалған жиіліктердің пайда болуын қарастыратын нөлдік гипотезаны ескере отырып, G үлестірімі шамамен хи-квадрат үлестіріміне жуық, оның еркіндік дәрежесі тиісті хи-квадрат тестіндегідей болады. Өте кішкентай үлгілер үшін G тестіне қарағанда, жарамдылықтың жақсылығын тексеру үшін мультиномиалдық тест, контингенциялық кестелер үшін Фишердің нақты тесті немесе тіпті Байес гипотезасын таңдау қолайлырақ. Макдональд үлгілердің жалпы саны 1000-нан кем болған жағдайда, әрқашан нақты тест (жарамдылықтың жақсылығының нақты тесті, Фишердің нақты тесті) қолдануды ұсынады. 1000 үлгі санында ешқандай ерекшелік жоқ, бұл тек нақты тест, хи-квадрат тесті және G тесті шамамен бірдей p мәндерін беретін ыңғайлы дөңгелек сан. Электрондық кестелер, веб-бет калькуляторлары және SAS 1000 үлгісі үшін нақты тестті орындауда ешқандай қиындық тудырмауы керек. — Джон Х. Макдональд.
Given the null hypothesis that the observed frequencies result from random sampling from a distribution with the given expected frequencies, the distribution of G is approximately a chi squared distribution, with the same number of degrees of freedom as in the corresponding chi squared test. For very small samples the multinomial test for goodness of fit, and Fisher's exact test for contingency tables, or even Bayesian hypothesis selection are preferable to the G test. McDonald recommends to always use an exact test (exact test of goodness of fit, Fisher's exact test) if the total sample size is less than 1 000 There is nothing magical about a sample size of 1 000, it's just a nice round number that is well within the range where an exact test, chi square test, and G–test will give almost identical p values. Spreadsheets, web page calculators, and SAS shouldn't have any problem doing an exact test on a sample size of 1 000 — John H. McDonald
Қолдану
Статистикалық генетикадағы Макдональд-Крайтман сынағы – G сынағының қолданылуы. Дуннинг бұл сынақты есептеу лингвистикасы қауымдастығына таныстырды, қазір ол кеңінен қолданылады. R скап бағдарламасы (Rfam пайдаланады) РНК тізбегінің сәйкес келу позициялары арасындағы ковариацияны анықтау үшін G сынағын қолданады.
The McDonald–Kreitman test in statistical genetics is an application of the G test. Dunning introduced the test to the computational linguistics community where it is now widely used. The R scape program (used by Rfam) uses G test to detect co variation between RNA sequence alignment positions.
Статистикалық бағдарламалық қамтамасыз ету
R бағдарламасында жылдам іске асыру AMR және Rfast пакеттерінде табылады. AMR пакеті үшін команда g.test, ол базалық R-дың chisq.test сияқты дәл жұмыс істейді. R-де Deducer пакетінде likelihood.test функциясы да бар. Ескерту: R бағдарламалау тілінің GeneCycle пакетіндегі (fisher.g.test) Фишердің G тестісі осы мақалада сипатталған G тестін емес, уақыт қатарындағы Гаусс ақ шуының Фишердің нақты тестін іске асырады. G статистикасы мен сәйкес p мәндерін есептеу үшін R пакеті entropy тағы бір іске асыруды ұсынады. Командалар: стандартты G статистикасы және оған байланысты p мәні үшін Gstat, ал тәуелсіздікті тексеру үшін бірлескен және көбейту үлестірімдерін салыстыруға қолданылатын G статистикасы үшін Gstatindep. SAS-та /chisq опциясын proc freq-тен кейін қолдану арқылы G тестін жүргізуге болады. Stata-да табуляция командасынан кейін lr опциясын қолдану арқылы G тестін жүргізуге болады. Java-да org.apache.commons.math3.stat.inference.GTest қолданыңыз. Python-да scipy.stats.powerdivergence, lambda=0 қолданыңыз.
In R fast implementations can be found in the AMR and Rfast packages. For the AMR package, the command is g. test which works exactly like chisq. test from base R. R also has the likelihood. test function in the Deducer package. Note: Fisher's G test in the GeneCycle Package of the R programming language (fisher. g. test) does not implement the G test as described in this article, but rather Fisher's exact test of Gaussian white noise in a time series. Another R implementation to compute the G statistic and corresponding p values is provided by the R package entropy. The commands are Gstat for the standard G statistic and the associated p value and Gstatindep for the G statistic applied to comparing joint and product distributions to test independence. In SAS, one can conduct G test by applying the /chisq option after the proc freq. In Stata, one can conduct a G test by applying the lr option after the tabulate command. In Java, use org. apache. commons. math3. stat. inference. GTest. In Python, use scipy. stats. power divergence with lambda =0.