Гистограмма – сандық деректерді көрсету тәсілі. Интервалдарға бөліп, әрбір санаттағы деректер санын есептеу арқылы құрылады. Статистикалық талдау үшін маңызды.
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Сандық деректердің графикалық бейнеленуі
Graphical representation of the distribution of numerical data
Гистограмма – сандық деректердің таралуының визуальды бейнеленуі. Бұл термин алғаш рет Карл Пирсонмен енгізілген. Гистограмма құрудың бірінші қадамы – мәндер диапазонын «интервалдарға» (немесе «бөлімдерге») бөлу, яғни мәндердің барлық диапазонын бірнеше интервалдарға бөліп, содан кейін әр интервалға қанша мән түсетінін санау. Интервалдар әдетте, бір-біріне тікелей жанасқан, үсті-үстіне келмейтін аралықтар түрінде беріледі. Интервалдар (аралықтар) іргелес жатқан және әдетте (бірақ міндетті емес) бірдей өлшемде болады. Гистограммалар деректердің негізгі таралуының тығыздығы туралы жалпы түсінік береді және көбінесе тығыздықты бағалау үшін қолданылады: негізгі айнымалының ықтималдық тығыздық функциясын бағалау. Ықтималдық тығыздығы үшін қолданылатын гистограмманың жалпы ауданы әрқашан 1-ге нормалданады. Егер x осьіндегі интервалдардың ұзындығы барлығы 1-ге тең болса, онда гистограмма салыстырмалы жиілік графигімен сәйкес келеді. Гистограммалар кейде бағандық диаграммалармен шатастырылады. Гистограммада әр интервал мәндердің әртүрлі диапазоны үшін арналған, сондықтан гистограмманың өзі мәндердің таралуын көрсетеді. Ал бағандық диаграммада әр баған байқаулардың әртүрлі санатына арналған (мысалы, әр баған әртүрлі популяция үшін болуы мүмкін), сондықтан бағандық диаграмманы әртүрлі санаттарды салыстыру үшін пайдалануға болады. Кейбір авторлар бағандық диаграммаларда бағандар арасында бос орын болуын ұсынады, осылайша олар гистограмма емес екенін нақтылауға болады.
A histogram is a visual representation of the distribution of quantitative data. The term was first introduced by Karl Pearson. To construct a histogram, the first step is to "bin" (or "bucket") the range of values— divide the entire range of values into a series of intervals—and then count how many values fall into each interval. The bins are usually specified as consecutive, non overlapping intervals of a variable. The bins (intervals) are adjacent and are typically (but not required to be) of equal size. Histograms give a rough sense of the density of the underlying distribution of the data, and often for density estimation: estimating the probability density function of the underlying variable. The total area of a histogram used for probability density is always normalized to 1. If the length of the intervals on the x axis are all 1, then a histogram is identical to a relative frequency plot. Histograms are sometimes confused with bar charts. In a histogram, each bin is for a different range of values, so altogether the histogram illustrates the distribution of values. But in a bar chart, each bar is for a different category of observations (e. g., each bar might be for a different population), so altogether the bar chart can be used to compare different categories. Some authors recommend that bar charts always have gaps between the bars to clarify that they are not histograms.
Жиынтық гистограмма
Жинақталған гистограмма — бұл белгіленген контейнерге дейінгі барлық контейнерлердегі бақылаулардың жиынтық санын көрсететін функция. Яғни, бір гистограмманың (mj) жиынтық гистограммасы (Mi) былай анықталады:
A cumulative histogram is a mapping that counts the cumulative number of observations in all of the bins up to the specified bin. That is, the cumulative histogram Mi of a histogram mj is defined as:
Квадрат түбірін таңдау
Бұл үлгідегі деректер нүктелерінің санын квадрат түбірге шығарып, келесі толық санға дейін жуықтайды. Бұл ереже көптеген қарапайым статистикалық оқулықтарда ұсынылған және көптеген бағдарламалық пакеттерде кеңінен қолданылады.
which takes the square root of the number of data points in the sample and rounds to the next integer. This rule is suggested by a number of elementary statistics textbooks and widely implemented in many software packages.
Стерджес формуласы
Стерджес ережесі биномдық үлестірімнен туындайды және жақынша қалыпты үлестірімді меңзейді. Стерджес формуласы контейнерлердің мөлшерін деректердің диапазонына байланысты есептейді және егер n < 30 болса, нашар жұмыс істеуі мүмкін, себебі контейнерлердің саны аз – жетіден кем болады және деректердегі тенденцияларды жақсы көрсетпейді. Керісінше, Стерджес формуласы өте үлкен деректер жиынтығы үшін контейнерлердің енін шамадан тыс үлкейтуі мүмкін, нәтижесінде гистограммалар тым тегіс болып шығады. Деректер қалыпты үлестірімге жатпаса, оның тиімділігі төмендеуі мүмкін. Скотт ережесімен және Террелл Скотт ережесімен – гистограммалар үшін тағы екі кеңінен қабылданған формуламен салыстырғанда, Стерджес формуласының нәтижесі n ≈ 100 болғанда ең жақын нәтиже береді. Бұл Стерджес ережесіне қарапайым балама ретінде ұсынылады.
Sturges's rule is derived from a binomial distribution and implicitly assumes an approximately normal distribution. Sturges's formula implicitly bases bin sizes on the range of the data, and can perform poorly if n < 30, because the number of bins will be small—less than seven—and unlikely to show trends in the data well. On the other extreme, Sturges's formula may overestimate bin width for very large datasets, resulting in oversmoothed histograms. It may also perform poorly if the data are not normally distributed. When compared to Scott's rule and the Terrell Scott rule, two other widely accepted formulas for histogram bins, the output of Sturges's formula is closest when n ≈ 100. is presented as a simple alternative to Sturges's rule.
Террелл-Скотт ережесі
Террелл-Скотт ережесі – қалыпты анықтамалық ереже емес. Ол асимптотикалық жағынан оптималды гистограмма үшін қажетті ең аз контейнер санын көрсетеді, мұнда оптималдық интегралдық орташа квадраттық қате арқылы өлшенеді. Бұл шектеу ең тегіс мүмкін тығыздықты анықтау арқылы шығарылады, ол кез келген басқа тығыздыққа көбірек контейнерлерді қажет етеді, сондықтан аталған бағалау «артық тегістелген» ереже деп те аталады. Формулалардың ұқсастығы және Террелл мен Скотттың осы ережені ұсынған кезде Райс университетінде болғандығы, бұл Райс ережесінің де содан туындағанын көрсетеді.
The Terrell–Scott rule is not a normal reference rule. It gives the minimum number of bins required for an asymptotically optimal histogram, where optimality is measured by the integrated mean squared error. The bound is derived by finding the 'smoothest' possible density, which turns out to be Any other density will require more bins, hence the above estimate is also referred to as the 'oversmoothed' rule. The similarity of the formulas and the fact that Terrell and Scott were at Rice University when the proposed it suggests that this is also the origin of the Rice rule.
Ескертпе
Биндер санының пропорционалды болуының жақсы себебі мынадай: деректер шектелген ықтималдық үлестірілімінің тәуелсіз іске асырылуы ретінде алынған деп есептейік, оның тығыздығы тегіс. Онда гистограмма шексіздікке қарай бірдей "дөңгелек" болып қалады. Егер таралудың "ені" (мысалы, стандартты ауытқу немесе квартильдік диапазон) болса, онда биндердегі бірліктер саны (жиілік) шамамен тең болады және салыстырмалы стандартты қате шамамен тең. Тығыздықтың туындысы нөлге тең болмаса, келесі биндермен салыстырғанда жиіліктің салыстырмалы өзгеруі шамамен тең болады. Егер шамамен тең болса, онда шамамен тең болады. Бұл қарапайым куб түбір таңдауы тұрақты емес ені бар биндерге де қолданылуы мүмкін.
A good reason why the number of bins should be proportional to is the following: suppose that the data are obtained as independent realizations of a bounded probability distribution with smooth density. Then the histogram remains equally "rugged" as tends to infinity. If is the "width" of the distribution (e. g., the standard deviation or the inter quartile range), then the number of units in a bin (the frequency) is of order and the relative standard error is of order Compared to the next bin, the relative change of the frequency is of order provided that the derivative of the density is non zero. These two are of the same order if is of order , so that is of order This simple cubic root choice can also be applied to bins with non constant widths.
Қолданбалар
Гидрологияда жауын-шашын және өзен су ағыны деректерінің гистограммасы мен есептелген тығыздық функциясы, ықтималдық таралымымен талданып, олардың қалай өзгеретінін және қаншалықты жиі кездесетінін түсінуге көмектеседі. Мысалы, көк түсті суретте көрсетілген. Көптеген цифрлық кескіндерді өңдеу бағдарламаларында гистограмма құралы бар, ол пикселдердің контрастының/жарықтығының таралуын көрсетеді.
In hydrology the histogram and estimated density function of rainfall and river discharge data, analysed with a probability distribution, are used to gain insight in their behaviour and frequency of occurrence. An example is shown in the blue figure. In many Digital image processing programs there is an histogram tool, which show you the distribution of the contrast / brightness of the pixels.