Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Статистиканың саласы
Branch of statistics
Математикалық статистика – бұл статистикалық деректерді жинау тәсілдерінен өзгеше, математиканың бір саласы – ықтималдықтар теориясын статистикаға қолдану. Бұл үшін математикалық талдау, сызықтық алгебра, стохастикалық талдау, дифференциалдық теңдеулер және өлшемдер теориясы сияқты арнайы математикалық әдістер қолданылады.
Mathematical statistics is the application of probability theory, a branch of mathematics, to statistics, as opposed to techniques for collecting statistical data. Specific mathematical techniques which are used for this include mathematical analysis, linear algebra, stochastic analysis, differential equations, and measure theory.
Кіріспе
Статистикалық деректерді жинау зерттеулерді жоспарлаумен, әсіресе кездейсоқ эксперименттерді жобалаумен және кездейсоқ үлгі алу арқылы сауалнамаларды жоспарлаумен байланысты. Деректерді бастапқы талдау көбінесе зерттеу жүргізілгенге дейін белгіленген зерттеу хаттамасына сәйкес жүргізіледі. Зерттеуден алынған деректерді бастапқы нәтижелерге негізделген қосымша гипотезаларды қарастыру немесе жаңа зерттеулерді ұсыну үшін де талдауға болады. Жоспарланған зерттеуден алынған деректерді қайта талдау деректерді талдау құралдарын қолданады, ал осы процестің өзі математикалық статистика болып табылады. Деректерді талдау келесіге бөлінеді:
Statistical data collection is concerned with the planning of studies, especially with the design of randomized experiments and with the planning of surveys using random sampling. The initial analysis of the data often follows the study protocol specified prior to the study being conducted. The data from a study can also be analyzed to consider secondary hypotheses inspired by the initial results, or to suggest new studies. A secondary analysis of the data from a planned study uses tools from data analysis, and the process of doing this is mathematical statistics. Data analysis is divided into:
сипаттамалық статистика – деректерді сипаттайтын, яғни деректерді және олардың ерекше қасиеттерін қорытындылайтын статистиканың бір бөлігі. қорытынды статистика – деректерден қорытынды шығаратын статистиканың бір бөлігі (деректер үшін белгілі бір модельді пайдалана отырып): Мысалы, қорытынды статистика деректерге модельді таңдауды, деректердің нақты модельдің шарттарына сай келетінін тексеруді және осыған байланысты белгісіздікті сандық өлшеуді (мысалы, сенімділік интервалдарын қолдану) қамтиды. Деректерді талдау құралдары кездейсоқ зерттеулерден алынған деректерде ең жақсы жұмыс істейді, бірақ олар басқа да деректерге қолданылады. Мысалы, табиғи эксперименттер мен байқау зерттеулерінен, онда қорытынды статистикалықтың таңдаған моделіне байланысты болады және де субъективті.
descriptive statistics – the part of statistics that describes data, i. e. summarises the data and their typical properties. inferential statistics – the part of statistics that draws conclusions from data (using some model for the data): For example, inferential statistics involves selecting a model for the data, checking whether the data fulfill the conditions of a particular model, and with quantifying the involved uncertainty (e. g. using confidence intervals). While the tools of data analysis work best on data from randomized studies, they are also applied to other kinds of data. For example, from natural experiments and observational studies, in which case the inference is dependent on the model chosen by the statistician, and so subjective.
Ықтималдық үлестірілімдері
Ықтималдық үлестірімі – кездейсоқ эксперимент, сауалнама немесе статистикалық қорытындылау процедурасының мүмкін нәтижелерінің әрбір өлшенетін кіші жиынына ықтималдық тағайындайтын функция. Мысалдар сандық емес үлгі кеңістігіне ие эксперименттерде кездеседі, онда үлестіру категориялық үлестіру болады; үлгі кеңістігі дискретті кездейсоқ айнымалылармен кодталған эксперименттерде, онда үлестіру ықтималдық массалық функциясымен сипатталады; және үздіксіз кездейсоқ айнымалылармен кодталған үлгі кеңістігіне ие эксперименттерде, онда үлестіру ықтималдық тығыздық функциясымен сипатталады. Ұзақ уақыт аралығында анықталған стохастикалық процестерді қамтитын күрделі эксперименттерге көбінесе жалпы ықтималдық өлшемдерді қолдану қажет болуы мүмкін. Ықтималдық үлестірімі бірөлшемді немесе көпөлшемді болуы мүмкін. Бірөлшемді үлестіру бір кездейсоқ айнымалының әртүрлі мәндерді қабылдау ықтималдығын көрсетеді; көпөлшемді үлестіру (бірлескен ықтималдық үлестіру) екі немесе одан көп кездейсоқ айнымалылар жиынтығы – кездейсоқ вектордың әртүрлі мәндер комбинацияларын қабылдау ықтималдығын көрсетеді. Маңызды және жиі кездесетін бірөлшемді ықтималдық үлестірілімдеріне биномдық үлестіру, гипергеометриялық үлестіру және қалыпты үлестіру жатады. Көпөлшемді қалыпты үлестіру – жиі кездесетін көпөлшемді үлестіру.
A probability distribution is a function that assigns a probability to each measurable subset of the possible outcomes of a random experiment, survey, or procedure of statistical inference. Examples are found in experiments whose sample space is non numerical, where the distribution would be a categorical distribution; experiments whose sample space is encoded by discrete random variables, where the distribution can be specified by a probability mass function; and experiments with sample spaces encoded by continuous random variables, where the distribution can be specified by a probability density function. More complex experiments, such as those involving stochastic processes defined in continuous time, may demand the use of more general probability measures. A probability distribution can either be univariate or multivariate. A univariate distribution gives the probabilities of a single random variable taking on various alternative values; a multivariate distribution (a joint probability distribution) gives the probabilities of a random vector—a set of two or more random variables—taking on various combinations of values. Important and commonly encountered univariate probability distributions include the binomial distribution, the hypergeometric distribution, and the normal distribution. The multivariate normal distribution is a commonly encountered multivariate distribution.
Регрессия
Статистикада регрессиялық талдау – айнымалылар арасындағы қатынастарды бағалаудың статистикалық процесі. Ол тәуелді айнымалы мен бір немесе бірнеше тәуелсіз айнымалылар арасындағы қатынасқа назар аударғанда, бірнеше айнымалыларды модельдеу және талдаудың көптеген жолдарын қамтиды. Нақтырақ айтқанда, регрессиялық талдау тәуелді айнымалының (немесе ‘критерий айнымалының’) типік мәні тәуелсіз айнымалылардың кез келгені өзгерген кезде, ал қалған тәуелсіз айнымалылар тұрақты ұсталғанда қалай өзгеретінін түсінуге көмектеседі. Көбінесе регрессиялық талдау тәуелсіз айнымалылар берілгенде тәуелді айнымалының шартты күтімін, яғни тәуелсіз айнымалылар бекітілгенде тәуелді айнымалының орташа мәнін бағалайды. Аз жиілікте назар тәуелсіз айнымалылардың берілгенде тәуелді айнымалының шартты үлестірілімінің квантиліне немесе басқа орналасу параметріне аударылады. Барлық жағдайларда бағалау нысаны тәуелсіз айнымалылардың функциясы болып табылады, ол регрессия функциясы деп аталады. Регрессиялық талдау кезінде, ықтималдық үлестірімімен сипатталатын регрессия функциясы төңірегіндегі тәуелді айнымалының өзгеруін сипаттау да маңызды. Регрессиялық талдауды жүргізу үшін көптеген техникалар әзірленді. Сызықтық регрессия сияқты таныс әдістер параметрлік болып табылады, себебі регрессия функциясы деректерден бағаланатын шекті сандағы белгісіз параметрлер арқылы анықталады (мысалы, ең кіші квадраттар әдісін қолдану арқылы). Параметриялық емес регрессия – регрессия функциясының шексіз өлшемді болуы мүмкін функциялар жиынтығында жатуына мүмкіндік беретін техникаларды білдіреді.
In statistics, regression analysis is a statistical process for estimating the relationships among variables. It includes many ways for modeling and analyzing several variables, when the focus is on the relationship between a dependent variable and one or more independent variables. More specifically, regression analysis helps one understand how the typical value of the dependent variable (or 'criterion variable') changes when any one of the independent variables is varied, while the other independent variables are held fixed. Most commonly, regression analysis estimates the conditional expectation of the dependent variable given the independent variables – that is, the average value of the dependent variable when the independent variables are fixed. Less commonly, the focus is on a quantile, or other location parameter of the conditional distribution of the dependent variable given the independent variables. In all cases, the estimation target is a function of the independent variables called the regression function. In regression analysis, it is also of interest to characterize the variation of the dependent variable around the regression function which can be described by a probability distribution. Many techniques for carrying out regression analysis have been developed. Familiar methods, such as linear regression, are parametric, in that the regression function is defined in terms of a finite number of unknown parameters that are estimated from the data (e. g. using ordinary least squares). Nonparametric regression refers to techniques that allow the regression function to lie in a specified set of functions, which may be infinite dimensional.
Параметриялық емес статистика
Параметриялық емес статистика – бұл ықтималдық үлестірілімдерінің параметрленген отбасыларына негізделмеген деректерден есептелген мәндер. Олар сипаттамалық және қорытынды статистиканы қамтиды. Типтік параметрлер – күту, дисперсия және т.б. Параметриялық статистикадан өзгеше, параметриялық емес статистика бағаланатын айнымалылардың ықтималдық үлестірімі туралы ешқандай болжам жасамайды. Параметриялық емес әдістер рейтингтік тәртіптегі популяцияларды зерттеу үшін кеңінен қолданылады (мысалы, бірден төрт жұлдызға дейінгі фильмдерге жазылған пікірлер). Деректерде реттілік болғанда, бірақ нақты сандық интерпретациясы болмағанда, мысалы, қалауларды бағалау кезінде, параметриялық емес әдістерді қолдану қажет болуы мүмкін. Өлшеу деңгейі тұрғысынан, параметриялық емес әдістер "реттік" деректерді тудырады. Параметриялық емес әдістер азырақ болжамдар жасайтындықтан, олардың қолданылу аймағы тиісті параметриялық әдістерге қарағанда әлдеқайда кең. Атап айтқанда, оларды қолданылатын мәселе туралы ақпарат аз болған жағдайларда қолдануға болады. Сонымен қатар, азырақ болжамдарға сүйенудің нәтижесінде, параметриялық емес әдістер сенімдірек болады. Параметриялық емес әдістердің бір кемшілігі – олар болжамдарға сүйенбегендіктен, әдетте, параметрлік әдістерге қарағанда нашаррақ күшке ие. Төмен қуаттылыққа ие параметриялық емес тесттер мәселелі, себебі осы әдістер көбінесе үлгі мөлшері шағын болғанда қолданылады. Олар ғылыми есептеулерді, талдауды және оптимизацияны кеңінен пайдаланады; эксперименттерді жобалау үшін статистиктер алгебра мен комбинаториканы қолданады. Бірақ статистикалық тәжірибе көбінесе ықтималдық пен шешім қабылдау теориясына сүйенсе де, олардың қолданылуы кейде күмәнді болуы мүмкін.
Nonparametric statistics are values calculated from data in a way that is not based on parameterized families of probability distributions. They include both descriptive and inferential statistics. The typical parameters are the expectations, variance, etc. Unlike parametric statistics, nonparametric statistics make no assumptions about the probability distributions of the variables being assessed. Non parametric methods are widely used for studying populations that take on a ranked order (such as movie reviews receiving one to four stars). The use of non parametric methods may be necessary when data have a ranking but no clear numerical interpretation, such as when assessing preferences. In terms of levels of measurement, non parametric methods result in "ordinal" data. As non parametric methods make fewer assumptions, their applicability is much wider than the corresponding parametric methods. In particular, they may be applied in situations where less is known about the application in question. Also, due to the reliance on fewer assumptions, non parametric methods are more robust. One drawback of non parametric methods is that since they do not rely on assumptions, they are generally less powerful than their parametric counterparts. Low power non parametric tests are problematic because a common use of these methods is for when a sample has a low sample size. and makes extensive use of scientific computing, analysis, and optimization; for the design of experiments, statisticians use algebra and combinatorics. But while statistical practice often relies on probability and decision theory, their application can be controversial