Введение
Математическая статистика – это применение теории вероятности, ветви математики, к статистике, в отличие от техник сбора статистических данных. Конкретные математические методы, используемые в ней, включают математический анализ, линейную алгебру, стохастический анализ, дифференциальные уравнения и теорию меры.
Mathematical statistics is the application of probability theory, a branch of mathematics, to statistics, as opposed to techniques for collecting statistical data. Specific mathematical techniques which are used for this include mathematical analysis, linear algebra, stochastic analysis, differential equations, and measure theory.
Введение
Сбор статистических данных связан с планированием исследований, в особенности с разработкой рандомизированных экспериментов и планированием обследований с использованием случайной выборки. Первоначальный анализ данных часто следует протоколу исследования, определенному до его проведения. Данные, полученные в ходе исследования, также могут быть проанализированы для проверки дополнительных гипотез, возникших на основе первичных результатов, или для разработки новых исследований. Вторичный анализ данных, полученных в рамках запланированного исследования, использует инструменты анализа данных, а сам процесс является математической статистикой. Анализ данных подразделяется на:
дескриптивную статистику – раздел статистики, описывающий данные, то есть обобщающий данные и их типичные характеристики. инференциальную статистику – раздел статистики, позволяющий делать выводы на основе данных (с использованием определенной модели для этих данных): например, инференциальная статистика включает выбор модели для данных, проверку соответствия данных условиям выбранной модели и количественную оценку связанной с этим неопределенности (например, с помощью доверительных интервалов). Хотя инструменты анализа данных наиболее эффективны при работе с данными, полученными в результате рандомизированных исследований, они также применяются к другим типам данных, например, к данным, полученным в ходе квазиэкспериментов и наблюдательных исследований, в этом случае выводы зависят от модели, выбранной статистиком, и, следовательно, являются субъективными.
Распределения вероятности
Распределение вероятностей — это функция, которая присваивает вероятность каждому измеримому подмножеству возможных исходов случайного эксперимента, опроса или процедуры статистического вывода. Примеры можно найти в экспериментах, пространство выборки которых не является числовым, где распределение будет категориальным; в экспериментах, пространство выборки которых закодировано дискретными случайными величинами, где распределение может быть задано функцией массы вероятности; и в экспериментах с пространствами выборки, закодированными непрерывными случайными величинами, где распределение может быть задано функцией плотности вероятности. Более сложные эксперименты, такие как те, которые включают стохастические процессы, определенные в непрерывном времени, могут потребовать использования более общих мер вероятности. Распределение вероятностей может быть унивариантным или мультивариантным. Унивариантное распределение задает вероятности принятия различных значений одной случайной величиной; мультивариантное распределение (совместное распределение вероятностей) задает вероятности принятия различных комбинаций значений случайным вектором — набором из двух или более случайных величин. Важные и часто встречающиеся унивариантные распределения вероятностей включают биномиальное распределение, гипергеометрическое распределение и нормальное распределение. Мультивариантное нормальное распределение является часто встречающимся мультивариантным распределением.
Регрессия
В статистике регрессионный анализ – это статистический процесс оценки взаимосвязей между переменными. Он включает в себя множество методов моделирования и анализа нескольких переменных, при котором основное внимание уделяется связи между зависимой переменной и одной или несколькими независимыми переменными. В частности, регрессионный анализ помогает понять, как типичное значение зависимой переменной (или «критериальной переменной») изменяется при изменении любой из независимых переменных, при этом остальные независимые переменные остаются фиксированными. Чаще всего регрессионный анализ оценивает условное математическое ожидание зависимой переменной при заданных значениях независимых переменных – то есть среднее значение зависимой переменной при фиксированных независимых переменных. Реже фокус делается на квантиле или другом параметре расположения условного распределения зависимой переменной при заданных значениях независимых переменных. Во всех случаях целью оценки является функция независимых переменных, называемая регрессионной функцией. В регрессионном анализе также представляет интерес характеризация разброса зависимой переменной вокруг регрессионной функции, который можно описать с помощью распределения вероятностей. Разработано множество методов для проведения регрессионного анализа. Известные методы, такие как линейная регрессия, являются параметрическими, поскольку регрессионная функция определяется через конечное число неизвестных параметров, которые оцениваются на основе данных (например, с использованием метода наименьших квадратов). Непараметрическая регрессия относится к методам, позволяющим регрессионной функции принимать значения из заданного множества функций, которое может быть бесконечномерным.
Непараметрическая статистика
Непараметрическая статистика – это значения, рассчитанные на основе данных способом, не зависящим от параметрических семейств распределений вероятностей. Она включает в себя как описательную, так и индуктивную статистику. Типичными параметрами являются математическое ожидание, дисперсия и т.д. В отличие от параметрической статистики, непараметрическая статистика не делает никаких предположений о распределении вероятностей оцениваемых переменных. Непараметрические методы широко используются для изучения совокупностей, принимающих упорядоченные значения (например, оценки фильмов по шкале от одной до четырех звезд). Использование непараметрических методов может быть необходимо, когда данные имеют ранговую шкалу, но не имеют четкой числовой интерпретации, например, при оценке предпочтений. С точки зрения уровней измерения, непараметрические методы приводят к "порядковым" данным. Поскольку непараметрические методы делают меньше предположений, их область применения значительно шире, чем у соответствующих параметрических методов. В частности, они могут применяться в ситуациях, когда известно мало о рассматриваемой задаче. Кроме того, благодаря меньшей зависимости от предположений, непараметрические методы более устойчивы. Одним из недостатков непараметрических методов является то, что из-за отсутствия зависимости от предположений они, как правило, менее мощные, чем их параметрические аналоги. Невысокая мощность непараметрических тестов является проблемой, поскольку эти методы часто используются при малом размере выборки. Статистика широко использует научные вычисления, анализ и оптимизацию; для планирования экспериментов используются алгебра и комбинаторика. Однако, хотя статистическая практика часто опирается на теорию вероятностей и теорию принятия решений, их применение может быть спорным.