Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Статистические искажения в линейных регрессиях
Statistical bias in linear regressions
Разбавление регрессии, также известное как ослабление регрессии, — это смещение наклона линейной регрессии к нулю (недооценка его абсолютной величины), вызванное ошибками в независимой переменной. Представим, что мы подбираем прямую линию для описания зависимости переменной y от переменной x и оцениваем наклон этой линии. Статистическая изменчивость, ошибка измерения или случайный шум в переменной y приводят к неопределенности в оценке наклона, но не к искажению: в среднем процедура вычисляет правильный наклон. Однако изменчивость, ошибка измерения или случайный шум в переменной x вызывают искажение в оценке наклона (а также неточность). Чем больше дисперсия в измерениях x, тем ближе к нулю должен стремиться оцененный наклон вместо истинного значения. Может показаться нелогичным, что шум в предикторной переменной x вызывает искажение, а шум в переменной y — нет. Важно помнить, что линейная регрессия не является симметричной: линия наилучшего соответствия для предсказания y по x (обычная линейная регрессия) не совпадает с линией наилучшего соответствия для предсказания x по y.
Regression dilution, also known as regression attenuation, is the biasing of the linear regression slope towards zero (the underestimation of its absolute value), caused by errors in the independent variable. Consider fitting a straight line for the relationship of an outcome variable y to a predictor variable x, and estimating the slope of the line. Statistical variability, measurement error or random noise in the y variable causes uncertainty in the estimated slope, but not bias: on average, the procedure calculates the right slope. However, variability, measurement error or random noise in the x variable causes bias in the estimated slope (as well as imprecision). The greater the variance in the x measurement, the closer the estimated slope must approach zero instead of the true value. It may seem counter intuitive that noise in the predictor variable x induces a bias, but noise in the outcome variable y does not. Recall that linear regression is not symmetric: the line of best fit for predicting y from x (the usual linear regression) is not the same as the line of best fit for predicting x from y.
Коррекция наклона
Склон регрессии и другие коэффициенты регрессии могут быть скорректированы на занижение следующим образом.
Regression slope and other regression coefficients can be disattenuated as follows.
Случай с фиксированной переменной x
Случай, когда x является фиксированным, но измеряется с погрешностью, известен как функциональная модель или функциональная зависимость. Его можно скорректировать, используя метод наименьших квадратов в общем смысле и модели ошибок в переменных.
The case that x is fixed, but measured with noise, is known as the functional model or functional relationship. It can be corrected using total least squares and errors in variables models in general.
Случай случайной распределенной переменной x
Случай, когда переменная x возникает случайным образом, известен как структурная модель или структурная зависимость. Например, в медицинском исследовании пациенты набираются в качестве выборки из генеральной совокупности, и их характеристики, такие как артериальное давление, могут рассматриваться как полученные из случайной выборки. При определенных предположениях (как правило, предположениях о нормальном распределении) существует известное соотношение между истинным наклоном и ожидаемым оцененным наклоном. Фрост и Томпсон (2000) рассматривают несколько методов оценки этого соотношения и, следовательно, коррекции оцененного наклона. Термин «коэффициент регрессионного разбавления», хотя и не определяется всеми авторами одинаково, используется для обозначения этого общего подхода, при котором применяется обычная линейная регрессия, а затем вносится поправка. Ответ Лонгфорда (2001) на работу Фроста и Томпсона ссылается на другие методы, расширяющие модель регрессии для учета изменчивости переменной x, чтобы избежать смещения. Фуллер (1987) является одним из стандартных справочников по оценке и корректировке регрессионного разбавления. Хьюз (1993) показывает, что методы коэффициента регрессионного разбавления приблизительно применимы в моделях выживаемости. Росне́р (1992) показывает, что методы коэффициентов приблизительно применимы к логистическим моделям регрессии. Кэрролл и др. (1995) приводят более подробную информацию о регрессионном разбавлении в нелинейных моделях, представляя методы коэффициента регрессионного разбавления как простейший случай методов регрессионной калибровки, в которые также могут быть включены дополнительные ковариаты. В целом, методы для структурной модели требуют некоторой оценки изменчивости переменной x. Это потребует повторных измерений переменной x у одних и тех же испытуемых, либо в рамках подинследования основного набора данных, либо в отдельном наборе данных. Без этой информации внести поправку будет невозможно.
The case that the x variable arises randomly is known as the structural model or structural relationship. For example, in a medical study patients are recruited as a sample from a population, and their characteristics such as blood pressure may be viewed as arising from a random sample. Under certain assumptions (typically, normal distribution assumptions) there is a known ratio between the true slope, and the expected estimated slope. Frost and Thompson (2000) review several methods for estimating this ratio and hence correcting the estimated slope. The term regression dilution ratio, although not defined in quite the same way by all authors, is used for this general approach, in which the usual linear regression is fitted, and then a correction applied. The reply to Frost & Thompson by Longford (2001) refers the reader to other methods, expanding the regression model to acknowledge the variability in the x variable, so that no bias arises. Fuller (1987) is one of the standard references for assessing and correcting for regression dilution. Hughes (1993) shows that the regression dilution ratio methods apply approximately in survival models. Rosner (1992) shows that the ratio methods apply approximately to logistic regression models. Carroll et al. (1995) give more detail on regression dilution in nonlinear models, presenting the regression dilution ratio methods as the simplest case of regression calibration methods, in which additional covariates may also be incorporated. In general, methods for the structural model require some estimate of the variability of the x variable. This will require repeated measurements of the x variable in the same individuals, either in a sub study of the main data set, or in a separate data set. Without this information it will not be possible to make a correction.
Многочисленные переменные x
Случай множественных предикторных переменных, подверженных изменчивости (возможно, коррелированных), хорошо изучен для линейной регрессии и некоторых моделей нелинейной регрессии, в частности, для устранения ослабляющего эффекта ошибки измерения из коэффициента корреляции. В метрологии и статистике эта процедура также называется дезаттенюацией корреляции. Коррекция обеспечивает, чтобы коэффициент корреляции Пирсона между единицами данных (например, людьми) для двух наборов переменных оценивался с учетом погрешности, содержащейся в измерениях этих переменных.
The case of multiple predictor variables subject to variability (possibly correlated) has been well studied for linear regression, and for some non linear regression models. i. e., to "rid a correlation coefficient from the weakening effect of measurement error". In measurement and statistics, the procedure is also called correlation disattenuation or the disattenuation of correlation. The correction assures that the Pearson correlation coefficient across data units (for example, people) between two sets of variables is estimated in a manner that accounts for error contained within the measurement of those variables.
Применимость
Коррекция на разбавление регрессии необходима при статистическом выводе на основе коэффициентов регрессии. Однако в задачах предиктивного моделирования коррекция не требуется и не уместна. При обнаружении изменений коррекция необходима. Чтобы понять это, рассмотрим ошибку измерения следующим образом. Пусть y – переменная результата, x – истинная переменная-предиктор, а w – приближенное наблюдение x. Фрост и Томпсон, например, предполагают, что x может представлять собой истинное, долгосрочное артериальное давление пациента, а w – артериальное давление, измеренное во время одного конкретного визита к врачу. Все эти результаты можно математически доказать в случае простой линейной регрессии при условии нормального распределения (в рамках подхода Фроста и Томпсона). Обсуждалось, что неверно выполненная коррекция на разбавление регрессии, особенно если она проводится без проверки основных предположений, может нанести больше вреда оценке, чем ее отсутствие.
A correction for regression dilution is necessary in statistical inference based on regression coefficients. However, in predictive modelling applications, correction is neither necessary nor appropriate. In change detection, correction is necessary. To understand this, consider the measurement error as follows. Let y be the outcome variable, x be the true predictor variable, and w be an approximate observation of x. Frost and Thompson suggest, for example, that x may be the true, long term blood pressure of a patient, and w may be the blood pressure observed on one particular clinic visit. All of these results can be shown mathematically, in the case of simple linear regression assuming normal distributions throughout (the framework of Frost & Thompson). It has been discussed that a poorly executed correction for regression dilution, in particular when performed without checking for the underlying assumptions, may do more damage to an estimate than no correction.