Введение
В статистике, регрессия с единичными весами является упрощенной и устойчивой версией (Wainer & Thissen, 1976) множественного регрессионного анализа, в которой оценивается только константа (пересечение). То есть, она аппроксимирует модель
где каждая из является бинарной переменной, возможно, умноженной на произвольный вес. Это отличается от более распространенной модели множественной регрессии, в которой каждый предиктор имеет свой собственный оцениваемый коэффициент:
В социальных науках регрессия с единичными весами иногда используется для бинарной классификации, то есть для предсказания ответа "да" или "нет", где обозначает "нет", а – "да". Она проще в интерпретации, чем множественная линейная регрессия (которая в случае классификации известна как линейный дискриминантный анализ).
Единичные веса
Единица взвешенной регрессии – это метод устойчивой регрессии, который выполняется в три этапа. Сначала отбираются предикторы интересующей переменной результата; желательно, чтобы для этого отбора существовали веские эмпирические или теоретические основания. Затем предикторы приводятся к стандартному виду. И, наконец, предикторы суммируются, и эта сумма называется вариатой, которая используется в качестве предиктора переменной результата.
Метод Бёрджесса
Метод Берджесса был впервые представлен социологом Эрнестом В. Берджессом в исследовании 1928 года для определения успешности или неуспешности заключенных, освобожденных условно-досрочно. Сначала он выбрал 21 переменную, которая, как предполагалось, связана с успешностью условно-досрочного освобождения. Затем он преобразовал каждый предиктор в стандартную форму, используя значения ноль или один (Берджесс, 1928). Если предиктор имел два значения, значение, соответствующее целевому результату, кодировалось как единица. Берджесс выбрал успешное условно-досрочное освобождение в качестве целевого результата, поэтому такой предиктор, как наличие истории краж, был закодирован как "да" = 0 и "нет" = 1. Эти закодированные значения затем суммировались для создания итогового балла по предиктору, так что более высокие баллы указывали на более высокую вероятность успеха. Итоговые баллы могли варьироваться от нуля (отсутствие предикторов успеха) до 21 (все 21 предиктор показали признаки, предсказывающие успех). Для предикторов с более чем двумя значениями метод Берджесса выбирает пороговое значение на основе субъективной оценки. Например, в исследовании, использующем метод Берджесса (Gottfredson & Snyder, 2005), одним из предикторов было выбрано количество жалоб на противоправное поведение. При неудаче условно-досрочного освобождения в качестве целевого результата количество жалоб кодировалось следующим образом: "от нуля до двух жалоб" = 0 и "три и более жалоб" = 1 (Gottfredson & Snyder, 2005. с. 18).
Метод Керби
Метод Керби аналогичен методу Берджесса, но отличается двумя аспектами. Во-первых, в то время как метод Берджесса использует субъективную оценку для выбора порогового значения для многозначного предиктора с бинарным исходом, метод Керби использует анализ дерева классификации и регрессии (CART). Таким образом, выбор порогового значения основывается не на субъективной оценке, а на статистическом критерии, например, на точке, где значение хи-квадрат достигает максимума. Второе отличие заключается в том, что метод Берджесса применяется к бинарному исходу, а метод Керби может применяться к исходу с несколькими значениями, поскольку анализ CART способен определять пороговые значения и в таких случаях, используя критерий, например, точку, где значение t достигает максимума. Поскольку анализ CART не только позволяет работать с бинарными данными, но и является рекурсивным, результатом может стать повторное разделение предикторной переменной, приводящее к двум пороговым значениям. Стандартная форма для каждого предиктора предполагает добавление единицы при создании разделения в ходе анализа CART. В одном исследовании (Kerby, 2003) в качестве предикторов были выбраны пять черт из Большой пятерки черт личности для прогнозирования многозначной оценки суицидальных мыслей. Затем оценки личности были преобразованы в стандартную форму с помощью анализа CART. Когда анализ CART давал одно разделение, результат был аналогичен методу Берджесса, поскольку предиктор кодировался как 0 или 1. Однако для измерения невротизма был получен результат с двумя пороговыми значениями. Поскольку более высокие баллы по невротизму коррелировали с более выраженными суицидальными мыслями, эти два пороговых значения привели к следующей кодировке: «низкий невротизм» = 0, «умеренный невротизм» = 1, «высокий невротизм» = 2 (Kerby, 2003).
Метод z-оценки
Другой метод может быть применен, когда предикторы измеряются в непрерывном масштабе. В этом случае каждый предиктор можно преобразовать в стандартизированную оценку, или z-оценку, так, чтобы все предикторы имели среднее значение, равное нулю, и стандартное отклонение, равное единице. При использовании этого метода регрессии с единичными весами, переменная является суммой z-оценок (например, Dawes, 1979; Bobko, Roth, & Buster, 2007).
Обзор литературы
Первое эмпирическое исследование с использованием регрессии с единичными весами широко считается исследованием 1928 года, проведенным социологом Эрнестом В. Берджессом. Он использовал 21 переменную для прогнозирования успеха или неудачи условно-досрочного освобождения, и результаты показывают, что единичные веса являются полезным инструментом при принятии решений о том, каких заключенных следует освободить условно-досрочно. Среди заключенных с наивысшими баллами 98% действительно добились успеха на свободе; а среди заключенных с наихудшими результатами – только 24% (Burgess, 1928). Математические аспекты регрессии с единичными весами впервые были рассмотрены в 1938 году Сэмюэлем Стэнли Уилксом, ведущим статистиком, проявлявшим особый интерес к многомерному анализу. Уилкс описал, как единичные веса могут быть использованы на практике, когда недостаточно данных для оценки бета-весов. Например, небольшой колледж может захотеть отобрать хороших студентов для поступления, но у него может не быть средств для сбора данных и проведения стандартного множественного регрессионного анализа. В этом случае колледж может использовать несколько предикторов: оценки в школе, результаты SAT, оценки учителей. Уилкс (1938) математически показал, почему единичные веса должны хорошо работать на практике. Фрэнк Шмидт (1971) провел имитационное исследование единичных весов, и его результаты подтвердили правоту Уилкса, показав, что единичные веса, как правило, хорошо работают в имитациях практических исследований. Робин Доус (1979) обсудила использование единичных весов в прикладных исследованиях, подчеркивая их надежную эффективность. Джейкоб Коэн также говорил о ценности единичных весов и отмечал их практическую применимость. Он даже писал: «С практической точки зрения, в большинстве случаев, нам лучше использовать единичные веса» (Cohen, 1990, с. 1306). Дейв Керби (2003) показал, что единичные веса сопоставимы со стандартной регрессией, используя для этого перекрестную валидацию: он вычислил бета-веса в одной выборке и применил их к другой. В качестве интересующего исхода рассматривались суицидальные мысли, а предикторами – общие черты личности. В выборке для перекрестной валидации корреляция между личностными чертами и суицидальными мыслями была немного выше при регрессии с единичными весами (r = 0,48), чем при стандартной множественной регрессии (r = 0,47). Готфредсон и Снайдер (2005) сравнили метод Берджесса с использованием регрессии с единичными весами с другими методами, используя конструктивную выборку размером N = 1924 и выборку для перекрестной валидации размером N = 7552. Используя бисериальный коэффициент корреляции Пирсона, размер эффекта в выборке для перекрестной валидации для модели с единичными весами составил r = 0,392, что несколько больше, чем для логистической регрессии (r = 0,368) и анализа предиктивных атрибутов (r = 0,387), и лишь незначительно меньше, чем для множественной регрессии (r = 0,397). В обзоре литературы по единичным весам Бобко, Рот и Бастер (2007) отметили, что «единичные веса и веса регрессии показывают схожие результаты с точки зрения величины множественной корреляции, проверенной перекрестной валидацией, и эмпирические исследования подтверждают этот результат на протяжении нескольких десятилетий» (с. 693). Андреас Граефе применил подход равного взвешивания к девяти установленным моделям множественной регрессии для прогнозирования президентских выборов в США. В течение десяти выборов с 1976 по 2012 год одинаково взвешенные предикторы в среднем снизили ошибку прогноза исходных моделей регрессии на четыре процента. Модель с равными весами, включающая все переменные, обеспечила откалиброванные прогнозы, которые уменьшили ошибку самой точной модели регрессии на 29%.
Пример
Пример может прояснить, как единичные веса могут быть полезны на практике. Бренна Брай и коллеги (1982) рассмотрели вопрос о причинах употребления наркотиков подростками. Предыдущие исследования использовали множественную регрессию; при этом методе естественно искать лучший предиктор, тот, который имеет наибольший бета-коэффициент. Брай и коллеги отметили, что одно предыдущее исследование показало, что раннее употребление алкоголя является лучшим предиктором. Другое исследование выявило, что отчуждение от родителей является лучшим предиктором. Третье исследование показало, что низкие оценки в школе являются лучшим предиктором. Отсутствие воспроизводимости результатов было очевидной проблемой, которая могла быть вызвана нестабильностью бета-коэффициентов. Брай и коллеги предложили иной подход: вместо поиска лучшего предиктора они рассмотрели количество предикторов. Иными словами, они присвоили единичный вес каждому предиктору. В их исследовании было выделено шесть предикторов: 1) низкие оценки в школе, 2) отсутствие религиозной принадлежности, 3) раннее употребление алкоголя, 4) психологический дистресс, 5) низкая самооценка и 6) отчуждение от родителей. Чтобы привести предикторы к стандартной форме, каждый фактор риска оценивался как отсутствующий (оценивался нулем) или присутствующий (оценивался единицей). Например, кодировка низких оценок в школе была следующей: "C или выше" = 0, "D или F" = 1. Результаты показали, что количество факторов риска является хорошим предиктором употребления наркотиков: подростки с большим количеством факторов риска с большей вероятностью употребляют наркотики. Модель, использованная Брай и коллегами, заключалась в том, что потребители наркотиков не отличаются каким-либо особым образом от не употребляющих наркотики. Скорее, они различаются по количеству проблем, с которыми им приходится сталкиваться. «Количество факторов, с которыми должен справляться человек, важнее, чем конкретные факторы» (стр. 277). Учитывая эту модель, регрессия с единичными весами является подходящим методом анализа.
Веса бета
При стандартной множественной регрессии каждый предиктор умножается на число, называемое бета-коэффициентом, весом регрессии или взвешенными коэффициентами регрессии (обозначаемыми βW или BW). Прогноз вычисляется путем суммирования этих произведений вместе с константой. Если веса выбираются таким образом, чтобы обеспечить наилучший прогноз по определенному критерию, модель называется корректной линейной моделью. Следовательно, множественная регрессия является корректной линейной моделью. В отличие от этого, регрессия с единичными весами называется некорректной линейной моделью.
Спецификация модели
Стандартная множественная регрессия основывается на предположении, что все значимые предикторы исхода включены в регрессионную модель. Это предположение называется спецификацией модели. Модель считается правильно специфицированной, когда в нее включены все значимые предикторы и исключены все незначимые предикторы. На практике редко удается заранее определить все значимые предикторы. В этом случае модели не специфицированы, и оценки коэффициентов регрессии (бета-весов) подвержены смещению из-за пропущенных переменных. То есть, значения бета-весов могут меняться от одной выборки к другой, ситуация, которую иногда называют проблемой «прыгающих бета». Именно эта проблема «прыгающих бета» делает регрессию с единичными весами полезным методом.