Введение
Статистический анализ, при котором размер выборки не фиксируется заранее. В статистике последовательный анализ, или последовательное проверка гипотез, – это статистический анализ, в котором размер выборки не задается заранее. Вместо этого данные оцениваются по мере поступления, и дальнейший сбор данных прекращается в соответствии с заранее определенным правилом остановки, как только получены статистически значимые результаты. Таким образом, к выводу можно прийти на более ранней стадии, чем при использовании традиционных методов проверки гипотез или оценки параметров, что позволяет снизить финансовые и/или человеческие ресурсы.
In statistics, sequential analysis or sequential hypothesis testing is statistical analysis where the sample size is not fixed in advance. Instead data is evaluated as it is collected, and further sampling is stopped in accordance with a pre defined stopping rule as soon as significant results are observed. Thus a conclusion may sometimes be reached at a much earlier stage than would be possible with more classical hypothesis testing or estimation, at consequently lower financial and/or human cost.
История
Метод последовательного анализа впервые приписывается Аврааму Уолду совместно с Якобом Вольфовицем, В. Алленом Уоллисом и Милтоном Фридманом, работавшими в Статистической исследовательской группе Колумбийского университета в качестве инструмента для повышения эффективности контроля качества в промышленности во время Второй мировой войны. Ценность метода для военных усилий была быстро признана, что привело к присвоению ему грифа "конфиденциально". Одновременно Джордж Барнард руководил группой, занимавшейся изучением оптимальной остановки в Великобритании. Еще один ранний вклад в развитие метода внесли К. Дж. Ароу, Д. Блэкуэлл и М. А. Гиршик. Похожий подход был независимо разработан с нуля примерно в то же время Аланом Тьюрингом в рамках техники Banburismus, использовавшейся в Блетчли-парке для проверки гипотез о том, следует ли объединять и анализировать вместе различные сообщения, зашифрованные немецкими машинами Enigma. Эта работа оставалась секретной до начала 1980-х годов. Питер Армитаж внедрил использование последовательного анализа в медицинских исследованиях, особенно в области клинических испытаний. Последовательные методы получили все большее распространение в медицине благодаря работам Стюарта Покока, который предоставил четкие рекомендации по контролю уровня ошибок первого рода в последовательных схемах.
Функции расходов Альфа
Когда исследователи многократно анализируют данные с поступлением новых наблюдений, возрастает вероятность ошибки первого рода. Поэтому важно корректировать уровень альфа при каждом промежуточном анализе, чтобы общая вероятность ошибки первого рода оставалась на заданном уровне. Это концептуально схоже с коррекцией Бонферрони, но поскольку повторные анализы данных зависимы, можно использовать более эффективные методы корректировки уровня альфа. Одним из первых предложений является граница Покока. Существуют альтернативные способы контроля вероятности ошибки первого рода, такие как границы Хейбитла–Петo, а дополнительная работа по определению границ для промежуточных анализов была проведена О’Брайеном и Флемингом, а также Вангом и Тсиатисом. Ограничением корректировок, таких как граница Покока, является то, что количество анализов данных должно быть определено до начала сбора данных, и что эти анализы должны проводиться через равные промежутки времени (например, после 50, 100, 150 и 200 пациентов). Метод функции расходования альфа, разработанный Деметом и Ланом, не имеет этих ограничений и, в зависимости от выбранных параметров функции расходования, может быть очень близок к границам Покока или корректировкам, предложенным О’Брайеном и Флемингом. Другой подход, лишенный подобных ограничений, основан на e-величинах и e-процессах.
Клинические испытания
В рандомизированном исследовании с двумя группами лечения групповое последовательное тестирование может проводиться, например, следующим образом: после набора n испытуемых в каждую группу проводится промежуточный анализ. Выполняется статистический тест для сравнения двух групп, и если нулевая гипотеза отвергается, исследование прекращается; в противном случае исследование продолжается, набирается еще n испытуемых в каждую группу, и статистический тест выполняется повторно, с учетом всех испытуемых. Если нулевая гипотеза отвергается, исследование прекращается, и в противном случае проводятся периодические оценки до достижения максимального количества промежуточных анализов, после чего выполняется последний статистический тест и исследование завершается.
Другие применения
Последовательный анализ также связан с проблемой разорения игрока, которую изучал, в частности, Гюйгенс в 1657 году. Обнаружение скачка – это процесс выявления резких изменений среднего уровня временного ряда или сигнала. Обычно это рассматривается как частный случай статистического метода, известного как обнаружение точек изменения. Зачастую скачок незначителен, а временной ряд подвержен воздействию шума, что затрудняет задачу, поскольку скачок может быть скрыт шумом. Поэтому часто требуются статистические и/или алгоритмы обработки сигналов. Когда алгоритмы запускаются в режиме реального времени по мере поступления данных, особенно с целью генерации оповещения, это является применением последовательного анализа.
Предвзятость
Испытания, которые прекращаются досрочно из-за отклонения нулевой гипотезы, как правило, переоценивают истинный размер эффекта. Это происходит потому, что в небольших выборках только большие оценки размера эффекта приводят к статистически значимому результату и, как следствие, к досрочному прекращению исследования. Предложены методы коррекции оценок размера эффекта для отдельных исследований. Важно отметить, что эта систематическая ошибка наиболее актуальна при интерпретации отдельных исследований. В метаанализах переоценки размера эффекта, вызванные ранним прекращением, компенсируются недооценками в исследованиях, которые завершаются поздно, что позволило Schou & Marschner заключить, что "досрочное прекращение клинических испытаний не является существенным источником систематической ошибки в метаанализах". Интерпретация p-значений в последовательных анализах также меняется, поскольку при использовании последовательных анализов выполняется несколько анализов, и стандартное определение p-значения как вероятности получения данных "по крайней мере столь же экстремальных", как наблюдаемые, требует пересмотра. Одним из решений является упорядочение p-значений серии последовательных тестов в зависимости от времени остановки и величины тестовой статистики на момент анализа, что известно как поэтапное упорядочение и было впервые предложено Армитажем.