Введение

Анализ выживаемости — это раздел статистики, предназначенный для анализа ожидаемой продолжительности времени до наступления одного события, такого как смерть биологических организмов и отказ в механических системах. В инженерной области эта тема называется теорией надёжности или анализом надёжности, в экономике — анализом длительности или моделированием длительности, а в социологии — анализом истории событий. Анализ выживаемости стремится ответить на определённые вопросы, например, какова доля популяции, которая переживёт определённый момент времени? Среди тех, кто пережил, с какой скоростью они умрут или выйдут из строя? Можно ли учесть множество причин смерти или отказа? Как конкретные обстоятельства или характеристики повышают или понижают вероятность выживания? Для ответа на эти вопросы необходимо определить понятие «продолжительность жизни». В случае биологического выживания смерть однозначна, но для механической надёжности отказ может быть нечётко определён, поскольку существуют механические системы, в которых отказ может быть частичным, зависеть от степени выраженности или быть не локализованным во времени. Даже в биологических задачах некоторые события (например, сердечный приступ или другая недостаточность органов) могут иметь ту же неоднозначность. Теория, изложенная ниже, предполагает чётко определённые события в конкретные моменты времени; другие случаи могут быть лучше изучены с помощью моделей, которые явно учитывают неоднозначные события. В более широком смысле анализ выживаемости включает моделирование времени до наступления события; в этом контексте смерть или отказ рассматриваются как «событие» в литературе по анализу выживаемости — традиционно для каждого объекта происходит только одно событие, после которого организм или механизм погибает или ломается. Модели повторяющихся событий ослабляют это предположение. Изучение повторяющихся событий актуально для надёжности систем, а также во многих областях социальных наук и медицинских исследований.

График KaplanMeier для данных AML

Функция выживаемости S(t) – это вероятность того, что пациент выживет дольше времени t. S(t) теоретически представляет собой гладкую кривую, но обычно оценивается с использованием кривой Каплана-Мейера (KM). График показывает кривую Каплана-Мейера для данных AML и может быть интерпретирован следующим образом:

Ось X – это время, от нуля (момент начала наблюдения) до последней зафиксированной точки времени. Ось Y – доля выживших пациентов. В момент времени ноль 100% пациентов живы и не имели события. Сплошная линия, напоминающая ступеньки, показывает прогрессирование наступления событий. Вертикальное падение указывает на наступление события. В таблице данных AML, представленной выше, у двух пациентов произошло событие на пятой неделе, у двух – на восьмой неделе, у одного – на девятой неделе и так далее. Эти события на пятой, восьмой неделе и т.д. обозначаются вертикальными падениями на кривой KM в соответствующие моменты времени. В самом правом конце кривой KM находится отметка на 161 неделе. Вертикальная отметка указывает на то, что данные пациента были подвергнуты цензуре в этот момент времени. В таблице данных AML пять пациентов были подвергнуты цензуре на 13, 16, 28, 45 и 161 неделях. На кривой KM имеется пять отметок, соответствующих этим цензурированным наблюдениям.

Таблица срока службы для данных AML

Таблица выживаемости обобщает данные о выживаемости с точки зрения количества событий и доли выживших в каждый момент времени. Представлена таблица выживаемости для данных AML, созданная с использованием программного обеспечения R. Таблица выживаемости обобщает события и долю выживших в каждый момент времени. Столбцы в таблице выживаемости имеют следующую интерпретацию:

time – это моменты времени, в которые происходят события. n.risk – количество пациентов, находящихся под наблюдением непосредственно перед моментом времени t. Находиться "под наблюдением" означает, что у пациента не было события до времени t и он не был исключен из анализа до или в момент времени t.
n.event – количество пациентов, у которых произошло событие в момент времени t.
survival – доля выживших, рассчитанная с использованием оценки Каплана-Мейера (product limit estimate). std.err – стандартная ошибка оценки выживаемости. Стандартная ошибка оценки Каплана-Мейера рассчитывается по формуле Гринвуда и зависит от числа пациентов под наблюдением (n.risk в таблице), количества событий (n.event в таблице) и доли выживших (survival в таблице). lower 95% CI и upper 95% CI – нижняя и верхняя границы 95% доверительного интервала для доли выживших.

Тест на логистическую степень: проверка различий в выживаемости в данных о количестве случаев заболевания

Тест логранга сравнивает время выживания двух или более групп. В этом примере тест логранга используется для оценки различий в выживаемости между группами, получающими поддерживающую терапию, и группами, не получающими ее, на основе данных о лейкемии. График показывает кривые Каплана-Мейера для данных о лейкемии, разделенные по группам лечения, что обозначено переменной "x" в данных. Нулевая гипотеза теста логранга заключается в том, что группы имеют одинаковую выживаемость. Ожидаемое число пациентов, выживших в каждый момент времени в каждой группе, корректируется с учетом числа пациентов в риске в группах в момент наступления события. Тест логранга определяет, существенно ли наблюдаемое число событий в каждой группе отличается от ожидаемого. Формальный тест основан на статистике хи-квадрат. Большое значение статистики логранга свидетельствует о различии во времени выживания между группами. Статистика логранга приблизительно имеет распределение хи-квадрат с одной степенью свободы, а p-значение рассчитывается с использованием теста хи-квадрат. Для представленных данных тест логранга на разницу в выживаемости дает p-значение p=0,0653, что указывает на отсутствие значимых различий в выживаемости между группами лечения при уровне значимости альфа = 0,05. Объем выборки в 23 пациента невелик, поэтому возможности обнаружить различия между группами лечения ограничены. Тест хи-квадрат основан на асимптотическом приближении, поэтому p-значение следует интерпретировать с осторожностью при небольших размерах выборки.

Пропорциональный риск Кокса (PH)

Кривые Каплана–Мейера и тесты лог-ранга наиболее полезны, когда предикторная переменная является категориальной (например, препарат против плацебо) или принимает небольшое число значений (например, дозы препарата 0, 20, 50 и 100 мг/сутки), которые можно рассматривать как категориальные. Тест лог-ранга и кривые Каплана–Мейера сложно применять с количественными предикторами, такими как экспрессия генов, количество лейкоцитов или возраст. Для количественных предикторных переменных альтернативным методом является регрессионный анализ пропорциональных рисков Кокса. Модели Кокса PH также работают с категориальными предикторными переменными, которые кодируются как индикаторные или фиктивные переменные {0,1}. Тест лог-ранга является частным случаем анализа Кокса PH и может быть выполнен с использованием программного обеспечения для анализа Кокса PH.

Модель Кокса с использованием ковариатов в данных о меланоме

Модель Кокса расширяет лог-ранговый критерий, позволяя включать дополнительные ковариаты. В этом примере используется набор данных о меланоме, где предикторы включают непрерывный ковариат – толщину опухоли (название переменной = "thick"). На гистограммах значения толщины имеют положительную асимметрию и не имеют нормального, симметричного распределения вероятностей. Регрессионные модели, включая модель Кокса, обычно дают более надежные результаты с нормально распределенными переменными. Для этого примера можно использовать логарифмическое преобразование. Логарифм толщины опухоли выглядит более нормально распределенным, поэтому в моделях Кокса будет использоваться логарифм толщины. Результаты анализа пропорциональных рисков Кокса представлены в блоке результатов. P-значение для всех трех общих тестов (функции правдоподобия, Уолда и оценки) является значимым, что указывает на значимость модели. P-значение для log(thick) составляет 6.9e-07, с отношением рисков HR = exp(coef) = 2.18, что указывает на сильную связь между толщиной опухоли и повышенным риском смерти. В отличие от этого, p-значение для пола теперь равно p=0.088. Отношение рисков HR = exp(coef) = 1.58, с 95% доверительным интервалом от 0.934 до 2.68. Поскольку доверительный интервал для HR включает 1, эти результаты показывают, что пол вносит меньший вклад в разницу в HR после учета толщины опухоли, и лишь демонстрирует тенденцию к значимости. Анализ графиков log(толщины) по полу и t-тест log(толщины) по полу показывают, что существует значимая разница между мужчинами и женщинами в толщине опухоли при первом обращении к врачу. Модель Кокса предполагает пропорциональность рисков. Предположение о пропорциональности рисков можно проверить с помощью функции cox.zph в R. P-значение меньше 0.05 указывает на то, что риски не пропорциональны. Для данных о меланоме мы получаем p=0.222. Следовательно, мы не можем отвергнуть нулевую гипотезу о пропорциональности рисков. Дополнительные тесты и графики для анализа модели Кокса описаны в указанных учебниках.

Расширения моделей Кокса

Модели Кокса могут быть расширены для работы с различными модификациями простого анализа. Стратификация. Субъекты исследования могут быть разделены на страты, при этом ожидается, что субъекты внутри одной страты будут относительно более схожи друг с другом, чем с случайно выбранными субъектами из других страт. Предполагается, что параметры регрессии остаются одинаковыми для всех страт, однако для каждой страты может существовать своя базовая функция риска. Стратификация полезна для анализа данных по сопоставленным субъектам, для работы с подгруппами пациентов, например, из разных клиник, и для учета нарушений допущения о пропорциональности рисков. Ковариаты, изменяющиеся во времени. Некоторые переменные, такие как пол и группа лечения, обычно остаются постоянными в ходе клинического исследования. Другие клинические переменные, например, уровни сывороточных белков или дозы сопутствующих препаратов, могут изменяться в течение исследования. Модели Кокса могут быть расширены для учета таких ковариатов, зависящих от времени.

Модели выживания по древесной структуре

Модель регрессии Кокса PH является линейной моделью. Она аналогична линейной и логистической регрессии. В частности, эти методы исходят из того, что одной прямой, кривой, плоскости или поверхности достаточно для разделения групп (выживших, не выживших) или для оценки количественного показателя (время до события). Однако в некоторых случаях альтернативные разбиения позволяют получить более точную классификацию или количественные оценки. Одним из наборов альтернативных методов являются модели выживаемости, построенные на деревьях решений, включая случайные леса выживаемости. Модели выживаемости, построенные на деревьях решений, могут давать более точные прогнозы, чем модели Кокса. Рассмотрение обоих типов моделей для конкретного набора данных является разумной стратегией.

Пример анализа дерева выживания

В этом примере анализа дерева выживания используется R-пакет "rpart". Пример основан на данных 146 пациентов с раком предстательной железы стадии C из набора данных stagec в пакете rpart. Пакет rpart и пример stagec описаны в работе Atkinson и Therneau (1997), которая также распространяется в виде руководства (виньетки) к пакету rpart. Пакет randomForestSRC включает пример анализа случайного леса для данных о выживаемости с использованием набора данных pbc. Эти данные получены в ходе исследования первичного билиарного цирроза (ПБЦ) в клинике Майо, проводившегося с 1974 по 1984 год. В примере модель случайного леса для анализа выживаемости дает более точные прогнозы выживаемости, чем модель пропорциональных рисков Кокса (Cox PH). Ошибки прогнозирования оцениваются методом бутстрэп-перевыборки.

Модели выживания глубокого обучения

Недавние достижения в области глубокого обучения представлений были применены к оценке выживаемости. Модель DeepSurv предлагает заменить лог-линейную параметризацию модели CoxPH многослойным перцептроном. Дальнейшие разработки, такие как Deep Survival Machines и Deep Cox Mixtures, включают использование моделей смесей скрытых переменных для моделирования распределения времени до события как смеси параметрических или полупараметрических распределений, одновременно изучая представления входных предикторов. Методы глубокого обучения продемонстрировали превосходные результаты, особенно при работе со сложными типами входных данных, такими как изображения и клинические временные ряды.

Цензура

Цензурирование – это форма проблемы отсутствия данных, при которой время до наступления события не наблюдается по причинам, таким как завершение исследования до того, как у всех включенных участников наступило интересующее событие, или участник покинул исследование до наступления события. Цензурирование часто встречается в анализе выживаемости. Если известно только нижнее ограничение *l* для истинного времени события *T*, такое что *T* > *l*, это называется цензурированием справа. Цензурирование справа возникает, например, для участников, дата рождения которых известна, но которые все еще живы, когда они выбывают из наблюдения или когда исследование заканчивается. Мы обычно сталкиваемся с данными, цензурированными справа. Если интересующее событие уже произошло до включения участника в исследование, но неизвестно, когда именно, данные считаются цензурированными слева. Интервальное цензурирование имеет место, когда можно лишь утверждать, что событие произошло между двумя наблюдениями или обследованиями. Цензурирование слева возникает, например, когда постоянный зуб уже прорезался до начала стоматологического исследования, направленного на оценку распределения времени его прорезывания. В том же исследовании время прорезывания может быть интервально цензурировано, если постоянный зуб присутствует во рту во время текущего обследования, но отсутствовал на предыдущем. Интервальное цензурирование часто встречается в исследованиях ВИЧ/СПИДа. Действительно, время до сероконверсии ВИЧ можно определить только с помощью лабораторного анализа, который обычно начинается после посещения врача. В этом случае можно лишь заключить, что сероконверсия ВИЧ произошла между двумя обследованиями. То же самое справедливо и для диагностики СПИДа, которая основана на клинических симптомах и требует подтверждения медицинским осмотром. Также может случиться, что участники с продолжительностью жизни, меньшей определенного порога, вообще не наблюдаются: это называется усечением. Важно отметить, что усечение отличается от цензурирования слева, поскольку для данных, цензурированных слева, мы знаем, что участник существовал, а для усеченных данных мы можем быть совершенно не осведомлены о существовании участника. Усечение также часто встречается. В так называемых исследованиях с отсроченным включением участники не наблюдаются до тех пор, пока не достигнут определенного возраста. Например, люди могут не наблюдаться до достижения ими возраста поступления в школу. Любые умершие участники в дошкольном возрасте будут неизвестны. Данные, усеченные слева, часто встречаются в актуарной работе при страховании жизни и пенсионном обеспечении. Данные, цензурированные слева, могут возникать, когда время выживания человека становится неполным с левой стороны периода наблюдения. Например, в эпидемиологическом исследовании мы можем наблюдать за пациентом на предмет инфекционного заболевания, начиная с момента получения положительного результата теста на инфекцию. Хотя мы можем знать продолжительность наблюдения справа, мы можем никогда не узнать точное время воздействия инфекционного агента.

Непараметрическая оценка

Для оценки функции выживаемости можно использовать оценщик Каплана–Мейера. Оценщик Нельсона–Аалена можно использовать для непараметрической оценки функции кумулятивных рисков. Для работы этих оценщиков требуются данные о времени до события. Периодические данные о количестве случаев (когорты) и смертей (и выздоровлений) статистически достаточны для получения непараметрических оценок максимального правдоподобия и метода наименьших квадратов функций выживаемости, без использования данных о продолжительности жизни.

Хорошее приспособление

Качество подгонки моделей выживания можно оценить с помощью скоринговых правил.

Компьютерная программа для анализа выживаемости

В учебнике Клейнбаума приведены примеры анализа выживаемости с использованием SAS, R и других пакетов. В учебниках Брострома и Далгарда приведены примеры анализа выживаемости с использованием R (или S, которые можно запустить в R).