Введение

В статистике гетерогенность исследований – это явление, часто возникающее при проведении метаанализа или систематического обзора. В идеальном случае, исследования, результаты которых планируется объединить в метаанализе, проводились бы одинаково и по одним и тем же экспериментальным протоколам. Различия в результатах были бы обусловлены лишь погрешностью измерения (и исследования были бы, таким образом, однородными). Гетерогенность исследований указывает на вариабельность результатов, превышающую ту, что можно было бы ожидать или объяснить только погрешностью измерения.

Введение

Метаанализ – это метод, используемый для объединения результатов различных исследований с целью получения количественного синтеза. Размер отдельных клинических исследований часто бывает недостаточным для надежного выявления эффекта лечения. Метаанализ повышает мощность статистического анализа за счет объединения результатов всех доступных исследований. При попытке использовать метаанализ для оценки общего эффекта по группе схожих исследований, эффекты, выявленные в отдельных исследованиях, должны быть достаточно однородными, чтобы можно было с уверенностью сказать, что объединенная оценка будет содержательным описанием совокупности исследований. Однако индивидуальные оценки эффекта лечения будут варьироваться случайно; некоторая вариабельность ожидается из-за погрешности наблюдений. Любая избыточная вариабельность (независимо от того, проявляется она или нет) называется (статистической) гетерогенностью. Наличие некоторой гетерогенности не является редкостью, например, аналогичные эффекты часто встречаются даже внутри одного исследования, в многоцентровых испытаниях (междуцентровая гетерогенность). Причинами дополнительной вариабельности обычно являются различия в самих исследованиях, исследуемых популяциях, схемах лечения, определениях конечных точек или других условиях ("клиническое разнообразие"), либо в способах анализа данных, используемых моделях или в том, были ли оценки скорректированы каким-либо образом ("методологическое разнообразие").

Моделирование

В случае, если источник неоднородности может быть идентифицирован и связан с определенными характеристиками исследования, анализ может быть стратифицирован (путем рассмотрения подгрупп исследований, которые, как ожидается, будут более однородными), или расширен до метарегрессии, учитывающей (непрерывные или категориальные) модераторные переменные. К сожалению, метаанализ, основанный на литературных данных, часто не позволяет собрать данные по всем (потенциально) релевантным модераторам. Кроме того, неоднородность обычно учитывается с помощью модели случайных эффектов, в которой она представляет собой компонент дисперсии. Модель отражает недостаток знаний о причинах различий в эффектах лечения, рассматривая (потенциальные) различия как неизвестные. Центр этого симметричного распределения описывает среднее значение эффектов, а его ширина – степень неоднородности. Очевидным и общепринятым выбором распределения является нормальное распределение. Установить обоснованность какого-либо предположения о распределении сложно, и это является распространенной критикой метаанализов со случайными эффектами. Однако, вариации точной формы распределения могут не иметь существенного значения, и моделирование показало, что методы относительно устойчивы даже при экстремальных предположениях о распределении, как при оценке неоднородности, так и при расчете общего размера эффекта. Включение случайного эффекта в модель делает выводы (в определенном смысле) более консервативными или осторожными, поскольку (ненулевая) неоднородность приводит к большей неопределенности (и предотвращает излишнюю уверенность) при оценке общих эффектов. В частном случае нулевой дисперсии неоднородности модель случайных эффектов снова сводится к частному случаю модели общих эффектов. Однако, общие модели метаанализа, разумеется, не следует применять слепо или наивно к собранным наборам оценок. Если результаты, подлежащие объединению, существенно различаются (по контексту или по оцененным эффектам), полученное метааналитическое среднее может в конечном итоге не соответствовать разумной оценке. Когда отдельные исследования демонстрируют противоречивые результаты, вероятно, существуют причины этих различий; например, у двух субпопуляций могут быть разные фармакокинетические пути. В таком сценарии важно знать и учитывать соответствующие ковариаты в анализе.

Испытания

Статистическое тестирование на ненулевую дисперсию неоднородности часто проводится на основе Q-теста Кокрана или связанных с ним процедур. Однако эта распространенная процедура вызывает вопросы по нескольким причинам, в частности, из-за низкой мощности таких тестов, особенно в очень часто встречающемся случае, когда в анализе объединяется лишь небольшое количество оценок.

Оценка

Хотя основной целью метаанализа обычно является оценка основного эффекта, исследование гетерогенности также крайне важно для его интерпретации. Существует большое количество (фреквентистских и байесовских) оценок. Байесовская оценка гетерогенности обычно требует указания подходящего априорного распределения. В то время как многие из этих оценок ведут себя схожим образом при большом количестве исследований, различия особенно проявляются при небольшом числе оценок – ситуации, часто встречающейся на практике. Часто получается некорректная оценка дисперсии между исследованиями, равная нулю, что приводит к ошибочному предположению об однородности. В целом, представляется, что гетерогенность систематически недооценивается в метаанализах. Показатель I² соотносит величину дисперсии гетерогенности с размерами дисперсий отдельных оценок (квадратами стандартных ошибок); однако, при такой нормализации не всегда очевидно, какие значения гетерогенности следует считать "небольшими" или "большими". При постоянной гетерогенности (τ) наличие исследований разного размера (с соответствующими различными стандартными ошибками) будет влиять на значение I²; поэтому интерпретация конкретного значения I² не является однозначной. Совместное рассмотрение интервала предсказания и интервала доверия для основного эффекта может помочь лучше оценить вклад гетерогенности в неопределенность оценки эффекта.