Введение

Иерархия доказательств, включающая уровни доказательств (LOE), то есть уровни доказательности (EL), является эвристическим методом ранжирования относительной силы результатов, полученных в экспериментальных исследованиях, особенно в медицинских. Существует широкое согласие относительно относительной силы крупномасштабных эпидемиологических исследований. Для оценки медицинских доказательств было предложено более 80 различных иерархий. Дизайн исследования (например, описание клинического случая отдельного пациента или двойное слепое рандомизированное контролируемое исследование) и измеряемые конечные точки (например, выживаемость или качество жизни) влияют на силу доказательств. В клинических исследованиях наиболее надежные данные об эффективности лечения поступают в основном из метаанализов рандомизированных контролируемых исследований (РКИ). Систематические обзоры завершенных, высококачественных рандомизированных контролируемых исследований – такие как публикуемые Кокрейновским сотрудничеством – имеют ту же ценность, что и систематические обзоры завершенных высококачественных наблюдательных исследований при изучении побочных эффектов. Иерархии доказательств часто применяются в практике, основанной на доказательствах, и являются неотъемлемой частью доказательной медицины (EBM).

Определение

В 2014 году Джейкоб Стегенга определил иерархию доказательств как «ранжирование видов методов в соответствии с их потенциальной подверженностью систематическим ошибкам». На вершине иерархии находится метод, обладающий наибольшей свободой от систематических ошибок или наилучшей внутренней валидностью по отношению к предполагаемой эффективности протестированного медицинского вмешательства. В 1997 году Гринхалг предложил рассматривать это как «относительный вес, придаваемый различным типам первичных исследований при принятии решений о клинических вмешательствах». Национальный институт рака определяет уровни доказательств как «систему ранжирования, используемую для оценки силы результатов, полученных в клиническом исследовании или научном изучении. Дизайн исследования [ ] и измеряемые конечные точки [ ] влияют на силу доказательств».

Примеры

Было предложено множество иерархий доказательств. Подобные протоколы для оценки качества исследований все еще находятся в разработке. На данный момент существующие протоколы уделяют относительно мало внимания тому, насколько исследования результатов применимы к оценке эффективности (результата лечения в идеальных условиях) или действенности (результата лечения в реальных, типичных условиях).

Хан и другие.

Протокол оценки качества исследований был предложен в отчете Центра обзоров и распространения информации, подготовленном Khan и соавторами, и предназначен в качестве общего метода оценки как медицинских, так и психосоциальных вмешательств. Хотя протокол настоятельно рекомендует использовать рандомизированные схемы, в нем отмечается, что такие схемы полезны только при соблюдении строгих критериев, таких как истинная рандомизация и сокрытие информации о назначенном методе лечения от пациента и других лиц, включая тех, кто оценивает результаты. В протоколе Khan и соавторов подчеркивается необходимость проведения сравнений по принципу "намерение лечить", чтобы избежать проблем, связанных с большей потерей участников в одной из групп. Протокол Khan и соавторов также устанавливает строгие критерии для нерандомизированных исследований, включая сопоставимость групп по потенциальным вмешивающимся факторам, адекватное описание групп и методов лечения на каждом этапе, а также сокрытие информации о выбранном методе лечения от лиц, оценивающих результаты. Протокол не предусматривает классификацию уровней доказательности, но включает или исключает методы лечения из категории доказательных в зависимости от соответствия исследования заявленным стандартам.

Национальный реестр практик и программ США, основанных на доказательствах

Национальный реестр практик и программ, основанных на доказательствах (NREPP) США разработал протокол оценки. Оценка по этому протоколу проводится только в том случае, если для вмешательства уже были зафиксированы один или несколько положительных результатов с вероятностью менее 0,05, если эти результаты были опубликованы в рецензируемом журнале или отчете об оценке, и если предоставлена соответствующая документация, такая как учебные материалы. Оценка NREPP, которая присваивает рейтинги качества от 0 до 4 по определенным критериям, изучает надежность и валидность используемых в исследовании показателей результатов, наличие доказательств соответствия вмешательству (последовательное применение метода лечения каждый раз), уровни незаполненных данных и оттока участников, потенциальные вмешивающиеся факторы, а также адекватность статистической обработки, включая размер выборки.

Соединенные Штаты

В 1988 году Рабочая группа по профилактическим услугам США (USPSTF) опубликовала свои рекомендации, основанные на CTF, используя те же 3 уровня, с дальнейшим подразделением уровня II. Уровень I: доказательства, полученные как минимум в одном правильно спланированном рандомизированном контролируемом исследовании. Уровень II 1: доказательства, полученные в результате хорошо спланированных контролируемых исследований без рандомизации. Уровень II 2: доказательства, полученные в результате хорошо разработанных когортных или исследований типа «случай-контроль», предпочтительно из нескольких центров или исследовательских групп. Уровень II 3: доказательства, полученные из нескольких серий временных рядов с проведением или без проведения вмешательства. Значительные результаты неконтролируемых исследований также могут рассматриваться как доказательства этого типа. Уровень III: мнения уважаемых экспертов, основанные на клиническом опыте, описательных исследованиях или отчетах экспертных комиссий. За прошедшие годы было описано множество других систем оценки.

Глобальный

В 2007 году система классификации Всемирного фонда исследований рака описывала 4 уровня: убедительные, вероятные, возможные и недостаточные данные. Все исследования «Глобальное бремя болезней» использовали ее для оценки эпидемиологических данных в поддержку причинно-следственных связей.

Сторонники

В 1995 году Уилсон и др., в 1996 году Хадорн и др. и в 1996 году Аткинс и др. описали и обосновали различные типы систем оценивания.

Критика

В 2011 году систематический обзор критической литературы выявил три вида критики: процедурные аспекты EBM (особенно от Картрайта, Уоррала и Ховика), большая, чем ожидалось, подверженность ошибкам EBM (Иоанидис и другие), и неполнота EBM как философии науки (Эшкрофт и другие). Rawlins и Bluhm отмечают, что EBM ограничивает возможность использования результатов исследований для лечения отдельных пациентов, и что для понимания причин заболеваний необходимы исследования как на популяционном уровне, так и лабораторные исследования. Иерархия доказательств EBM не учитывает исследования безопасности и эффективности медицинских вмешательств. РКИ должны быть разработаны "для выявления вариабельности внутри группы, что возможно только при замене иерархии доказательств сетью, учитывающей взаимосвязь между эпидемиологическими и лабораторными исследованиями". Иерархия доказательств, основанная на дизайне исследования, подверглась сомнению, поскольку руководства "не смогли должным образом определить ключевые термины, оценить достоинства определенных нерандомизированных контролируемых исследований и использовать исчерпывающий перечень ограничений дизайна исследования". Стегенга особенно критиковал размещение мета-анализов на вершине таких иерархий. Предположение о необходимости размещения РКИ в верхней части таких иерархий подверглось критике со стороны Уоррала и Картрайта. В 2005 году Росс Апшур заявил, что EBM претендует на роль нормативного руководства для врачей, стремящихся к совершенству, но не является философской доктриной. Боргерсон в 2009 году писал, что обоснования для уровней иерархии не являются абсолютными и не обладают эпистемической обоснованностью, но что "медицинским исследователям следует уделять больше внимания социальным механизмам управления распространенными предубеждениями". Ла Кейз отметила, что фундаментальная наука находится на нижних уровнях EBM, хотя она "играет роль в разработке экспериментов, а также в анализе и интерпретации данных". Конкато в 2004 году заявил, что EBM придает РКИ чрезмерный авторитет и что не на все исследовательские вопросы можно ответить с помощью РКИ, либо по практическим, либо по этическим соображениям. Даже при наличии данных из высококачественных РКИ, данные из других типов исследований могут оставаться актуальными. Stegenga считает, что схемы оценки доказательств неоправданно ограничительны и менее информативны, чем другие доступные схемы.