Введение

Многофакторное понижение размерности (MDR) — это статистический подход, также используемый в автоматизированных методах машинного обучения, для выявления и характеристики комбинаций признаков или независимых переменных, которые взаимодействуют, влияя на зависимую или классовую переменную. MDR был разработан специально для идентификации неаддитивных взаимодействий между дискретными переменными, влияющими на бинарный исход, и рассматривается как непараметрическая и не зависящая от модели альтернатива традиционным статистическим методам, таким как логистическая регрессия. В основе метода MDR лежит конструктивный индукционный или алгоритм разработки признаков, который преобразует две или более переменных или признаков в один признак. Этот процесс создания нового признака изменяет пространство представлений данных. Конечная цель — создать или обнаружить представление, которое облегчает выявление нелинейных или неаддитивных взаимодействий между признаками, таким образом улучшая предсказание классовой переменной по сравнению с исходным представлением данных.

Машинное обучение с помощью MDR

Как показано выше, базовый алгоритм конструктивной индукции в MDR очень прост. Однако его реализация для поиска закономерностей в реальных данных может быть вычислительно сложной. Как и в случае с любым алгоритмом машинного обучения, всегда существует риск переобучения. То есть, алгоритмы машинного обучения хорошо выявляют закономерности даже в совершенно случайных данных. Часто бывает трудно определить, представляет ли обнаруженная закономерность важный сигнал или является лишь случайностью. Один из подходов – оценка способности модели к обобщению на независимых наборах данных с использованием методов, таких как перекрестная проверка. Модели, описывающие случайные данные, обычно не обобщаются. Другой подход заключается в создании множества случайных перестановок данных, чтобы выяснить, какие закономерности обнаружит алгоритм поиска данных, получив возможность переобучиться. Пермутационное тестирование позволяет получить эмпирическое p-значение для результата. Воспроизведение результатов на независимых данных также может служить доказательством в пользу модели MDR, но может быть чувствительно к различиям между наборами данных. Все эти подходы оказались полезными для выбора и оценки моделей MDR. Важным этапом в задаче машинного обучения является интерпретация результатов. Для MDR использовались различные подходы, включая энтропийный анализ и анализ путей. Рассмотрены рекомендации и подходы к использованию MDR для моделирования взаимодействий между генами.

Расширения на MDR

В модель MDR было внесено множество расширений. Среди них — методы, основанные на анализе семей, нечёткие методы, корректировка на ковариаты, отношения шансов, баллы риска, методы анализа выживаемости, робастные методы, методы для количественных признаков и многие другие.

Применение МДР

МДР в основном использовался для выявления генно-генных взаимодействий или эпистаза в генетических исследованиях распространенных заболеваний человека, таких как фибрилляция предсердий, аутизм, рак мочевого пузыря, рак молочной железы, сердечно-сосудистые заболевания, ожирение, рак поджелудочной железы, рак предстательной железы и туберкулез. Также он применялся для решения других биомедицинских задач, например, для генетического анализа результатов фармакологических исследований. Основной проблемой является масштабирование МДР для работы с большими данными, такими как данные полногеномных исследований ассоциаций (GWAS). Для этого использовались различные подходы. Один из них – предварительная фильтрация признаков перед проведением МДР-анализа. Это можно сделать, используя биологические знания с помощью инструментов, таких как BioFilter, или вычислительные инструменты, такие как ReliefF. Другой подход заключается в использовании стохастических алгоритмов поиска, например генетического программирования, для исследования пространства комбинаций признаков. Еще один подход – это полный перебор с использованием высокопроизводительных вычислений.

Реализация

www.epistasis.org предоставляет пакет программного обеспечения MDR с открытым исходным кодом и бесплатным доступом. Пакет R для MDR. Python-реализация, совместимая со sklearn. Пакет R для MDR, основанного на моделях. MDR в Weka. Обобщенный MDR.