Машинное обучение
-
Парадигмы машинного обучения: смещение и дисперсия.
Обучение с учителем в машинном обучении: суть, принцип работы, обобщение данных и оценка ошибки обобщения. Построение моделей по размеченным данным.
-
Векторное квантование: классический метод обработки сигналов
Векторная квантизация (VQ): классический метод обработки сигналов для сжатия данных и моделирования распределений. Основана на прототипах векторов и кластеризации.
-
Наивный байесовский классификатор: принципы и применение.
Алгоритм наивного Байеса: простой и масштабируемый классификатор, основанный на теореме Байеса и предположении независимости признаков. Статистика, машинное обучение.
-
Бустинг в машинном обучении: от слабых к сильным алгоритмам.
Бустинг в машинном обучении: ансамблевый метод для снижения смещения и дисперсии. Преобразование слабых алгоритмов в сильные. Обучение с учителем.
-
Алгоритм обучения перцептрона для бинарной классификации
Персептрон: алгоритм обучения бинарных классификаторов в машинном обучении. Линейный классификатор, основанный на весах и векторах признаков. Теория информации.
-
Индуктивные предпосылки в машинном обучении
Индуктивный уклон в машинном обучении: предположения алгоритмов для предсказаний на новых данных. Выбор паттернов обучения и поиск оптимальных решений.
-
Ранняя остановка в машинном обучении: предотвращение переобучения
Ранняя остановка в машинном обучении: метод регуляризации для предотвращения переобучения при итеративной тренировке моделей (градиентный спуск).
-
Размерность Вапника-Червоненкиса в машинном обучении с учителем.
Размерность VC в машинном обучении: определение, свойства и значение для оценки сложности модели. Теория Vapnik–Chervonenkis и "разрушение" данных.
-
Методы нелинейного понижения размерности данных
Нелинейное понижение размерности: обзор алгоритмов для визуализации и анализа данных. Манифолд-обучение, PCA, SVD – упрощение сложных данных.
-
Принцип минимальной длины описания
Принцип минимальной длины описания (MDL): выбор модели по кратчайшему описанию данных. Информационная теория, машинное обучение, сжатие данных.
-
Истинные данные: сбор и применение в различных областях.
Истина в данных: что такое "ground truth"? Определение, примеры из практики и роль в статистических моделях. Прямые наблюдения vs. выводы.
-
Математический анализ машинного обучения: Framework PAC-обучения
PAC-обучение: математический анализ машинного обучения. Фреймворк Лесли Валента для оценки вероятности и точности обобщения гипотез на данных.
-
Рамки анализа алгоритмов машинного обучения
Теория алгоритмического обучения: математический анализ алгоритмов машинного обучения без статистических предположений. Основы и отличия от статистической теории.
-
Теория вычислительного обучения
Теория машинного обучения: изучение алгоритмов ИИ, проектирование и анализ. Обзор основных концепций и библиография по computational learning theory.
-
Итеративный метод максимального правдоподобия: алгоритм EM
Алгоритм EM: итеративный метод поиска максимального правдоподобия в статистических моделях с латентными переменными. Применение: смеси Гаусса, регрессия.
-
Линейная разделимость множеств точек в евклидовом пространстве.
Линейная разделимость в геометрии: определение, свойства и применение. Разделение точек на плоскости гиперплоскостью. Важно для машинного обучения и анализа данных.
-
Снижение размерности в физике: методы и применение
Уменьшение размерности данных в физике: методы снижения числа переменных для упрощения анализа, визуализации и снижения вычислительной сложности.
-
Кластерный анализ: методы и применение
Кластерный анализ: группировка объектов по схожести. Методы, алгоритмы и применение в анализе данных, машинном обучении и других областях.
-
Алгоритм Баума — Велша для скрытых марковских моделей
Алгоритм Баума-Велча: вычисление параметров скрытых марковских моделей (HMM) в математике, инженерии и биоинформатике. Основан на алгоритме EM.
-
Векторная квантизация обучением: алгоритм классификации и прототипы
Векторная квантизация (LVQ): алгоритм классификации, разработанный Теуво Кохоненом. Основан на обучении Хебба и является предшественником SOM и k-NN.
-
Мягкое моделирование независимых классов по аналогии (SIMCA) для классификации данных
Метод SIMCA: статистическая классификация данных, основанная на PCA. Определение принадлежности к классам с учетом вероятностей, а не жесткой категоризации.
-
Матрица ошибок: визуализация и анализ производительности алгоритмов машинного обучения
Матрица ошибок (спутанных понятий) в машинном обучении: визуализация производительности алгоритмов классификации. Анализ точности и выявление ошибок.
-
Парадигма обучения на основе правил: Системы классификаторов
Системы обучения классификаторов (LCS): машинное обучение на основе правил, генетические алгоритмы, адаптивные системы, ИИ. Применение в моделировании и анализе данных.
-
Многозадачное обучение в машинном обучении
Многозадачное обучение (MTL) в машинном обучении: одновременное решение задач для повышения эффективности и точности моделей. Общий подход к переносу знаний.
-
Меры сходства объектов и их применение в анализе данных
Меры сходства: определение, применение в статистике, машинном обучении и информационном поиске. Косинусное сходство, kernel-функции и другие метрики.
-
Метод случайного согласования выборок (RANSAC) для оценки параметров модели при наличии выбросов.
RANSAC: робастный метод оценки параметров модели при наличии выбросов. Итеративный алгоритм для обнаружения и исключения аномалий в данных.
-
Генеративные топографические карты: метод машинного обучения
Генеративная топографическая карта (GTM): метод машинного обучения, вероятностный аналог SOM. Обучение без сжатия окрестности, EM-алгоритм.
-
Выбор признаков в машинном обучении и статистике
Выбор признаков в машинном обучении: методы отбора релевантных переменных для упрощения моделей, повышения скорости обучения и избежания "проклятия размерности".
-
Генеративные модели в статистической классификации
Генеративные и дискриминативные модели в статистической классификации: Naive Bayes, LDA, логистическая регрессия. Обучение, вероятности, классификация данных.
-
Признаки в машинном обучении: типы и применение.
Признаки в машинном обучении: что это такое? Выбор информативных признаков – ключ к эффективным алгоритмам классификации, регрессии и распознавания образов.
-
Бернхард Шёлкопф: Пионер машинного обучения и причинно-следственного вывода.
Бернхард Шёлкопф – немецкий ученый в области машинного обучения, эксперт в методах ядра и причинности. Директор института Max Planck, профессор ETH Zürich.
-
Смешение контекстов: алгоритмы и применение в сжатии данных.
Смешение контекстов: алгоритм сжатия данных, объединяющий прогнозы моделей для повышения точности. Используется в машинном обучении и PAQ.
-
Задачи машинного обучения: обучение, валидация и тестирование моделей.
Машинное обучение: задачи, алгоритмы и построение моделей на данных. Обучение, валидация и тестирование – ключевые этапы создания точных прогнозов.
-
Категоризация данных и методы классификации в статистике.
Классификация данных в статистике: определение категорий, анализ признаков (спам-фильтры, диагностика). Методы: сравнение, количественные свойства.
-
Алгоритм классификации на основе AdaBoost
AdaBoost: алгоритм машинного обучения для классификации. Объединяет "слабые" алгоритмы, повышая точность прогнозов. Подробное описание и применение.
-
Алгоритм k ближайших соседей: непараметрический метод классификации и регрессии.
k-ближайших соседей (k NN): непараметрический метод классификации и регрессии. Обучение без этапа тренировки, взвешивание соседей по расстоянию.
-
Квадратичный классификатор в статистике
Квадратичный классификатор в статистике: определение, принцип работы и отличие от линейного. Обучение на основе тренировочных данных для определения класса объекта.
-
Метод совместного кластеризации строк и столбцов матрицы: обзор техник бикластеризации
Бикластеризация: метод интеллектуального анализа данных для одновременной кластеризации строк и столбцов матрицы. Поиск схожих паттернов в данных.
-
Алгоритм ID3 для построения деревьев решений
Алгоритм ID3: построение дерева решений в машинном обучении. Расчет энтропии, выбор признаков для разбиения, максимальный прирост информации.
-
Регуляризация в машинном обучении: обобщение и предотвращение переобучения.
Регуляризация в машинном обучении: методы повышения обобщающей способности моделей и предотвращения переобучения. Явные методы и оптимизация задач.
-
Индекс Жаккара: мера сходства и различия множеств
Индекс Жаккара: мера сходства и различия между множествами. История, формула и применение в метеорологии и анализе данных. Коэффициент сообщества.
-
Medoid
-
Оценка обобщающей способности алгоритмов машинного обучения
Ошибка обобщения в машинном обучении: оценка точности алгоритмов на новых данных, избежание переобучения и использование кривых обучения.
-
Информационный прирост: получение выгоды от наблюдения другой переменной.
Информационный прирост: определение, применение в машинном обучении и теории информации. Kullback–Leibler divergence, взаимная информация, деревья решений.
-
Границы принятия решений в задачах классификации
Границы принятия решений в машинном обучении: что это такое, как работают и когда они размыты. Объяснение гиперповерхностей и линейной классификации.
-
Projection pursuit
-
Классификация и методы бинарной и мультиклассовой классификации
Классификация данных: Байесовский классификатор, бинарная классификация, правила классификации, признаки и объекты. Оптимальное предсказание классов.
-
Многофакторное понижение размерности: методы, применение и интерпретация.
Метод снижения размерности MDR: выявление неаддитивных взаимодействий признаков для бинарной классификации. Альтернатива логистической регрессии в машинном обучении.
-
Теория вычислительного обучения: понятия и классы концепций
Теория вычислительного обучения: понятия, классы понятий и их роль в математике и машинном обучении. PAC-обучение и модели классификации.
-
Метод ядер в машинном обучении: анализ закономерностей и "ядерный трюк"
Метод машинного обучения: Kernel Machines (SVM). Анализ данных, нелинейные задачи, кластеризация, классификация. Обучение без явного преобразования признаков.
-
Выбор статистической модели: методы и принципы.
Выбор статистической модели: критерии, методы и важность простоты (бритва Оккама). Оптимизация моделей машинного обучения и статистического анализа.
-
Многомерная статистическая классификация в маркетинге: методы и применение
Геодемографическая сегментация в маркетинге: многомерный статистический анализ для выявления групп потребителей. K-means и другие алгоритмы.
-
Условные случайные поля: методы статистического моделирования и современные подходы.
Условные случайные поля (CRF): методы статистического моделирования для машинного обучения и распознавания образов. Учитывают контекст, повышая точность прогнозов.
-
Джон Росс Куинлан: Пионер алгоритмов машинного обучения и деревьев решений
Джон Росс Куинлан: учёный в области data mining и теории принятия решений. Разработчик алгоритмов C4.5, ID3, FOIL. Основатель RuleQuest Research.