Введение

Одновременное решение нескольких задач машинного обучения. Многозадачное обучение (MTL) — это подраздел машинного обучения, в котором несколько задач обучения решаются одновременно, используя общие черты и различия между задачами. Это может привести к повышению эффективности обучения и точности прогнозирования для моделей, специфичных для каждой задачи, по сравнению с обучением моделей по отдельности. Ранние версии MTL назывались «подсказками». В широко цитируемой статье 1997 года Рич Каруана дал следующую характеристику: «Многозадачное обучение — это подход к индуктивному переносу, который улучшает обобщающую способность, используя информацию о предметной области, содержащуюся в обучающих сигналах связанных задач, в качестве индуктивного смещения. Это достигается путем одновременного обучения задачам с использованием общего представления; то, что изучается для каждой задачи, может помочь другим задачам быть изученными лучше. Многозадачное обучение работает, потому что регуляризация, вызванная требованием к алгоритму хорошо выполнять связанную задачу, может быть эффективнее регуляризации, которая предотвращает переобучение, равномерно штрафуя всю сложность. Многозадачное обучение может быть особенно полезным, когда задачи имеют значительные общие черты и, как правило, недостаточно представлены в обучающей выборке».

Методы

Ключевая задача в многозадачном обучении состоит в том, как объединить сигналы обучения из нескольких задач в единую модель. Это может сильно зависеть от степени согласованности или противоречия между различными задачами. Существует несколько подходов к решению этой задачи:

Группировка задач и их перекрытие

В парадигме многозадачного обучения (MTL) информация может передаваться между некоторыми или всеми задачами. В зависимости от структуры взаимосвязи задач, может потребоваться выборочный обмен информацией между ними. Например, задачи могут быть сгруппированы, существовать в иерархии или быть связаны в соответствии с некоторой общей метрикой. Предположим, как будет формализовано ниже, что вектор параметров, моделирующий каждую задачу, является линейной комбинацией некоторого базового набора. Сходство с точки зрения этого набора может указывать на взаимосвязь задач. Например, при разреженности, перекрытие ненулевых коэффициентов между задачами указывает на общие признаки. Группировка задач соответствует задачам, лежащим в подпространстве, порожденном подмножеством базовых элементов, при этом задачи в разных группах могут быть непересекающимися или произвольно пересекаться с точки зрения их баз. Взаимосвязь задач может быть задана априори или изучена на основе данных. Иерархическую взаимосвязь задач также можно использовать неявно, без предположений об априорных знаниях или явного обучения связям. Например, можно явно изучать релевантность примеров для разных задач, чтобы гарантировать эффективность совместного обучения в нескольких областях. Классификатор объектов на основе изображений может разрабатывать устойчивые представления, которые могут быть полезны для дальнейшего обучения алгоритмов, решающих связанные задачи. Например, предварительно обученную модель можно использовать в качестве экстрактора признаков для предварительной обработки данных для другого алгоритма обучения. Или предварительно обученную модель можно использовать для инициализации модели с аналогичной архитектурой, которая затем дообучается для решения другой задачи классификации.

Многократные нестационарные задачи

Традиционно многозадачное обучение и передача знаний применяются в стационарных условиях обучения. Распространение этих методов на нестационарные среды называется групповым адаптивным онлайн-обучением (GOAL). Обмен информацией может быть особенно полезен, когда обучающиеся работают в постоянно меняющихся условиях, поскольку один обучающийся может извлечь выгоду из предыдущего опыта другого, чтобы быстрее адаптироваться к новой среде. Такое групповое адаптивное обучение имеет множество применений, от прогнозирования финансовых временных рядов и систем рекомендаций контента до визуального понимания для адаптивных автономных агентов.

Оптимизация многозадачности

Оптимизация многозадачности: в некоторых случаях одновременное обучение, казалось бы, связанных задач может снижать производительность по сравнению с моделями, обученными на одной задаче. Как правило, в моделях многозадачного обучения (MTL) используются модули, специфичные для каждой задачи, поверх совместного представления признаков, полученного с помощью общего модуля. Поскольку это совместное представление должно захватывать полезные признаки для всех задач, MTL может ухудшать производительность отдельных задач, если эти задачи требуют противоречивых представлений, то есть градиенты разных задач указывают в противоположные направления или значительно различаются по величине. Это явление обычно называют негативным переносом. Для смягчения этой проблемы предложено множество методов оптимизации MTL. Обычно градиенты для каждой задачи объединяются в единое направление обновления с использованием различных алгоритмов агрегации или эвристик. Эти методы включают вычитание проекции конфликтующих градиентов, применение методов теории игр и использование байесовского моделирования для получения распределения градиентов.

Воспроизведение гильбертового пространства векторных функций (RKHSvv)

Проблема MTL может быть сформулирована в контексте RKHSvv (полное внутреннее пространство произведений векторно-значных функций, оснащенное воспроизводящим ядром). В частности, в последнее время основное внимание уделяется случаям, когда структуру задач можно определить с помощью разделяемого ядра, описанного ниже. Данное изложение основано на работе Ciliberto et al., 2015, в которой предлагается задать F как норму Фробениуса. Они оптимизировали напрямую, используя метод блочного спуска по координатам, не учитывая трудности на границе. В обучении кластеризованных задач Jacob et al. предложили изучать A в условиях, когда T задач организованы в R непересекающихся кластеров. В этом случае пусть будет матрицей с Setting, и , то матрица задач может быть параметризована как функция от : , с членами, штрафующими среднее значение, дисперсию между кластерами и дисперсию внутри кластеров предсказаний задач соответственно. M не является выпуклой, но существует выпуклая релаксация в данной формулировке, .

Обобщения

Невыпуклые штрафы. Штрафы могут быть построены таким образом, чтобы матрица A была ограничена структурой графа Лапласа или имела низкоранговую факторизацию. Однако эти штрафы не являются выпуклыми, и анализ барьерного метода, предложенного Ciliberto et al., неприменим в этих случаях. Неразделимые ядра. Разделимые ядра ограничены, в частности, они не учитывают структуры во взаимодействии между входными и выходными доменами в совокупности. Требуются дальнейшие исследования для разработки моделей для этих ядер.

Пакет программного обеспечения

Пакет MATLAB под названием Multi Task Learning via StructurAl Regularization (MALSAR) реализует следующие алгоритмы многозадачного обучения: многозадачное обучение с усредненной регуляризацией, многозадачное обучение с совместным отбором признаков, устойчивое многозадачное обучение признакам, многозадачное обучение с регуляризацией по норме следа, чередующаяся структурная оптимизация, некогерентное обучение с низким рангом и разреженностью, устойчивое многозадачное обучение с низким рангом, кластерное многозадачное обучение, многозадачное обучение с использованием графовых структур.