Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Введение
Рамки математического анализа машинного обучения
Framework for mathematical analysis of machine learning
В теории вычислительного обучения, обучение с вероятностно приближённой точностью (PAC-обучение) представляет собой основу для математического анализа машинного обучения. Оно было предложено в 1984 году Лесли Валиантом. В этой модели обучающийся получает выборки и должен выбрать функцию обобщения (называемую гипотезой) из определённого класса возможных функций. Цель состоит в том, чтобы с высокой вероятностью (соответствующей понятию "вероятно") выбранная функция имела низкую ошибку обобщения (соответствующей понятию "приблизительно правильная"). Обучающийся должен уметь выучить концепцию при любом произвольном коэффициенте аппроксимации, вероятности успеха или распределении выборок. Модель впоследствии была расширена для учёта шума (неправильно классифицированных выборок). Важным новшеством PAC-модели является введение концепций теории вычислительной сложности в машинное обучение. В частности, от обучающегося ожидается нахождение эффективных функций (требования к времени и объёму памяти ограничены полиномом от размера выборки), а сам обучающийся должен реализовать эффективный алгоритм (требующий количества примеров, ограниченного полиномом от размера концепции, скорректированного границами аппроксимации и вероятности).
In computational learning theory, probably approximately correct (PAC) learning is a framework for mathematical analysis of machine learning. It was proposed in 1984 by Leslie Valiant. In this framework, the learner receives samples and must select a generalization function (called the hypothesis) from a certain class of possible functions. The goal is that, with high probability (the "probably" part), the selected function will have low generalization error (the "approximately correct" part). The learner must be able to learn the concept given any arbitrary approximation ratio, probability of success, or distribution of the samples. The model was later extended to treat noise (misclassified samples). An important innovation of the PAC framework is the introduction of computational complexity theory concepts to machine learning. In particular, the learner is expected to find efficient functions (time and space requirements bounded to a polynomial of the example size), and the learner itself must implement an efficient procedure (requiring an example count bounded to a polynomial of the concept size, modified by the approximation and likelihood bounds).
Определения и терминология
Чтобы дать определение тому, что можно изучить в рамках PAC-обучения, мы сначала должны ввести некоторую терминологию. Для следующих определений будут использованы два примера. Первый – это задача распознавания символов, заданная массивом битов, кодирующих изображение, принимающее двоичные значения. Второй пример – задача поиска интервала, который правильно классифицирует точки внутри интервала как положительные, а точки вне интервала – как отрицательные. Пусть – множество, называемое пространством экземпляров или кодировкой всех образцов. В задаче распознавания символов пространство экземпляров равно . В задаче с интервалами пространство экземпляров, , представляет собой множество всех ограниченных интервалов в , где обозначает множество всех действительных чисел. Концепция – это подмножество . Одна концепция – это множество всех шаблонов битов в , кодирующих изображение буквы "P". Примером концепции из второго примера является множество открытых интервалов, , каждый из которых содержит только положительные точки. Класс концепций – это коллекция концепций над . Это может быть множество всех подмножеств массива битов, имеющих скелетизированную 4-связность (ширина шрифта равна 1). Пусть – процедура, которая генерирует пример , используя распределение вероятностей и возвращает правильную метку , то есть 1, если и 0 в противном случае. Теперь, задано , предположим, что существует алгоритм и полином от (и других соответствующих параметров класса) такие, что, получив выборку размера , сформированную согласно , алгоритм с вероятностью не менее выдает гипотезу , имеющую среднюю ошибку не более на с тем же распределением . Более того, если вышеуказанное утверждение для алгоритма верно для каждой концепции и для каждого распределения над , и для всех , то (эффективно) PAC-обучаема (или PAC-обучаема без учета распределения). Мы также можем сказать, что является PAC-алгоритмом обучения для .
In order to give the definition for something that is PAC learnable, we first have to introduce some terminology. For the following definitions, two examples will be used. The first is the problem of character recognition given an array of bits encoding a binary valued image. The other example is the problem of finding an interval that will correctly classify points within the interval as positive and the points outside of the range as negative. Let be a set called the instance space or the encoding of all the samples. In the character recognition problem, the instance space is In the interval problem the instance space, , is the set of all bounded intervals in , where denotes the set of all real numbers. A concept is a subset One concept is the set of all patterns of bits in that encode a picture of the letter "P". An example concept from the second example is the set of open intervals, , each of which contains only the positive points. A concept class is a collection of concepts over This could be the set of all subsets of the array of bits that are skeletonized 4 connected (width of the font is 1). Let be a procedure that draws an example, , using a probability distribution and gives the correct label , that is 1 if and 0 otherwise. Now, given , assume there is an algorithm and a polynomial in (and other relevant parameters of the class ) such that, given a sample of size drawn according to , then, with probability of at least , outputs a hypothesis that has an average error less than or equal to on with the same distribution Further if the above statement for algorithm is true for every concept and for every distribution over , and for all then is (efficiently) PAC learnable (or distribution free PAC learnable). We can also say that is a PAC learning algorithm for .