Кіріспе

Машиналық оқытудағы парадигма Бақылаулы оқыту (СУ) – машиналық оқытудағы парадигма, онда кіріс объектілері (мысалы, болжаушы айнымалылардың векторы) және күтілетін шығыс мәні (адаммен белгіленген қадағалау сигналы деп те аталады) модельді оқытуға қолданылады. Оқу деректері өңделіп, жаңа деректерді күтілетін шығыс мәндерімен байланыстыратын функция құрылады. Оптималды жағдайда алгоритм жаңа деректер үшін шығыс мәндерін дұрыс анықтай алады. Бұл оқыту алгоритмінің оқу деректерінен белгісіз жағдайларға «әділ» түрде жалпылауын қажет етеді (индуктивті бейімділікке қараңыз). Алгоритмнің статистикалық қасиеттері жалпылау қатесі арқылы өлшенеді.

Көлденеңдік-варианстық тепе-теңдік

Бірінші мәселе – қатенділік пен дисперсия арасындағы айырбас. Бізде бірнеше түрлі, бірақ бірдей сапалы оқу деректер жиынтығы бар деп ойлап көріңіз. Егер оқу алгоритмі осы дерек жиынтықтарының әрқайсысымен оқытылғанда дұрыс нәтижені болжауда жүйелі түрде қателік жіберсе, онда ол белгілі бір кіріс үшін қатенділікке бейім. Егер оқу алгоритмі әртүрлі оқу жиынтықтарында оқытылғанда әртүрлі нәтижелерді болжаса, онда ол белгілі бір кіріс үшін жоғары дисперсияға ие. Оқытылған жіктегіштің болжау қатесі оқу алгоритмінің қатенділігі мен дисперсиясының қосындысына байланысты. Әдетте, қатенділік пен дисперсия арасында кері байланыс болады. Төмен қатенділікке ие оқу алгоритмі деректерге жақсы сәйкес келу үшін «икемді» болуы керек. Бірақ егер оқу алгоритмі тым икемді болса, ол әрбір оқу деректер жиынтығына әртүрлі сәйкес келеді, демек жоғары дисперсияға ие болады. Көптеген бақыланатын оқыту әдістерінің маңызды ерекшелігі – олар осы қатенділік пен дисперсия арасындағы айырбасты реттей алады (автоматты түрде немесе пайдаланушы реттей алатын қатенділік/дисперсия параметрін ұсына отырып).

Функцияның күрделілігі және оқу деректерінің көлемі

Екінші мәселе – "нағыз" функцияның (классификатор немесе регрессиялық функция) күрделілігіне қатысты қолжетімді оқу деректерінің мөлшері. Егер нағыз функция қарапайым болса, онда жоғары қатаңдығы және төмен дисперсиясы бар "икемсіз" оқу алгоритмі оны аз дерек көлемінен үйрене алады. Бірақ егер нағыз функция өте күрделі болса (мысалы, көптеген кіріс факторларының күрделі өзара әрекеттесуін қамтиды және кіріс кеңістігінің әртүрлі бөліктерінде әртүрліше танысады), онда функция тек көп мөлшердегі оқу деректерімен және төмен қатаңдықпен, бірақ жоғары дисперсиясы бар "икемді" оқу алгоритмімен үйренуге қабілетті болады.

Кіріс кеңістігінің өлшемдері

Үшінші мәселе – кіріс кеңістігінің өлшемділігі. Егер кіріс деректер векторларының өлшемдері жоғары болса, функцияны оқыту қиын болуы мүмкін, тіпті нақты функция осы өлшемдердің аз ғана санына тәуелді болса да. Себебі, көптеген "артық" өлшемдер оқу алгоритмін жаңылыстырып, оның жоғары дисперсиясына (немесе ауытқушылығына) алып келуі мүмкін. Сондықтан, жоғары өлшемді кіріс деректеріне классификаторды төмен дисперсияға және жоғары қиылысқа (бейімділікке) ие етуді қажет етеді. Іс жүзінде, егер инженер кіріс деректерінен қажетсіз белгілерді қолмен жоя алса, оқытылған функцияның дәлдігі артады. Сонымен қатар, маңызды белгілерді анықтап, қажетсіздерін жоюға бағытталған белгілерді таңдау алгоритмдері көп. Бұл – өлшемді азайтудың жалпы стратегиясының бір мысалы, ол кіріс деректерін бақыланатын оқыту алгоритмін қолдану алдында төмен өлшемді кеңістікке бейімдеуге тырысады.

Шығыс мәндеріндегі шу

Төртінші мәселе – қажетті шығыс мәндеріндегі шу деңгейі (бақылау мақсатты айнымалылары). Егер қажетті шығыс мәндері жиі қате болса (адам қателігі немесе сенсор қателігі салдарынан), онда оқу алгоритмі оқу үлгілеріне нақты сәйкес келетін функцияны табуға тырыспауы керек. Деректерді тым мұқият бейімдеуге тырысу артық бейімдеуге (overfitting) алып келеді. Өлшеу қателігі (стохастикалық шу) болмаса да, егер сіз оқуға тырысатын функция сіздің оқу моделіңіз үшін тым күрделі болса, артық бейімдеу болуы мүмкін. Мұндай жағдайда, мақсатты функцияның модельдеуге келмейтін бөлігі сіздің оқу деректеріңізді «бұрмалайды». Бұл құбылыс детерминистік шу деп аталады. Шудың кез келген түрі болғанда, жоғары қиылысқа (bias) және төмен дисперсияға (variance) ие бағалаушыны қолдану жақсы. Іс жүзінде, шығыс мәндеріндегі шуды азайту үшін бірнеше тәсіл бар, мысалы, артық бейімдеуді болдырмау үшін ерте тоқтату, сондай-ақ бақыланатын оқыту алгоритмін оқыту алдында шулы оқу үлгілерін анықтап жою. Шулы оқу үлгілерін анықтайтын бірнеше алгоритм бар және күдікті шулы оқу үлгілерін оқытудан бұрын жою статистикалық тұрғыдан маңызды жалпылау қатесін азайтады.

Бақылаумен оқытатын алгоритмдер қалай жұмыс істейді

Т-інші мысалдың белгі векторы және оның белгісі (яғни, классы) болып табылатын оқыту мысалдары жиынтығын ескере отырып, оқу алгоритмі функцияны іздейді , онда кіріс кеңістігі және шығыс кеңістігі болып табылады. Функция – мүмкін функциялар кеңістігінің элементі, әдетте гипотеза кеңістігі деп аталады. Кейде ең жоғары балл беретін мәнді қайтаратын балл функциясын пайдалану ыңғайлы: балл функцияларының кеңістігін білдіреді. және функциялардың кез келген кеңістігі болуы мүмкін, бірақ көптеген оқу алгоритмдері ықтималдық модельдер болып табылады, олар шартты ықтималдық модельі түрін немесе бірлескен ықтималдық модельі түрін қабылдайды. Мысалы, наив Байес және сызықтық дискриминантты талдау – бірлескен ықтималдық модельдері, ал логистикалық регрессия – шартты ықтималдық моделі. функцияны немесе таңдаудың екі негізгі тәсілі бар: эмпирикалық тәуекелді азайту және құрылымдық тәуекелді азайту. Эмпирикалық тәуекелді азайту оқу деректеріне ең жақсы сәйкес келетін функцияны іздейді. Құрылымдық тәуекелді азайтуда бейімділік/дисперсия арақатынасын реттеу үшін айыппұл функциясы қолданылады. Екі жағдайда да, оқу жиынтығы тәуелсіз және бірдей таралымды жұптардың үлгісінен тұрады деп есептеледі. Функцияның оқу деректеріне қаншалықты сәйкес келетінін өлшеу үшін жоғалту функциясы анықталады. Оқу мысалы үшін, мәнін болжаудың жоғалтуы келесідей:
Функцияның тәуекелі функцияның күтілетін жоғалтуы ретінде анықталады. Бұл оқу деректерінен келесідей бағалануы мүмкін:
.

Тәжірибелік тәуекелді азайту

Эмпирикалық тәуекелді азайтуда бақыланатын оқу алгоритмі ең төменгі мәнді қамтамасыз ететін функцияны іздейді. Сондықтан, бақыланатын оқу алгоритмін оптимизациялау алгоритмін қолдану арқылы құрастыруға болады. Егер шартты ықтималдық үлестірімі болса және жоғалту функциясы теріс логарифмдік ықтималдыққа тең болса: , онда эмпирикалық тәуекелді азайту максималды ықтималдық бағалауға балама болады. Егер көптеген мүмкін функцияларды қамтыса немесе оқу жиынтығы жеткілікті үлкен болмаса, эмпирикалық тәуекелді азайту жоғары дисперсияға және нашар жалпылауға алып келеді. Оқу алгоритмі жаттығу мысалдарындарын жақсы жалпыламастан жаттай алады. Бұл артық үйлесімділік деп аталады.

Өнеркәсіптік оқыту

Жоғарыда сипатталған оқыту әдістері дискриминациялық оқыту әдістері болып табылады, себебі олар әртүрлі нәтижелік мәндерді жақсы ажырататын функцияны табуға ұмтылады (дискриминациялық модельді қараңыз). Егер бірлескен ықтималдық таралымы және шығын функциясы теріс логарифмдік ықтималдыққа тең болса, онда тәуекелді азайту алгоритмі генеративтік оқытуды жүзеге асырады, өйткені оны деректердің қалай туындағанын түсіндіретін генеративтік модель ретінде қарастыруға болады. Генеративтік оқыту алгоритмдері көбінесе дискриминациялық оқыту алгоритмдерінен қарапайым және есептеу тұрғысынан тиімді болады. Кейбір жағдайларда, шешімді жабық түрде есептеуге болады, мысалы, наив Байес және сызықтық дискриминантты талдауда.