Кіріспе
Статистикалық модельді үміткер модельдер жиынтығынан таңдау міндеті. Модельді таңдау – бұл әртүрлі үміткерлердің ішінде ең жақсысын таңдау үшін өнімділік критерийі негізінде модельді таңдау міндеті. Машиналық оқыту және жалпы статистикалық талдау контекстінде, бұл берілген деректер негізінде үміткер модельдер жиынтығынан статистикалық модельді таңдау болуы мүмкін. Ең қарапайым жағдайларда, бұрыннан бар деректер жиынтығы қарастырылады. Дегенмен, бұл міндет тәжірибелерді жобалауды да қамти алады, осылай жиналған деректер модельді таңдау мәселесіне жақсы сәйкес келеді. Теңдей болжау немесе түсіндіру күшіне ие үміткер модельдерді қарастыратын болсақ, ең қарапайым модель ең жақсы таңдау болуы мүмкін (Оккамның бритвасы). "Статистикалық қорытындылаудағы көптеген проблемаларды статистикалық модельдеуге қатысты проблемалар деп қарастыруға болады" делінеді. Соған байланысты, "тақырыптық проблемадан статистикалық модельге ауысу қалай жүзеге асырылады, соның өзі талдаудың ең маңызды бөлігі болып табылады" делінген. Модельді таңдау, сондай-ақ, белгісіздік жағдайында шешім қабылдау немесе оңтайландыру мақсатында үлкен есептеу модельдері жиынтығынан бірнеше өкілдік модельдерді таңдау мәселесін де білдіруі мүмкін. Машиналық оқытуда модельді таңдаудың алгоритмдік тәсілдеріне белгілерді таңдау, гиперпараметрлерді оңтайландыру және статистикалық оқыту теориясы жатады.
Model selection is the task of selecting a model from among various candidates on the basis of performance criterion to choose the best one. In the context of machine learning and more generally statistical analysis, this may be the selection of a statistical model from a set of candidate models, given data. In the simplest cases, a pre existing set of data is considered. However, the task can also involve the design of experiments such that the data collected is well suited to the problem of model selection. Given candidate models of similar predictive or explanatory power, the simplest model is most likely to be the best choice (Occam's razor). state, "The majority of the problems in statistical inference can be considered to be problems related to statistical modeling". Relatedly, has said, "How [the] translation from subject matter problem to statistical model is done is often the most critical part of an analysis". Model selection may also refer to the problem of selecting a few representative models from a large set of computational models for the purpose of decision making or optimization under uncertainty. In machine learning, algorithmic approaches to model selection include feature selection, hyperparameter optimization, and statistical learning theory.
Кіріспе
Модельді таңдаудың ең қарапайым түрінде, ол ғылыми зерттеудің негізгі міндеттерінің бірі болып табылады. Байқаулар тізбегін түсіндіретін қағиданы анықтау жиі сол байқауларды болжайтын математикалық модельмен тікелей байланысты. Мысалы, Галилей еңіс жазықтықтағы тәжірибелерін жүргізген кезде, шарлардың қозғалысы оның моделі болжаған параболаға сәйкес келетінін көрсетті. Деректерді тудыруға болатын мүмкін болатын көптеген механизмдер мен процестердің ішінде ең жақсы модельді қалай таңдауға болады? Математикалық тәсіл әдетте кандидат модельдер жиынтығынан шешім шығарады; бұл жиынтықты зерттеуші таңдауы керек. Көбінесе полиномдар сияқты қарапайым модельдер қолданылады, кемінде бастапқыда. Олар өздерінің кітаптарында деректердің негізіндегі феноменологиялық процестер немесе механизмдерді (мысалы, химиялық реакциялар) түсіну сияқты ғылыми принциптерге негізделген модельдерді таңдаудың маңыздылығын баса көрсетеді. Кандидат модельдер жиынтығы таңдалғаннан кейін, статистикалық талдау осы модельдердің ішіндегі ең жақсысын таңдауға мүмкіндік береді. «Ең жақсы» дегеніміздің мағынасы даулы. Жақсы модельді таңдау әдісі, сәйкестіктің жақсылығын қарапайымдықпен теңестіреді. Күрделірек модельдер деректерге сәйкес пішінін жақсырақ бейімдей алады (мысалы, бесінші дәрежелі полином алты нүкеге дәл сәйкес келуі мүмкін), бірақ қосымша параметрлер ештеңе пайдалыны білдірмеуі мүмкін. (Мүмкін, бұл алты нүке тура сызық бойында кездейсоқ таратылған шығар.) Сәйкестіктің жақсылығы әдетте ықтималдық қатынасы тәсілін немесе оған жуықтау арқылы, нәтижесінде хи-квадрат тестіне әкелетін тәсілді қолдану арқылы анықталады. Күрделілік әдетте модельдегі параметрлердің санын санау арқылы өлшенеді. Модельді таңдау әдістерін белгілі бір физикалық шаманың бағалаушысы ретінде қарастыруға болады, мысалы, берілген деректерді тудыратын модельдің ықтималдығы. Бұрмалану және дисперсия осы бағалаушының сапасының маңызды өлшемдері болып табылады; тиімділік те көбінесе қарастырылады. Модельді таңдаудың стандартты мысалы - қисықтарды сәйкестендіру, онда нүктелер жиынтығы және басқа да қосымша білімдер берілген (мысалы, нүктелер тәуелсіз және бірдей таратылған үлгілердің нәтижесі), біз нүктелерді тудырған функцияны сипаттайтын қисықты таңдауымыз керек.
Of the countless number of possible mechanisms and processes that could have produced the data, how can one even begin to choose the best model? The mathematical approach commonly taken decides among a set of candidate models; this set must be chosen by the researcher. Often simple models such as polynomials are used, at least initially emphasize throughout their book the importance of choosing models based on sound scientific principles, such as understanding of the phenomenological processes or mechanisms (e. g., chemical reactions) underlying the data. Once the set of candidate models has been chosen, the statistical analysis allows us to select the best of these models. What is meant by best is controversial. A good model selection technique will balance goodness of fit with simplicity. More complex models will be better able to adapt their shape to fit the data (for example, a fifth order polynomial can exactly fit six points), but the additional parameters may not represent anything useful. (Perhaps those six points are really just randomly distributed about a straight line.) Goodness of fit is generally determined using a likelihood ratio approach, or an approximation of this, leading to a chi squared test. The complexity is generally measured by counting the number of parameters in the model. Model selection techniques can be considered as estimators of some physical quantity, such as the probability of the model producing the given data. The bias and variance are both important measures of the quality of this estimator; efficiency is also often considered. A standard example of model selection is that of curve fitting, where, given a set of points and other background knowledge (e. g. points are a result of i. i. d. samples), we must select a curve that describes the function that generated the points.
Үлгі таңдаудың екі бағыты
Деректерден есептеу және үйренудің екі негізгі мақсаты бар. Бірі – ғылыми жаңалықтар ашу, сонымен қатар статистикалық қорытынды деп аталатын деректерді тудыратын механизмді түсіну және деректердің мәнін түсіндіру. Деректерден білім алудың тағы бір мақсаты – болашақ немесе көрінбеген деректерді болжау, бұл статистикалық болжам деп те аталады. Екінші мақсатта деректерді зерттеуші деректердің дәл ықтималдық сипаттамасына қатысуға міндетті емес. Әрине, екі бағытқа да қызығушылық таныту мүмкін. Екі түрлі мақсатқа сәйкес модельді таңдаудың да екі бағыты болуы мүмкін: қорытынды үшін модельді таңдау және болжам үшін модельді таңдау. Бірінші бағыт – деректерге ең жақсы модельді анықтау, ол ғылыми түсіндіру үшін белгісіздік көздерін сенімді түрде сипаттауға мүмкіндік береді. Осы мақсат үшін таңдалған модельдің үлгі көлеміне тым сезімтал болмауы өте маңызды. Сәйкесінше, модельді таңдауды бағалау үшін тиісті ұғым – таңдаудың тұрақтылығы, яғни жеткілікті көп деректер үлгісі болғанда ең сенімді үміткер тұрақты түрде таңдалады. Екінші бағыт – модельді тамаша болжамдық нәтижелер беруге қабілетті құрал ретінде таңдау. Алайда, соңғы жағдайда таңдалған модель бірнеше жақын бәсекелестердің арасында жай ғана сәтті жеңімпаз болуы мүмкін, бірақ болжамдық нәтижелер бәрібір мүмкіндігінше жақсы болуы мүмкін. Егер осылай болса, модельді таңдау екінші мақсат үшін (болжам) жарамды, бірақ таңдалған модельді түсінік пен интерпретация үшін пайдалану өте сенімсіз және қате жолға салуы мүмкін.